Treci la conținut

Metodologie · versiunea 0.1.0

Regulile vin înaintea rezultatelor.

Un protocol de tip preregistrare pentru a face ca rezultatele favorabile și nefavorabile să fie la fel de inspectabile. Versiunea actuală este încă un pilot; aceste reguli definesc poarta pentru un reper viitor.

01 · Definiția sistemului

Un nume de produs nu este o condiție de test.

Fiecare sistem este un tuplu: versiunea publică a produsului, versiunea sistemului de operare, revizia motorului sau modelului, setări care afectează recunoașterea și curățarea, clasa dispozitivului și calea de capturare. Rezultatele provenind din tupluri diferite nu sunt niciodată combinate în mod silențios.

Dacă un produs nu poate accepta aceeași cale audio, acesta este raportat într-un strat separat. Captarea microfonului în direct nu este prezentată ca fiind comparabilă direct cu redarea unui fișier.

Matricea de dispozitive propusă pentru prima versiune completă de benchmark.
PlatformăClasa de bazăClasa curentăScop
macOSIntrare Apple SiliconActual Apple SiliconGama de desktop local
WindowsLaptop x86 mainstreamLaptop de performanță curentVariația CPU și GPU
AndroidDispozitive medii acceptateProdus emblematic curentVarianță mobilă
02 · Trei faze

Reproductibilitatea în laborator, apoi realitatea pe dispozitivul real.

Faza A

Corpus reproductibil

Discurs public licențiat și scripturi consimțite, folosind aceleași fragmente audio acolo unde este suportat pentru a izola recunoașterea și post-procesarea.

Faza B

Captură de pe dispozitiv real

Redare calibrată prin camere și microfoane documentate pentru a evidenția comportamentul de reducere a zgomotului, pre-roll, poartă de tăcere și flush de coadă.

Faza C

Dictare naturală

Vorbitori nou-consimțiți citind mesaje preînregistrate. Capturile de suport private nu sunt promovate niciodată în corpusul public.

În toate fazele

Straturi vizibile

Limbaj, varietate regională, durată, zgomot, condiții ale încăperii, nume, numere, termeni tehnici, pauze și corecturi verbale.

03 · Metrici principali

WER este începutul, nu întreaga poveste.

Word rata de eroare este calculată ca substituții plus inserții plus ștergeri, împărțite la cuvintele de referință. De asemenea, studiul raportează fiecare operație separat, deoarece o singură transcriere fluentă poate ascunde o frază lipsă.

Ratele agregate sunt micro-word-weighted: numărul de operații și cuvintele de referință sunt însumate înainte ca rata să fie calculată. Latența publică numărul de mostre, mediana, p95 și maxim. Pilotul finalizat are stare termică mixtă; alergările controlate la rece și la cald și livrarea live UI rămân măsurători viitoare.

Timpul de procesare include recunoașterea, finalizarea conductei și curățarea locală atunci când este activată. Exclude construcția inițială a timpului de rulare, încărcarea dispozitivului, înregistrarea live, trimiterea comenzilor rapide și inserarea cursorului. Toate benzile au punctat rezultatul final al evaluatorului; benzile de curățare pot aplica în continuare modificări de vocabular și formatare.

Latența utilizează 60 de eșantioane de decodificare egal ponderate pe bandă și cuantile liniare R-7. Cele 20 de meciuri conțin 491 de poziții de cuvinte de referință per trecere, numărate de trei ori la numitorul de 1.473 de cuvinte. Repetările nu sunt enunțuri independente. Eșecurile de prag de calitate rămân incluse: 3 cu Core ML curățare activată, 3 cu Core ML curățare dezactivată și 6 cu Whisper.

Interpretarea corectată 6 septembrie 2026. Număr original neschimbat. Citiți auditul probelor, referințele externe, limitările rămase și instrucțiunile de reproducere.

Observație în rețea

Protocolul înregistrează dacă un flux de lucru se finalizează offline după configurare, destinațiile și octeții observați și dacă au fost observate încărcări audio sau text părăsind dispozitivul. Captura de pachete are puncte oarbe, așa că declarația defensabilă este „nu a fost observată nicio încărcare audio/text în acest test.” Nu afirmați niciodată „nimic nu părăsește vreodată dispozitivul.”

04 · Porți de publicare

Fără clasament până când toate porțile nu sunt trecute.

Metodă înghețată primaVersiunea și commit-ul de analiză înregistrate înainte de colectarea referinței.
Corpus fixatRevizii imuabile și digesturi SHA-256 pentru fiecare fișier sursă și emis.
Referințe revizuiteRecenzie de referință pentru două persoane și o politică de normalizare pentru fiecare sistem.
Intrări comparabileAceiași octeți sau un strat de captură explicit, raportat separat.
Proveniență completăProdus, model, dispozitiv, setări, stare de alimentare și cale de captură înregistrate.
Eșecurile păstrateTimeout-urile și transcrierile lipsă rămân în numitor.
Operațiuni reconciliateSubstituțiile, inserțiile și ștergerile se adună pentru a obține distanța de editare.
Revizuire a confidențialitățiiTreceri de sanitizare și un om inspectează limita artefactului public.
Conflict dezvăluitAutorshipul, excluderile, deviațiile și limitările Yaps rămân proeminente.
Datele vin cu declarațiiRânduri curățate, agregate, manifeste și canalul de corecție publicate împreună.
05 · Limitări cunoscute

Ce nu poate vedea încă acest protocol.

Echipamentul actual testează în principal fluxul de transcriere după captare. Nu redă complet audio-ul fixture-urilor prin sistemul de microfoane live, astfel încât decuparea la captare, artefactele de reducere a zgomotului, pre-roll, comutarea liniștii și evacuarea cozii necesită instrumentație din Faza B.

Observația rețelei nu poate demonstra absența conținutului criptat sau prezice comportamentul viitor. Un corpus public nu poate reprezenta fiecare accent, dizabilitate, microfon, cameră sau stil spontan de vorbire. Fiecare rezultat este legat de o versiune și o dată specifică.

Starea Dictării Private 2026Versiunea metodei 0.1.0Doar dovezi pilotProiectat și publicat de Yaps