Corpus reproductibil
Discurs public licențiat și scripturi consimțite, folosind aceleași fragmente audio acolo unde este suportat pentru a izola recunoașterea și post-procesarea.
Metodologie · versiunea 0.1.0
Un protocol de tip preregistrare pentru a face ca rezultatele favorabile și nefavorabile să fie la fel de inspectabile. Versiunea actuală este încă un pilot; aceste reguli definesc poarta pentru un reper viitor.
Fiecare sistem este un tuplu: versiunea publică a produsului, versiunea sistemului de operare, revizia motorului sau modelului, setări care afectează recunoașterea și curățarea, clasa dispozitivului și calea de capturare. Rezultatele provenind din tupluri diferite nu sunt niciodată combinate în mod silențios.
Dacă un produs nu poate accepta aceeași cale audio, acesta este raportat într-un strat separat. Captarea microfonului în direct nu este prezentată ca fiind comparabilă direct cu redarea unui fișier.
| Platformă | Clasa de bază | Clasa curentă | Scop |
|---|---|---|---|
| macOS | Intrare Apple Silicon | Actual Apple Silicon | Gama de desktop local |
| Windows | Laptop x86 mainstream | Laptop de performanță curent | Variația CPU și GPU |
| Android | Dispozitive medii acceptate | Produs emblematic curent | Varianță mobilă |
Discurs public licențiat și scripturi consimțite, folosind aceleași fragmente audio acolo unde este suportat pentru a izola recunoașterea și post-procesarea.
Redare calibrată prin camere și microfoane documentate pentru a evidenția comportamentul de reducere a zgomotului, pre-roll, poartă de tăcere și flush de coadă.
Vorbitori nou-consimțiți citind mesaje preînregistrate. Capturile de suport private nu sunt promovate niciodată în corpusul public.
Limbaj, varietate regională, durată, zgomot, condiții ale încăperii, nume, numere, termeni tehnici, pauze și corecturi verbale.
Word rata de eroare este calculată ca substituții plus inserții plus ștergeri, împărțite la cuvintele de referință. De asemenea, studiul raportează fiecare operație separat, deoarece o singură transcriere fluentă poate ascunde o frază lipsă.
Ratele agregate sunt micro-word-weighted: numărul de operații și cuvintele de referință sunt însumate înainte ca rata să fie calculată. Latența publică numărul de mostre, mediana, p95 și maxim. Pilotul finalizat are stare termică mixtă; alergările controlate la rece și la cald și livrarea live UI rămân măsurători viitoare.
Timpul de procesare include recunoașterea, finalizarea conductei și curățarea locală atunci când este activată. Exclude construcția inițială a timpului de rulare, încărcarea dispozitivului, înregistrarea live, trimiterea comenzilor rapide și inserarea cursorului. Toate benzile au punctat rezultatul final al evaluatorului; benzile de curățare pot aplica în continuare modificări de vocabular și formatare.
Latența utilizează 60 de eșantioane de decodificare egal ponderate pe bandă și cuantile liniare R-7. Cele 20 de meciuri conțin 491 de poziții de cuvinte de referință per trecere, numărate de trei ori la numitorul de 1.473 de cuvinte. Repetările nu sunt enunțuri independente. Eșecurile de prag de calitate rămân incluse: 3 cu Core ML curățare activată, 3 cu Core ML curățare dezactivată și 6 cu Whisper.
Interpretarea corectată 6 septembrie 2026. Număr original neschimbat. Citiți auditul probelor, referințele externe, limitările rămase și instrucțiunile de reproducere.
Protocolul înregistrează dacă un flux de lucru se finalizează offline după configurare, destinațiile și octeții observați și dacă au fost observate încărcări audio sau text părăsind dispozitivul. Captura de pachete are puncte oarbe, așa că declarația defensabilă este „nu a fost observată nicio încărcare audio/text în acest test.” Nu afirmați niciodată „nimic nu părăsește vreodată dispozitivul.”
Echipamentul actual testează în principal fluxul de transcriere după captare. Nu redă complet audio-ul fixture-urilor prin sistemul de microfoane live, astfel încât decuparea la captare, artefactele de reducere a zgomotului, pre-roll, comutarea liniștii și evacuarea cozii necesită instrumentație din Faza B.
Observația rețelei nu poate demonstra absența conținutului criptat sau prezice comportamentul viitor. Un corpus public nu poate reprezenta fiecare accent, dizabilitate, microfon, cameră sau stil spontan de vorbire. Fiecare rezultat este legat de o versiune și o dată specifică.