Reproducibilni korpus
Javni licencirani govor i pristali skripti, koristeći iste audio baze gdje je podržano kako bi se izoliralo prepoznavanje i naknadna obrada.
Metodologija · verzija 0.1.0
Protokol u stilu preregistracije za jednak pregled povoljnih i nepovoljnih ishoda. Trenutno izdanje je još uvijek pilot; ova pravila definiraju vrata za budući standard.
Svaki sustav je tuple: verzija javnog proizvoda, verzija operativnog sustava, verzija motora ili modela, postavke koje utječu na prepoznavanje i čišćenje, klasa uređaja i putanja hvatanja. Rezultati iz različitih tuple-a nikada se ne spajaju tiho.
Ako proizvod ne može prihvatiti isti audio put, to se prijavljuje u zasebnom sloju. Snimka uživo mikrofon se ne predstavlja kao izravno usporediva s reprodukcijom datoteke.
| Platforma | Osnovna klasa | Trenutni razred | Svrha |
|---|---|---|---|
| macOS | Unos Apple Silicon | Trenutni Apple Silicon | Lokalni raspon radne površine |
| Windows | Glavni x86 laptop | Trenutni prijenosnik za izvedbu | varijacije CPU-a i GPU-a |
| Android | Podržani uređaji srednjeg ranga | Trenutni vodeći model | Varijanta za mobilne uređaje |
Javni licencirani govor i pristali skripti, koristeći iste audio baze gdje je podržano kako bi se izoliralo prepoznavanje i naknadna obrada.
Kalibrirana reprodukcija kroz dokumentirane sobe i mikrofone kako bi se otkrilo ponašanje uklanjanja šuma, prednastavka, gumka za tišinu i ispiranja repa.
Novo pristali govornici čitaju unaprijed registrirane promptove. Privatne snimke podrške nikada se ne promoviraju u javni korpus.
Jezik, regionalna varijanta, trajanje, buka, uvjeti u prostoriji, imena, brojevi, tehnički termini, pauze i izgovorene ispravke.
Word stopa pogreške izračunava se kao zamjene plus umetanja plus brisanja, podijeljeno referentnim riječima. Studija također izvještava o svakoj operaciji zasebno jer jedan tečan prijepis može sakriti frazu koja nedostaje.
Agregirane stope su micro-word-weighted: brojevi operacija i referentne riječi zbrajaju se prije izračuna stope. Latencija objavljuje broj uzoraka, medijan, p95 i maksimum. Završeni pilot ima mješovito toplinsko stanje; kontrolirani hladni i topli rad i isporuka korisničkog sučelja uživo ostaju buduća mjerenja.
Vrijeme obrade uključuje prepoznavanje, finalizaciju cjevovoda i lokalno čišćenje kada je omogućeno. Isključuje početnu konstrukciju vremena izvođenja, učitavanje uređaja, snimanje uživo, slanje prečaca i umetanje kursora. Sve staze bodovaju konačni rezultat evaluatora; trake za čišćenje i dalje mogu primijeniti promjene vokabulara i oblikovanja.
Latencija koristi 60 jednako ponderiranih uzoraka dekodiranja po stazi i R-7 linearne kvantile. 20 utakmica sadrži 491 poziciju referentne riječi po prolazu, računajući tri puta u nazivniku od 1473 riječi. Ponavljanja nisu nezavisni iskazi. Greške praga kvalitete ostaju uključene: 3 s uključenim čišćenjem Core ML, 3 isključenim čišćenjem Core ML i 6 s isključenim čišćenjem Whisper.
Tumačenje ispravljeno 6. rujna 2026. Izvorni brojevi su nepromijenjeni. Pročitajte reviziju dokaza, vanjske reference, preostala ograničenja i upute za reprodukciju.
Protokol bilježi završava li radni tok izvan mreže nakon postavljanja, promatrane odredišne točke i bajtove, te je li promatrana audio ili tekstualna prijenosna jedinica koja izlazi iz uređaja. Snimanje paketa ima slepe točke, stoga je obrambena izjava „u ovom testu nije promatrana audio/tekstualna prijenosna jedinica“. Nikada ne tvrdite „ništa nikada ne izlazi“.
Trenutni sustav za testiranje uglavnom provjerava transkripcijski proces nakon snimanja. Ne reproducira u potpunosti zvuk s uređaja kroz živi mikrofon, pa je za provjeru prekida u snimanju, artefakata uklanjanja šuma, prednastava, zatvaranje tišine i ispiranje repa potrebno instrumentiranje faze B.
Promatranje mreže ne može dokazati odsutnost šifriranog sadržaja niti predvidjeti buduće ponašanje. Javni korpus ne može predstavljati svaki naglasak, invaliditet, mikrofon, sobu ili spontan način govora. Svaki rezultat vezan je uz određenu verziju i datum.