Reprodukálható korpusz
Nyilvános engedéllyel rendelkező beszéd és hozzájárulással készült forgatókönyvek, ugyanazokat az audio bájtokat használva, ahol támogatott, a felismerés és utófeldolgozás izolálására.
Módszertan · verzió 0.1.0
Egy előregisztrációs stílusú protokoll, amely lehetővé teszi a kedvező és kedvezőtlen kimenetek egyenlő ellenőrizhetőségét. A jelenlegi kiadás még mindig pilot; ezek a szabályok határozzák meg a jövőbeli mérőszám kapuját.
Minden rendszer egy tuple: nyilvános termékváltozat, operációs rendszer verzió, motor vagy modell revízió, a felismerést és tisztítást befolyásoló beállítások, eszközosztály és rögzítési útvonal. A különböző tuple-ök eredményeit soha nem vonják össze csendben.
Ha egy termék nem tudja elfogadni ugyanazt a hangútvonalat, azt külön rétegben jelentik. Egy élő mikrofonfelvételt nem lehet közvetlenül összehasonlíthatónak bemutatni a fájllejátszással.
| Platform | Alapértelmezett osztály | Jelenlegi osztály | Cél |
|---|---|---|---|
| macOS | Bejegyzés Apple Silicon | Jelenlegi Apple Silicon | Helyi asztali tartomány |
| Windows | Főáramú x86 laptop | Jelenlegi teljesítményű laptop | CPU és GPU eltérés |
| Android | Támogatott középkategóriás eszköz | Jelenlegi zászlóshajó | Mobil változat |
Nyilvános engedéllyel rendelkező beszéd és hozzájárulással készült forgatókönyvek, ugyanazokat az audio bájtokat használva, ahol támogatott, a felismerés és utófeldolgozás izolálására.
Kalibrált lejátszás dokumentált szobákon és mikrofonokon a zajcsökkentés, elő-roll, némítókapu és farok-kiöblítés viselkedésének feltárására.
Újonnan hozzájáruló beszélők előre regisztrált utasításokat olvasnak. A privát támogatási felvételek soha nem kerülnek át a nyilvános korpuszba.
Nyelv, regionális változat, időtartam, zaj, szobakörülmények, nevek, számok, szakkifejezések, szünetek és kimondott javítások.
A Word hibaarányt a helyettesítések plusz beillesztések és törlések számítják, elosztva a referenciaszavakkal. A tanulmány minden egyes műveletről külön is beszámol, mert egyetlen gördülékeny átirat elrejtheti a hiányzó kifejezéseket.
Az összesített arányok micro-word-weighted: a műveletek száma és a referenciaszavak összegzése az arány kiszámítása előtt. A Latency közzéteszi a mintaszámot, a mediánt, a p95-öt és a maximumot. Az elkészült pilot kevert termikus állapotú; Az ellenőrzött hideg és meleg futás, valamint az élő felhasználói felület a jövő mérései maradnak.
A feldolgozási idő magában foglalja a felismerést, a folyamat lezárását és a helyi tisztítást, ha engedélyezve van. Nem tartalmazza a kezdeti futásidejű felépítést, a fixture betöltését, az élő felvételt, a parancsikonok küldését és a kurzor beillesztését. Az összes sáv pontszáma a végső értékelő kimenete; A cleanup-off sávok továbbra is alkalmazhatják a szókincs és a formázás módosításait.
A Latency sávonként 60 egyenlő súlyú dekódolási mintát és R-7 lineáris kvantiust használ. A 20 összeállítás 491 referenciaszó-pozíciót tartalmaz átadásonként, háromszor számolva az 1473 szavas nevezőben. Az ismétlések nem független megnyilatkozások. A minőségi küszöbértékkel kapcsolatos hibák továbbra is szerepelnek: 3 a Core ML tisztítás bekapcsolt állapotában, 3 a Core ML tisztítása kikapcsolt és 6 a Whisper.
Értelmezés javítva 2026. szeptember 6. Az eredeti számok változatlanok. Olvassa el a bizonyítékok auditját, a külső hivatkozásokat, a fennmaradó korlátozásokat és a sokszorosítási utasításokat.
A protokoll rögzíti, hogy egy munkafolyamat befejeződik-e offline a beállítás után, a megfigyelt célpontokat és byte-okat, valamint azt, hogy észleltek-e audio- vagy szövegtartalmat a készülékről való kilépéskor. A csomagfogásnak vannak vakfoltjai, ezért a védhető állítás az, hogy „ebben a tesztben nem figyeltek meg audio/szövegtartalmat”. Soha ne állítsd, hogy „soha semmi sem hagyja el a készüléket”.
A jelenlegi tesztrendszer főként a rögzítés utáni átirat-folyamatot teszteli. Nem játssza le teljes mértékben a tesztaudio anyagot az élő mikrofonláncon keresztül, ezért a rögzítési vágás, zajcsökkentési artefaktumok, előfutás, némítási kapu és utólagos hangkiürítés a B fázisú műszerelést igényli.
A hálózati megfigyelés nem tudja bizonyítani a titkosított tartalom hiányát, és nem tudja előre jelezni a jövőbeli viselkedést. Egy nyilvános korpusz nem tud minden akcentust, fogyatékosságot, mikrofont, szobát vagy spontán beszédstílust reprezentálni. Minden eredmény egy adott verzióhoz és dátumhoz kötődik.