Core ML Parakeet + helyi tisztítás
- Mikro WER
- 3.46%
- Törlési arány
- 0.41%
- Medián feldolgozás
- 1,124 ms
- p95 feldolgozás
- 2,807 ms
- Maximális feldolgozás
- 2,958 ms
Magán Diktálás Állapota · 2026
Pontosság, törlések, késleltetés és megfigyelhető hálózati viselkedés az eszközön lévő beszédeszközökön. Közöljük a módszert, a korlátokat és a tisztított adatokat a számok mellett.
A helyi tisztítás bekapcsolásával a pilóta 1124 ms medián feldolgozási időt és 3,46%-os szóhibaarányt rögzített. Ugyanazt a 20 tiszta szintetikus lámpatestet sávonként háromszor dekódolták egy M1 Max MacBook Pro-n a Yaps 2.3.2129 használatával. Az alacsonyabb hiba- és késleltetési értékek jobbak ebben a pontos beállításban. Ezek Yaps konfigurációk, nem versengő termékek.
A feldolgozási idő magában foglalja a felismerést, a folyamat lezárását és a helyi tisztítást, ha engedélyezve van. Nem tartalmazza a kezdeti futásidejű felépítést, a fixture betöltését, az élő felvételt, a parancsikonok küldését és a kurzor beillesztését. Az összes sáv pontszáma a végső értékelő kimenete; A cleanup-off sávok továbbra is alkalmazhatják a szókincs és a formázás módosításait.
A Latency sávonként 60 egyenlő súlyú dekódolási mintát és R-7 lineáris kvantiust használ. A 20 összeállítás 491 referenciaszó-pozíciót tartalmaz átadásonként, háromszor számolva az 1473 szavas nevezőben. Az ismétlések nem független megnyilatkozások. A minőségi küszöbértékkel kapcsolatos hibák továbbra is szerepelnek: 3 a Core ML tisztítás bekapcsolt állapotában, 3 a Core ML tisztítása kikapcsolt és 6 a Whisper.
Értelmezés javítva 2026. szeptember 6. Az eredeti számok változatlanok. Olvassa el a bizonyítékok auditját, a külső hivatkozásokat, a fennmaradó korlátozásokat és a sokszorosítási utasításokat.
Ezekben a futtatásokban a Whisper Base tisztítás kikapcsolt állapotában 2,85 százalékponttal magasabb WER, 5,5 ms és 0,5 ms adatátviteli sebesség 947 ms-mal magasabb p95, mint Core ML Parakeet tisztítás kikapcsolt állapotában.
A pilóta kizárja az emberi beszédet, a hangzásokat, a többnyelvű beszédet, az élő mikrofonos rögzítést, az ellenőrzött hőmérsékleti sorrendet, a hálózati megfigyelést, a további eszközöket és a harmadik fél termékeit.
A modell súlyainak letöltése a könnyű rész. Egy hasznos diktálórendszernek megbízhatóan kell rögzítenie a hangot, ki kell választania a megfelelő futtatókörnyezetet, elő kell készítenie a beszédet a modell számára, észlelnie kell a hiányos kimenetet, meg kell őriznie a felhasználó szándékát, és a eredményt oda kell elhelyeznie, ahol a felhasználó dolgozik.
Yaps a helyi beszédmodelleket egyetlen privát eszközzé alakítja, amelyet az emberek a mindennapi alkalmazásaikban használhatnak, anélkül, hogy maguknak kellene modelleket kiszolgálni, szkripteket, hangfeldolgozási láncokat vagy exportálási lépéseket összeállítaniuk.
Egy gyorsbillentyű vagy mobil billentyűzet privát felvételt indít anélkül, hogy a felhasználót egy külön átirat készítő eszközbe vinné.
Yaps beszédfelismerést, csendkezelést és eszközformájú hanganyag-előkészítést alkalmaz a felismerés előtt.
Az alkalmazás kiválasztja az eszközhöz, nyelvhez, minőségi preferenciához és elérhető hardverhez telepített helyi motort.
Parakeet, Cohere, Whisper, vagy egy szakértői útvonal alakítja a előkészített hanganyagot jelölt szöveggé.
A teljesség-ellenőrzések, mentőútvonalak, szókincskezelés és helyi tisztítás védik a szállított eredményt.
A kész szöveg a kurzornál vagy a mobil billentyűzet munkafolyamatában kerül rögzítésre, azonnal használatra kész.
Ez a termékkörnyezet elmagyarázza, hogy a jelentés miért tesz különbséget a tisztítási beállítások és a mért kimeneti szakasz között. Ez nem bizonyíték arra, hogy a Yaps a legjobb, és nem változtatja a termékpozícionálást benchmark eredményké.
Ezek a kísérő tanulmányok különböző eszközöket, korpuszokat, metrikákat és tesztelési protokollokat használtak. A számaik magyarázzák a jelenlegi termékdöntéseket, de ezeket nem szabad egyetlen ranglistába kombinálni.
Egy szélesebb M1 Max összehasonlítás 144 szintetikus klipezést használt 24 nyelven és 65 emberi FLEURS klipezést 13 nyelven. Az egyező 20 klipes emberi részhalmazon, amelyet Cohere és minden modell megosztott, Cohere 4,2%-os ellenőrzött WER értéket rögzített a MLX Parakeet 12,0%-ával szemben.
Egy Ryzen 7 5700U Windows laptopon Cohere és ONNX Parakeet ugyanazt a 70 emberi FLEURS klipet futtatták 14 nyelven. Cohere 70 nem üres átírást adott vissza; Parakeet 61-et. Cohere nyerte a 14 automatizált nyelvi összehasonlításból 12-t, de átlagosan 3,654 másodpercenként futott le klipenként, szemben az Parakeet 1,394 másodpercével.
Egy arab FastConformer csomag futott egy Pixel 10 Pro-on. Egy érvénytelen referenciapárt leszámítva 39 FLEURS klip 9,8% WER és 4,1% CER produkált, 624 ms mediánnal és 984 ms p95-tel. Egy szélesebb tiszta és zajos MASC szelet a Mac CPU-n később 22,5%-ot ért el WER, így az útvonal továbbra is Preview marad, nem pedig általános arab állítás.
Jelenlegi bizonyítékA jelenlegi 20-es tesztpados pilot, valamint egy külön 144 szintetikus és 65 emberi többnyelvű modell verseny.
Következő bizonyíték-ellenőrzésAdj hozzá spontán beszédet, több Mac generációt, szabályozott hőmérsékleti sorrendet és élő mikrofon rögzítést.
Jelenlegi bizonyítékEgy külön 70 klipes, 14 nyelvű emberi FLEURS érvényesség összehasonlította Cohere és ONNX Parakeet Windows 11.
Következő bizonyíték-ellenőrzésKözzétenni a megtisztított sorokat a befagyasztott protokoll szerint, és hozzáadni alacsonyabb memóriájú és további GPU osztályokat.
Jelenlegi bizonyítékEgy Pixel 10 Pro értékelés egy arab FastConformer csomagot mért fel, és használta a valódi billentyűzet útvonalát.
Következő bizonyíték-ellenőrzésAdj spontán tájszólású beszédet, több telefonkategóriát, angol útvonal egyenlőséget, akkumulátort és folyamatos használat méréseket.
Jelenlegi bizonyítékYaps elérhető Linuxon, de ez a jelentés nem tartalmaz jelentésminőségű natív Linux pontossági vagy késleltetési futtatást.
Következő bizonyíték-ellenőrzésFuttassa a natív Ubuntu teszt újrajátszását, a telepített csomag diktafonját, a CPU-t és a Vulkan útvonalakat, X11-t, és Wayland-t.
Jelenlegi bizonyítékYaps elérhető iOS-en, de ez a jelentés még nem tartalmaz iPhone készülék-benchmarkot.
Következő bizonyíték-ellenőrzésMérje a valódi billentyűzet-kiterjesztést, a modell betöltését, a memória terhelést, az energiafogyasztást és a teljes végponti rögzítési késleltetést.
Hány hivatkozási szó cserélődik ki, illesztődik be vagy törlődik determinisztikus normalizálás után?
Egy átirat elveszíthet teljes szavakat vagy kifejezéseket, miközben még mindig elég folyamatosnak hangzik ahhoz, hogy elkerülje a gyors átnézést?
Mennyi ideig tart a feldolgozás egy teljes eloszlás mentén, nem csak az egyetlen leggyorsabb futás esetén?
Milyen kapcsolatokat és terheket figyelnek meg egy meghatározott munkafolyamat során, a csomagmegfigyelés korlátait világosan megadva?
A kísérleti program megkülönbözteti a szemantikai tisztítási beállításokat, pontozza a végső kiértékelő kimenetét, önállóan jelenti a helyettesítéseket, beillesztéseket és törléseket, és a privát beszédtartalmat a nyilvános kiadáson kívül tartja. Az összehasonlítható rendszerek ugyanazokat az audio byte-okat kapják, ahol interfészeik ezt lehetővé teszik; az összeférhetetlen befogási utak egyértelműen elkülönülő rétegekbe tartoznak.