Core ML Parakeet + lokal oprydning
- Mikro WER
- 3.46%
- Sletningshastighed
- 0.41%
- Medianbehandling
- 1,124 ms
- p95 behandler
- 2,807 ms
- Maksimal behandling
- 2,958 ms
Status for Privat Diktat · 2026
Nøjagtighed, sletninger, latens og observerbar netværksadfærd på tværs af taleværktøjer på enheden.Vi offentliggør metoden, grænserne og de rensede data ved siden af tallene.
Med lokal oprydning aktiveret, registrerede piloten en medianbehandlingstid på 1.124 ms og en ordfejlrate på 3,46 %. De samme 20 rene syntetiske armaturer blev afkodet tre gange pr. bane på én M1 Max MacBook Pro ved hjælp af Yaps 2.3.2129. Lavere fejl- og latensværdier er bedre inden for denne nøjagtige opsætning. Disse er Yaps konfigurationer, ikke konkurrerende produkter.
Behandlingstiden inkluderer genkendelse, færdiggørelse af pipeline og lokal oprydning, når det er aktiveret. Det udelukker indledende runtime-konstruktion, indlæsning af armaturer, live-optagelse, genvejsafsendelse og markørindsættelse. Alle baner scorer endelig evaluator output; oprydningsbaner kan stadig anvende ordforråd og formateringsændringer.
Latency bruger 60 lige vægtede afkodningsprøver pr. bane og R-7 lineære kvantiler. De 20 kampe indeholder 491 referenceord-positioner pr. pass, tællet tre gange i nævneren på 1.473 ord. Gentagelser er ikke selvstændige ytringer. Kvalitetstærskelfejl forbliver inkluderet: 3 med Core ML oprydning slået til, 3 med Core ML oprydning fra og 6 med Whisper.
Fortolkning rettet 6. september 2026. Originale tal er uændrede. Læs bevisrevisionen, eksterne referencer, resterende begrænsninger og reproduktionsinstruktioner.
I disse kørsler havde Whisper Base med oprydning slået fra 2,85 procentpoint højere WER point, 0,5 m højere medie, 5 m, n højere sletningsrate og 5 m, n højere. 947 ms højere p95 end Core ML Parakeet med oprydning slået fra.
Piloten udelukker menneskelig tale, accenter, flersproget tale, live mikrofonoptagelse, kontrolleret varmeordre, netværksovervågning, yderligere enheder og tredjepartsprodukter.
At downloade modelvægte er den nemme del.Et nyttigt dikteringssystem skal fange lyd pålideligt, vælge den rigtige runtime, forberede tale til den model, detektere ufuldstændig output, bevare brugerens hensigt og placere resultatet, uanset hvor de arbejder.
Yaps gør kapable lokale talemodeller til et enkelt privat værktøj, som folk kan bruge på tværs af deres daglige apps, uden selv at skulle samle modelservere, scripts, lydpipelines eller eksporttrin.
En genvej eller mobiltastatur starter en privat optagelse uden at flytte brugeren ind i et separat transskriptionsværktøj.
Yaps anvender talegenkendelse, håndtering af stilhed og enhed-formet lydforberedelse før genkendelse.
Appen vælger en installeret lokal motor til enheden, sprog, kvalitetspræference og tilgængeligt hardware.
Parakeet, Cohere, Whisper eller en specialistvej konverterer den forberedte lyd til kandidattekst.
Fuldstændighedstjek, redningsstier, ordforrådshåndtering og lokal oprydning beskytter det leverede resultat.
Den færdige tekst bliver indsat ved markøren eller i mobilens tastaturarbejdsgang, klar til brug med det samme.
Denne produktkontekst forklarer, hvorfor rapporten skelner mellem oprydningsindstillinger og det målte outputtrin. Det er ikke bevis for, at Yaps er bedst, og det gør ikke produktpositionering til et benchmarkresultat.
Disse ledsagende studier brugte forskellige enheder, korpora, målemetoder og testprotokoller. Deres tal forklarer de nuværende produktbeslutninger, men de må ikke kombineres til en enkelt ledertavle.
En bredere M1 Max bake-off brugte 144 syntetiske klip på 24 sprog og 65 menneskelige FLEURS-klip på 13 sprog.På den matchede 20-klips menneskelige delmængde, der deles af Cohere og hver model, registrerede Cohere 4,2 % revideret WER mod 12,0 % for MLX Parakeet.
På en Ryzen 7 5700U Windows laptop kørte Cohere og ONNX Parakeet de samme 70 menneskelige FLEURS klip på tværs af 14 sprog. Cohere returnerede 70 ikke-tomme transskriptioner; Parakeet returnerede 61. Cohere vandt 12 ud af 14 automatiserede sprogsammenligninger, men gennemsnitligt 3,654 sekunder per klip mod 1,394 sekunder for Parakeet.
En arabisk FastConformer-pakke kørte på en Pixel 10 Pro. Eksklusive ét ugyldigt referencepar producerede 39 FLEURS klip 9,8 % WER og 4,1 % CER, med en median på 624 ms og 984 ms p95. En bredere ren og støjende MASC skive på Mac CPU scorede senere 22,5 % WER, så ruten forbliver Preview i stedet for at blive en generel arabisk påstand.
Aktuelt bevisDen nuværende 20-armatur pilot, plus en separat 144-syntetisk og 65-menneskelig flersproget model bake-off.
Næste evidensgateTilføj spontan tale, flere Mac-generationer, kontrolleret termisk orden og levende mikrofonoptagelse.
Aktuelt bevisEn separat 70-klip, 14-sprog menneskelig FLEURS-validering sammenlignet Cohere og ONNX Parakeet på Windows 11.
Næste evidensgateUdgiv rensede rækker under den frosne protokol og tilføj lavere hukommelse- og yderligere GPU-klasser.
Aktuelt bevisEn Pixel 10 Pro-evaluering målte en arabisk FastConformer-pakke og udøvede den rigtige tastatursti.
Næste evidensgateTilføj spontan dialekttale, flere telefonniveauer, engelsk ruteparitet, batteri og målinger ved vedvarende brug.
Aktuelt bevisYaps er tilgængelig på Linux, men denne rapport indeholder ikke en rapport-kvalitets original Linux nøjagtigheds- eller latenstidstest.
Næste evidensgateKør oprindelig Ubuntu fixture-afspilning, installeret-pakke diktat, CPU og Vulkan stier, X11 og Wayland.
Aktuelt bevisYaps er tilgængelig på iOS, men denne rapport inkluderer endnu ikke en iPhone enhed benchmark.
Næste evidensgateMål den faktiske tastaturudvidelse, modellastning, hukommelsespres, energiforbrug og end-to-end forpligtelsesforsinkelse.
Hvor mange referenceord bliver erstattet, indsat eller slettet efter deterministisk normalisering?
Mister en transskription hele ord eller sætninger, mens den stadig lyder flydende nok til at undslippe en hurtig gennemgang?
Hvor lang tid tager behandlingen på tværs af en fordeling, ikke kun i det enkelt hurtigste run?
Hvilke forbindelser og payloads observeres under en defineret arbejdsgang, med grænserne for pakkeobservation angivet tydeligt?
Piloten skelner mellem semantiske oprydningsindstillinger, scorer det endelige evaluatoroutput, rapporterer substitutioner, indsættelser og sletninger uafhængigt og holder privat taleindhold uden for den offentlige udgivelse. Sammenlignelige systemer modtager de samme lydbytes, hvor deres grænseflader tillader det; inkompatible fangststier hører til i klart adskilte lag.