Core ML Parakeet + lokal rensning
- Mikro WER
- 3.46%
- Raderingshastighet
- 0.41%
- Medianbearbetning
- 1,124 ms
- p95-bearbetning
- 2,807 ms
- Maximal bearbetning
- 2,958 ms
Status för privat diktering · 2026
Noggrannhet, raderingar, latens och observerbart nätverksbeteende över talverktyg på enheten.Vi publicerar metoden, gränserna och de sanerade uppgifterna bredvid siffrorna.
Med lokal rensning aktiverad registrerade piloten en medianbearbetningstid på 1 124 ms och 3,46 % ordfelfrekvens. Samma 20 rena syntetiska fixturer avkodades tre gånger per körfält på en M1 Max MacBook Pro med Yaps 2.3.2129. Lägre fel- och latensvärden är bättre inom denna exakta inställning. Dessa är Yaps konfigurationer, inte konkurrerande produkter.
Behandlingstiden inkluderar igenkänning, slutförande av pipeline och lokal rensning när aktiverat. Det utesluter initial runtime-konstruktion, fixturladdning, liveinspelning, genvägsutskick och markörinsättning. Alla banor ger slutliga utvärderingsresultat; Rensningsbanor kan fortfarande tillämpa ordförråd och formateringsändringar.
Latensen använder 60 lika viktade avkodningsprov per körfält och R-7 linjära kvantiler. De 20 matcherna innehåller 491 referensordspositioner per pass, räknade tre gånger i nämnaren på 1 473 ord. Upprepningar är inte självständiga yttranden. Kvalitetströskelfel förblir inkluderade: 3 med Core ML rensning på, 3 med Core ML rensning av och 6 med Whisper.
Tolkning korrigerad 6 september 2026. Originalnummer är oförändrade. Läs bevisgranskningen, externa referenser, återstående begränsningar och reproduktionsinstruktioner.
I dessa körningar hade Whisper Base med rensning av 2,85 procentenheter högre WER poäng, 0,20 m högre raderingsfrekvens och 9,20 m, 5 media 947 ms högre p95 än Core ML Parakeet med rengöring av.
Piloten utesluter mänskligt tal, accenter, flerspråkigt tal, direkt mikrofonupptagning, kontrollerad termisk ordning, nätverksobservation, ytterligare enheter och tredjepartsprodukter.
Att ladda ner modellvikter är den enkla delen. Ett användbart dikteringssystem måste kunna fånga ljud pålitligt, välja rätt körmiljö, förbereda tal för den modellen, upptäcka ofullständig output, bevara användarens avsikt och placera resultatet där användaren arbetar.
Yaps omvandlar kapabla lokala talmodeller till ett enda privat verktyg som människor kan använda i sina vardagliga appar, utan att själva behöva sätta ihop modellservrar, skript, ljudpipelines eller exportsteg.
En genväg eller ett mobilt tangentbord startar en privat inspelning utan att flytta användaren till ett separat transkriptionsverktyg.
Yaps tillämpar taligenkänning, hantering av tystnad och ljudförberedelse i enhetens form innan igenkänning.
Appen väljer en installerad lokal motor för enheten, språk, kvalitetsinställning och tillgänglig hårdvara.
Parakeet, Cohere, Whisper eller en specialistrutt omvandlar det förberedda ljudet till kandidattext.
Fullständighetskontroller, räddningsvägar, ordförrådshantering och lokal rensning skyddar det levererade resultatet.
Den färdiga texten fastställs vid markören eller i mobilens tangentbordsflöde, redo att användas omedelbart.
Denna produktkontext förklarar varför rapporten särskiljer rensningsinställningar och det uppmätta slutsteget. Det är inte bevis för att Yaps är bäst, och det gör inte produktpositionering till ett benchmarkresultat.
Dessa kompletterande studier använde olika enheter, korpusar, måttstockar och testprotokoll. Deras siffror förklarar nuvarande produktbeslut, men de får inte kombineras till en enda topplista.
En bredare M1 Max bake-off använde 144 syntetiska klipp på 24 språk och 65 mänskliga FLEURS-klipp på 13 språk.På den matchade mänskliga delmängden med 20 klipp som delas av Cohere och varje modell, registrerade Cohere 4,2 % granskad WER mot 12,0 % för MLX Parakeet.
På en Ryzen 7 5700U Windows-laptop körde Cohere och ONNX Parakeet samma 70 mänskliga FLEURS-klipp på 14 språk. Cohere returnerade 70 icke-tomma transkript; Parakeet returnerade 61. Cohere vann 12 av 14 automatiska språkjämförelser, men genomsnittade 3,654 sekunder per klipp jämfört med 1,394 sekunder för Parakeet.
Ett arabiskt FastConformer-paket körde på en Pixel 10 Pro. Exklusive ett ogiltigt referenspar producerade 39 FLEURS klipp 9,8 % WER och 4,1 % CER, med en median på 624 ms och 984 ms p95. En bredare ren och bullrig MASC skiva på Mac CPU fick senare 22,5 % WER, så rutten förblir Preview snarare än att bli ett allmänt arabiskt påstående.
Aktuella bevisDen nuvarande pilotstudien med 20-fixturer, plus en separat 144-syntetisk och 65-mänsklig flerspråkig modelljämförelse.
Nästa bevisgateLägg till spontant tal, fler Mac-generationer, kontrollerad termisk ordning och levande mikrofonfångst.
Aktuella bevisEn separat 70-klipp, 14-språkig mänsklig FLEURS-validering jämförde Cohere och ONNX Parakeet på Windows 11.
Nästa bevisgatePublicera rensade rader under det frusna protokollet och lägg till klasser för lägre minnesanvändning och ytterligare GPU:er.
Aktuella bevisEn Pixel 10 Pro-utvärdering mätte ett arabiskt FastConformer-paket och utövade den verkliga tangentbordsbanan.
Nästa bevisgateLägg till spontant dialekttal, fler telefonnivåer, engelsk ruttparitet, batteri och mätningar för ihållande användning.
Aktuella bevisYaps finns tillgängligt på Linux, men denna rapport innehåller ingen rapportklassad körning av native Linux-precision eller latens.
Nästa bevisgateKör inhemsk Ubuntu-testuppspelning, installerat-paket diktamen, CPU och Vulkan-vägar, X11 och Wayland.
Aktuella bevisYaps finns tillgängligt på iOS, men denna rapport inkluderar ännu inte ett benchmark för iPhone-enheter.
Nästa bevisgateMät det verkliga tangentbordsförlängningen, modellinläsning, minnesbelastning, energianvändning och end-to-end-latens vid commit.
Hur många referensord ersätts, infogas eller tas bort efter deterministisk normalisering?
Förlorar en utskrift hela ord eller fraser samtidigt som den låter tillräckligt flytande för att undvika en snabb recension?
Hur lång tid tar bearbetningen över en distribution, inte bara i det snabbaste enskilda körningen?
Vilka anslutningar och paketobserverade data ses under ett definierat arbetsflöde, med gränserna för paketobservation tydligt angivna?
Piloten särskiljer semantiska rensningsinställningar, poängsätter slutlig utvärderare, rapporterar ersättningar, infogningar och borttagningar oberoende och håller privat talinnehåll utanför den offentliga versionen. Jämförbara system tar emot samma ljudbyte där deras gränssnitt tillåter det; inkompatibla fångstvägar hör hemma i tydligt separerade skikt.