Core ML Parakeet + lokale schoonmaak
- Micro WER
- 3.46%
- Verwijderingspercentage
- 0.41%
- Mediaan verwerking
- 1,124 ms
- p95 verwerking
- 2,807 ms
- Maximale verwerking
- 2,958 ms
Toestand van Privédictaat · 2026
Nauwkeurigheid, verwijderingen, latentie en waarneembaar netwerkgedrag via spraaktools op het apparaat.We publiceren de methode, de limieten en de opgeschoonde gegevens naast de cijfers.
Met lokale opschoning ingeschakeld registreerde de pilot een gemiddelde verwerkingstijd van 1.124 ms en een woordfoutpercentage van 3,46%. Dezelfde 20 schone synthetische armaturen werden drie keer per baan gedecodeerd op één M1 Max MacBook Pro met behulp van Yaps 2.3.2129. Lagere fout- en latentiewaarden zijn beter binnen deze exacte configuratie. Dit zijn Yaps-configuraties, geen concurrerende producten.
De verwerkingstijd omvat herkenning, pijplijnafronding en lokale opschoning, indien ingeschakeld. Het omvat de initiële runtime-constructie, het laden van de armatuur, live-opname, het verzenden van snelkoppelingen en het invoegen van de cursor. Alle rijstroken scoren de uiteindelijke output van de evaluator; Opruimstroken kunnen nog steeds wijzigingen in de woordenschat en opmaak toepassen.
Latency gebruikt 60 gelijk gewogen decodeermonsters per baan en R-7 lineaire kwantielen. De 20 armaturen bevatten 491 referentiewoordposities per pass, drie keer geteld in de noemer van 1.473 woorden. Herhalingen zijn geen onafhankelijke uitingen. Fouten op het gebied van de kwaliteitsdrempel blijven inbegrepen: 3 met Core ML opschonen aan, 3 met Core ML opschonen uit en 6 met Whisper.
Interpretatie gecorrigeerd op 6 september 2026. Originele cijfers zijn ongewijzigd. Lees de bewijsaudit, externe referenties, resterende beperkingen en reproductie-instructies.
In deze runs was Whisper Base met opschonen uitgeschakeld 2,85 procentpunten hoger WER, 0,20 punten hogere verwijderingssnelheid, een 595 ms hogere mediaan en een 947 ms hogere p95 dan Core ML Parakeet met opschonen uitgeschakeld.
De piloot sluit menselijke spraak, accenten, meertalige spraak, live microfoonopname, gecontroleerde thermische volgorde, netwerkobservatie, aanvullende apparaten en producten van derden uit.
Het downloaden van modelgewichten is het makkelijke gedeelte.Een nuttig dicteersysteem moet audio op betrouwbare wijze vastleggen, de juiste looptijd kiezen, spraak voor dat model voorbereiden, onvolledige uitvoer detecteren, de intentie van de gebruiker behouden en het resultaat plaatsen waar deze ook werkt.
Yaps verandert capabele lokale spraakmodellen in één enkel privéhulpmiddel dat mensen kunnen gebruiken in hun dagelijkse apps, zonder zelf modelservers, scripts, audiopijplijnen of exportstappen samen te stellen.
Een snelkoppeling of mobiel toetsenbord start een privé-opname zonder de gebruiker naar een aparte transcriptietool te verplaatsen.
Yaps past spraakdetectie, stilteafhandeling en apparaatvormige audiovoorbereiding toe vóór herkenning.
De app selecteert een geïnstalleerde lokale motor voor het apparaat, de taal, kwaliteitsvoorkeur en beschikbare hardware.
Parakeet, Cohere, Whisper, of een speciale route zet de voorbereide audio om in kandidaat-tekst.
Volledigheidscontroles, reddingspaden, afhandeling van woordenschat en lokale opschoning beschermen het opgeleverde resultaat.
De voltooide tekst wordt op de cursor of in de workflow van het mobiele toetsenbord vastgelegd, klaar voor direct gebruik.
Deze productcontext legt uit waarom in het rapport onderscheid wordt gemaakt tussen opschooninstellingen en de gemeten outputfase. Het is geen bewijs dat Yaps de beste is, en het verandert de productpositionering niet in een benchmarkresultaat.
Deze begeleidende studies gebruikten verschillende apparaten, corpora, meetmethoden en testprotocollen. Hun cijfers verklaren de huidige productbeslissingen, maar ze mogen niet worden gecombineerd tot één ranglijst.
Een bredere M1 Max-bake-off gebruikte 144 synthetische clips in 24 talen en 65 menselijke FLEURS-clips in 13 talen.Op de overeenkomende menselijke subset van 20 clips die door Cohere en elk model wordt gedeeld, registreerde Cohere 4,2% gecontroleerde WER versus 12,0% voor MLX Parakeet.
Op een Ryzen 7 5700U Windows laptop draaiden Cohere en ONNX Parakeet dezelfde 70 menselijke FLEURS clips in 14 talen. Cohere leverde 70 niet-lege transcripties op; Parakeet leverde er 61. Cohere won 12 van de 14 geautomatiseerde taalvergelijkingen, maar had gemiddeld 3,654 seconden per clip in vergelijking met 1,394 seconden voor Parakeet.
Een Arabisch FastConformer roedel reed op een Pixel 10 Pro. Exclusief één ongeldig referentiepaar produceerden 39 FLEURS-clips 9,8% WER en 4,1% CER, met een mediaan van 624 ms en 984 ms p95. Een breder schoon en luidruchtig MASC-segment op de Mac CPU scoorde later 22,5% WER, dus de route blijft Preview in plaats van een algemene Arabische claim te worden.
Huidig bewijsDe huidige 20-fixture pilot, plus een aparte 144-synthetische en 65-menselijke meertalige model bake-off.
Volgende bewijspoortVoeg spontane spraak, meer Mac-generaties, gecontroleerde thermische volgorde en live microfoonopname toe.
Huidig bewijsEen aparte 70-clip, 14-talige menselijke FLEURS-validatie vergeleek Cohere en ONNX Parakeet op Windows 11.
Volgende bewijspoortPubliceer gesaneerde rijen onder het bevroren protocol en voeg lagere-geheugen- en extra GPU-klassen toe.
Huidig bewijsBij een Pixel 10 Pro-evaluatie werd een Arabisch FastConformer-pakket gemeten en het echte toetsenbordpad getest.
Volgende bewijspoortVoeg spontane dialectspraak, meer telefoonniveaus, Engelse routepariteit, batterij- en metingen voor langdurig gebruik toe.
Huidig bewijsYaps is beschikbaar op Linux, maar dit rapport bevat geen rapportwaardige native Linux-accuratesse- of latentie-run.
Volgende bewijspoortVoer native Ubuntu fixture-herhaling uit, geïnstalleerde-pakket dictaat, CPU- en Vulkan-paden, X11, en Wayland.
Huidig bewijsYaps is beschikbaar op iOS, maar dit rapport bevat nog geen benchmark voor een iPhone-apparaat.
Volgende bewijspoortMeet de werkelijke toetsenbordinzet, model laden, geheugendruk, energieverbruik en end-to-end commit-latentie.
Hoeveel referentiewoorden worden vervangen, ingevoegd of verwijderd na deterministische normalisatie?
Verliest een transcriptie hele woorden of zinnen terwijl het nog steeds vloeiend genoeg klinkt om aan een snelle beoordeling te ontsnappen?
Hoe lang duurt de verwerking van een distributie, en niet alleen bij de snelste run?
Welke verbindingen en gegevenspakketten worden waargenomen tijdens een gedefinieerde workflow, met de grenzen van pakketobservatie duidelijk vermeld?
De pilot maakt onderscheid tussen instellingen voor semantische opschoning, beoordeelt de uiteindelijke uitvoer van de evaluator, rapporteert vervangingen, invoegingen en verwijderingen onafhankelijk van elkaar, en houdt de inhoud van privé-spraak buiten de publieke release. Vergelijkbare systemen ontvangen dezelfde audiobytes waar hun interfaces dit toestaan; incompatibele vangpaden horen thuis in duidelijk gescheiden lagen.