Core ML Parakeet + curățare locală
- Micro WER
- 3.46%
- Rata de ștergere
- 0.41%
- Prelucrare mediană
- 1,124 ms
- p95 procesare
- 2,807 ms
- Procesare maximă
- 2,958 ms
Starea Dicționării Private · 2026
Acuratețea, ștergerile, latența și comportamentul observabil al rețelei în cadrul instrumentelor de vorbire pe dispozitiv. Publicăm metoda, limitele și datele curățate lângă cifre.
Cu curățarea locală activată, pilotul a înregistrat un timp mediu de procesare de 1.124 ms și o rată de eroare a cuvintelor de 3,46%. Aceleași 20 de dispozitive sintetice curate au fost decodificate de trei ori pe bandă pe un M1 Max MacBook Pro utilizând Yaps 2.3.2129. Valorile mai mici de eroare și latență sunt mai bune în această configurație exactă. Acestea sunt configurații Yaps, nu produse concurente.
Timpul de procesare include recunoașterea, finalizarea conductei și curățarea locală atunci când este activată. Exclude construcția inițială a timpului de rulare, încărcarea dispozitivului, înregistrarea live, trimiterea comenzilor rapide și inserarea cursorului. Toate benzile au punctat rezultatul final al evaluatorului; benzile de curățare pot aplica în continuare modificări de vocabular și formatare.
Latența utilizează 60 de eșantioane de decodificare egal ponderate pe bandă și cuantile liniare R-7. Cele 20 de meciuri conțin 491 de poziții de cuvinte de referință per trecere, numărate de trei ori la numitorul de 1.473 de cuvinte. Repetările nu sunt enunțuri independente. Eșecurile de prag de calitate rămân incluse: 3 cu Core ML curățare activată, 3 cu Core ML curățare dezactivată și 6 cu Whisper.
Interpretarea corectată 6 septembrie 2026. Număr original neschimbat. Citiți auditul probelor, referințele externe, limitările rămase și instrucțiunile de reproducere.
In these runs, Whisper Base with cleanup off had 2.85 percentage points higher WER, 0.20 points higher deletion rate, a 595 ms higher median, and a 947 ms higher p95 than Core ML Parakeet with cleanup off.
Pilotul exclude vorbirea umană, accentele, vorbirea multilingvă, capturarea în direct cu microfonul, ordinea termică controlată, monitorizarea rețelei, dispozitivele suplimentare și produsele terților.
Descărcarea greutăților modelului este partea ușoară. Un sistem de dictare util trebuie să capteze audio în mod fiabil, să aleagă timpul de rulare potrivit, să pregătească vorbirea pentru acel model, să detecteze ieșirea incompletă, să păstreze intenția utilizatorului și să plaseze rezultatul acolo unde acesta lucrează.
Yaps transformă modelele locale de vorbire capabile într-un singur instrument privat pe care oamenii îl pot folosi în aplicațiile lor de zi cu zi, fără a asambla ei înșiși servere de modele, scripturi, fluxuri audio sau pași de export.
Un shortcut sau tastatura mobilă începe o înregistrare privată fără a muta utilizatorul într-un instrument de transcriere separat.
Yaps aplică detectarea vorbirii, gestionarea tăcerii și pregătirea audio în formă de dispozitiv înainte de recunoaștere.
Aplicația selectează un motor local instalat pentru dispozitiv, limbă, preferința de calitate și hardware-ul disponibil.
Parakeet, Cohere, Whisper, sau o rută specializată convertește audio-ul pregătit în text candidat.
Verificări de completitudine, căi de recuperare, gestionarea vocabularului și curățarea locală protejează rezultatul livrat.
Textul final este trimis la cursor sau în fluxul de tastatură mobil, gata de utilizare imediată.
Acest context de produs explică de ce raportul distinge setările de curățare și etapa de ieșire măsurată. Nu este o dovadă că Yaps este cel mai bun și nu transformă poziționarea produsului într-un rezultat de referință.
Aceste studii complementare au folosit dispozitive, corpusuri, metrici și protocoale de testare diferite. Numerele lor explică deciziile actuale privind produsul, dar nu trebuie să fie combinate într-un singur clasament.
Un test mai amplu M1 Max a folosit 144 de clipuri sintetice în 24 de limbi și 65 de clipuri umane FLEURS în 13 limbi. În subsetul uman de 20 de clipuri alese împreună de Cohere și fiecare model, Cohere a înregistrat o WER auditată de 4,2% comparativ cu 12,0% pentru MLX Parakeet.
Pe un laptop Ryzen 7 5700U cu Windows, Cohere și ONNX Parakeet au rulat aceleași 70 de clipuri FLEURS umane în 14 limbi. Cohere a returnat 70 de transcrieri ne-goale; Parakeet a returnat 61. Cohere a câștigat 12 din 14 comparații automate de limbă, dar a avut în medie 3,654 secunde per clip comparativ cu 1,394 secunde pentru Parakeet.
Un pachet arab FastConformer rula pe un Pixel 10 Pro. Excluzând o pereche de referință nevalidă, 39 de clipuri FLEURS au produs 9,8% WER și 4,1% CER, cu o mediană de 624 ms și p95 de 984 ms. O secțiune MASC mai amplă, curată și zgomotoasă, pe procesorul Mac, a obținut mai târziu un scor de 22,5% WER, așa că ruta rămâne Previzualizare, mai degrabă decât să devină o revendicare generală arabă.
Dovezi curentePilotul actual cu 20 de fixture-uri, plus un alt test comparativ separat cu 144 de modele sintetice și 65 de modele multilingve umane.
Următorul filtru de doveziAdaugă discurs spontan, mai multe generații Mac, ordine termică controlată și captare live a microfonului.
Dovezi curenteO validare umană separată FLEURS de 70 de clipuri, 14 limbi, a comparat Cohere și ONNX Parakeet pe Windows 11.
Următorul filtru de doveziPublică rândurile curățate conform protocolului înghețat și adaugă clase cu memorie mai redusă și GPU suplimentar.
Dovezi curenteO evaluare Pixel 10 Pro a măsurat un pachet arabic FastConformer și a utilizat calea reală de tastatură.
Următorul filtru de doveziAdăugați vorbire spontană în dialect, mai multe niveluri de telefon, echivalență între traseele în engleză, baterie și măsurători de utilizare susținută.
Dovezi curenteYaps este disponibil pe Linux, dar acest raport nu conține o execuție nativă pentru Linux cu acuratețe sau latență la nivel de raport.
Următorul filtru de doveziRulați redarea fixture nativ Ubuntu, dictarea pachetului instalat, CPU și căile Vulkan, X11, și Wayland.
Dovezi curenteYaps este disponibil pe iOS, dar acest raport nu include încă un benchmark pentru dispozitive iPhone.
Următorul filtru de doveziMăsurați extensia reală a tastaturii, încărcarea modelului, presiunea asupra memoriei, consumul de energie și latența de la început până la finalizarea commit-ului.
Câte cuvinte de referință sunt înlocuite, adăugate sau șterse după normalizarea deterministă?
Un transcript își pierde cuvinte sau fraze întregi în timp ce sună suficient de fluent pentru a scăpa unei revizuiri rapide?
Cât durează procesarea pe toată distribuția, nu doar într-o singură rulare cea mai rapidă?
Ce conexiuni și payload-uri sunt observate în timpul unui flux de lucru definit, cu limitele de observare a pachetelor indicate clar?
Pilotul distinge setările de curățare semantică, notează rezultatele finale ale evaluatorului, raportează înlocuirile, inserările și ștergerile în mod independent și păstrează conținutul vorbirii private în afara lansării publice. Sistemele comparabile primesc aceiași octeți audio acolo unde interfețele lor permit acest lucru; căi de captură incompatibile aparțin unor straturi clar separate.