Core ML Parakeet + pulizia locale
- Micro WER
- 3.46%
- Tasso di cancellazione
- 0.41%
- Elaborazione mediana
- 1,124 ms
- Elaborazione p95
- 2,807 ms
- Elaborazione massima
- 2,958 ms
Stato della Dettatura Privata · 2026
Precisione, eliminazioni, latenza e comportamento di rete osservabile negli strumenti vocali sul dispositivo.Pubblichiamo il metodo, i limiti e i dati sanificati accanto ai numeri.
Con la pulizia locale abilitata, il pilota ha registrato un tempo di elaborazione medio di 1.124 ms e un tasso di errore di parola del 3,46%. Gli stessi 20 dispositivi sintetici puliti sono stati decodificati tre volte per corsia su un M1 Max MacBook Pro utilizzando Yaps 2.3.2129. Valori di errore e latenza inferiori sono migliori con questa esatta configurazione. Queste sono configurazioni Yaps, non prodotti concorrenti.
Il tempo di elaborazione include il riconoscimento, la finalizzazione della pipeline e la pulizia locale quando abilitata. Esclude la costruzione runtime iniziale, il caricamento delle apparecchiature, la registrazione dal vivo, l'invio di scorciatoie e l'inserimento del cursore. Tutte le corsie assegnano un punteggio all'output finale del valutatore; Le corsie di pulizia possono ancora applicare modifiche al vocabolario e alla formattazione.
La latenza utilizza 60 campioni di decodifica equamente ponderati per corsia e quantili lineari R-7. Le 20 apparecchiature contengono 491 posizioni di parole di riferimento per passaggio, contate tre volte nel denominatore di 1.473 parole. Le ripetizioni non sono espressioni indipendenti. Gli errori della soglia di qualità rimangono inclusi: 3 con pulizia Core ML attivata, 3 con pulizia Core ML disattivata e 6 con Whisper.
Interpretazione corretta il 6 settembre 2026. I numeri originali rimangono invariati. Leggi le prove di audit, i riferimenti esterni, le restanti limitazioni e le istruzioni di riproduzione.
In queste esecuzioni, Whisper Base con la pulizia disattivata aveva 2,85 punti percentuali in più WER, tasso di eliminazione più alto di 0,20 punti, una mediana più alta di 595 ms e un p95 più alto di 947 ms rispetto a Core ML Parakeet con pulizia disattivata.
Il pilota esclude il linguaggio umano, gli accenti, il linguaggio multilingue, la cattura dal microfono in diretta, l'ordine termico controllato, l'osservazione della rete, dispositivi aggiuntivi e prodotti di terzi.
Scaricare i pesi dei modelli è la parte facile.Un sistema di dettatura utile deve acquisire l'audio in modo affidabile, scegliere il giusto runtime, preparare il parlato per quel modello, rilevare l'output incompleto, preservare l'intento dell'utente e posizionare il risultato ovunque stia lavorando.
Yaps trasforma modelli vocali locali capaci in un unico strumento privato che le persone possono usare nelle loro app quotidiane, senza dover assemblare server di modelli, script, pipeline audio o passaggi di esportazione da soli.
Una scorciatoia o una tastiera mobile avvia una registrazione privata senza spostare l'utente in uno strumento di trascrizione separato.
Yaps applica il rilevamento della voce, la gestione del silenzio e la preparazione dell'audio modellato sul dispositivo prima del riconoscimento.
L'app seleziona un motore locale installato per il dispositivo, la lingua, la preferenza di qualità e l'hardware disponibile.
Parakeet, Cohere, Whisper o un percorso specialista converte l'audio preparato in testo candidato.
Controlli di completezza, percorsi di salvataggio, gestione del vocabolario e pulizia locale proteggono il risultato consegnato.
Il testo completato viene inserito dove c'è il cursore o nel flusso della tastiera mobile, pronto per essere usato immediatamente.
Questo contesto di prodotto spiega perché il report distingue le impostazioni di pulizia e la fase di output misurato. Non è una prova che Yaps sia il migliore e non trasforma il posizionamento del prodotto in un risultato di riferimento.
Questi studi complementari hanno utilizzato dispositivi, corpora, metriche e protocolli di prova diversi. I loro numeri spiegano le decisioni attuali sui prodotti, ma non devono essere combinati in un'unica classifica.
Un'analisi più ampia di M1 Max ha utilizzato 144 clip sintetiche in 24 lingue e 65 clip FLEURS umane in 13 lingue.Sul sottoinsieme umano di 20 clip corrispondenti condiviso da Cohere e da ogni modello, Cohere ha registrato un WER controllato del 4,2% rispetto al 12,0% per MLX Parakeet.
Su un laptop Ryzen 7 5700U Windows, Cohere e ONNX Parakeet hanno eseguito gli stessi 70 clip umani FLEURS in 14 lingue. Cohere ha restituito 70 trascrizioni non vuote; Parakeet ne ha restituite 61. Cohere ha vinto 12 delle 14 comparazioni linguistiche automatizzate, ma ha avuto in media 3,654 secondi per clip contro 1,394 secondi per Parakeet.
Un pacchetto FastConformer arabo funzionava su un Pixel 10 Pro. Escludendo una coppia di riferimento non valida, 39 FLEURS clip hanno prodotto il 9,8% WER e il 4,1% CER, con una mediana di 624 ms e 984 ms p95. Una fetta più ampia, pulita e rumorosa MASC sulla CPU Mac ha successivamente ottenuto un punteggio del 22,5% WER, quindi il percorso rimane Anteprima piuttosto che diventare una rivendicazione araba generale.
Evidenze attualiL'attuale pilota a 20 apparecchi, più un separato confronto tra modelli multilingue con 144 sintetici e 65 umani.
Prossima soglia di verificaAggiungi parlato spontaneo, più generazioni di Mac, ordine termico controllato e acquisizione dal microfono dal vivo.
Evidenze attualiUna convalida FLEURS umana separata di 70 clip e 14 lingue ha confrontato Cohere e ONNX Parakeet su Windows 11.
Prossima soglia di verificaPubblicare righe sanitizzate secondo il protocollo congelato e aggiungere classi a bassa memoria e GPU aggiuntive.
Evidenze attualiUna valutazione del Pixel 10 Pro ha misurato un pacchetto FastConformer arabo ed ha testato il percorso della tastiera reale.
Prossima soglia di verificaAggiungi parlato dialettale spontaneo, più livelli di telefoni, parità di percorso in inglese, batteria e misurazioni di utilizzo sostenuto.
Evidenze attualiYaps è disponibile su Linux, ma questo report non contiene una rilevazione di precisione o latenza nativa su Linux di livello report.
Prossima soglia di verificaEsegui il replay del fixture nativo Ubuntu, dettatura dei pacchetti installati, percorsi CPU e Vulkan, X11 e Wayland.
Evidenze attualiYaps è disponibile su iOS, ma questo report non include ancora un benchmark per dispositivi iPhone.
Prossima soglia di verificaMisura l'estensione reale della tastiera, il caricamento del modello, la pressione della memoria, l'uso di energia e la latenza di commit end-to-end.
Quante parole di riferimento vengono sostituite, inserite o cancellate dopo la normalizzazione deterministica?
Una trascrizione perde intere parole o frasi pur risultando abbastanza fluida da sfuggire a una rapida revisione?
Quanto tempo richiede l'elaborazione in una distribuzione, non solo nella singola esecuzione più veloce?
Quali connessioni e payload vengono osservati durante un flusso di lavoro definito, con i limiti dell'osservazione dei pacchetti chiaramente indicati?
Il pilota distingue le impostazioni di pulizia semantica, assegna un punteggio all'output finale del valutatore, segnala sostituzioni, inserimenti ed eliminazioni in modo indipendente e mantiene il contenuto vocale privato al di fuori della versione pubblica. Sistemi comparabili ricevono gli stessi byte audio laddove le loro interfacce lo consentono; i percorsi di cattura incompatibili appartengono a strati chiaramente separati.