Vai al contenuto

Stato della Dettatura Privata · 2026

Misura ciò che la dettatura omette.

Precisione, eliminazioni, latenza e comportamento di rete osservabile negli strumenti vocali sul dispositivo.Pubblichiamo il metodo, i limiti e i dati sanificati accanto ai numeri.

01 · Risultati pilota

I primi numeri, in piena vista.

Con la pulizia locale abilitata, il pilota ha registrato un tempo di elaborazione medio di 1.124 ms e un tasso di errore di parola del 3,46%. Gli stessi 20 dispositivi sintetici puliti sono stati decodificati tre volte per corsia su un M1 Max MacBook Pro utilizzando Yaps 2.3.2129. Valori di errore e latenza inferiori sono migliori con questa esatta configurazione. Queste sono configurazioni Yaps, non prodotti concorrenti.

Infissi
20
Esegue per corsia
60
Parole, con ripetizioni
1,473
Origine del discorso
Sintetico
Dispositivo di test
1
Aggregazione errori
Micro
Pulizia su60 funziona

Core ML Parakeet + pulizia locale

Micro WER
3.46%
Tasso di cancellazione
0.41%
Elaborazione mediana
1,124 ms
Elaborazione p95
2,807 ms
Elaborazione massima
2,958 ms
Pulisci disattivato60 funziona

Core ML Parakeet, pulizia disattivata

Micro WER
3.67%
Tasso di cancellazione
0.20%
Elaborazione mediana
250 ms
Elaborazione p95
722 ms
Elaborazione massima
1,863 ms
Pulisci disattivato60 funziona

Whisper Base, pulizia di

Micro WER
6.52%
Tasso di cancellazione
0.41%
Elaborazione mediana
844 ms
Elaborazione p95
1,669 ms
Elaborazione massima
2,189 ms

Il tempo di elaborazione include il riconoscimento, la finalizzazione della pipeline e la pulizia locale quando abilitata. Esclude la costruzione runtime iniziale, il caricamento delle apparecchiature, la registrazione dal vivo, l'invio di scorciatoie e l'inserimento del cursore. Tutte le corsie assegnano un punteggio all'output finale del valutatore; Le corsie di pulizia possono ancora applicare modifiche al vocabolario e alla formattazione.

La latenza utilizza 60 campioni di decodifica equamente ponderati per corsia e quantili lineari R-7. Le 20 apparecchiature contengono 491 posizioni di parole di riferimento per passaggio, contate tre volte nel denominatore di 1.473 parole. Le ripetizioni non sono espressioni indipendenti. Gli errori della soglia di qualità rimangono inclusi: 3 con pulizia Core ML attivata, 3 con pulizia Core ML disattivata e 6 con Whisper.

Interpretazione corretta il 6 settembre 2026. I numeri originali rimangono invariati. Leggi le prove di audit, i riferimenti esterni, le restanti limitazioni e le istruzioni di riproduzione.

Cosa questo pilota supporta

Un blocco note osservazione della pulizia.

In queste esecuzioni, Whisper Base con la pulizia disattivata aveva 2,85 punti percentuali in più WER, tasso di eliminazione più alto di 0,20 punti, una mediana più alta di 595 ms e un p95 più alto di 947 ms rispetto a Core ML Parakeet con pulizia disattivata.

Cosa non può supportare

Un prodotto generale o una dichiarazione sulla privacy.

Il pilota esclude il linguaggio umano, gli accenti, il linguaggio multilingue, la cattura dal microfono in diretta, l'ordine termico controllato, l'osservazione della rete, dispositivi aggiuntivi e prodotti di terzi.

02 · Livello prodotto

Un modello non è un'esperienza di dettatura.

Perché Yaps dovrebbe essere incluso nel rapporto

Scaricare i pesi dei modelli è la parte facile.Un sistema di dettatura utile deve acquisire l'audio in modo affidabile, scegliere il giusto runtime, preparare il parlato per quel modello, rilevare l'output incompleto, preservare l'intento dell'utente e posizionare il risultato ovunque stia lavorando.

Yaps trasforma modelli vocali locali capaci in un unico strumento privato che le persone possono usare nelle loro app quotidiane, senza dover assemblare server di modelli, script, pipeline audio o passaggi di esportazione da soli.
01

Cattura

Una scorciatoia o una tastiera mobile avvia una registrazione privata senza spostare l'utente in uno strumento di trascrizione separato.

02

Preparare

Yaps applica il rilevamento della voce, la gestione del silenzio e la preparazione dell'audio modellato sul dispositivo prima del riconoscimento.

03

Percorso

L'app seleziona un motore locale installato per il dispositivo, la lingua, la preferenza di qualità e l'hardware disponibile.

04

Riconosci

Parakeet, Cohere, Whisper o un percorso specialista converte l'audio preparato in testo candidato.

05

Guardia

Controlli di completezza, percorsi di salvataggio, gestione del vocabolario e pulizia locale proteggono il risultato consegnato.

06

Consegna

Il testo completato viene inserito dove c'è il cursore o nel flusso della tastiera mobile, pronto per essere usato immediatamente.

Questo contesto di prodotto spiega perché il report distingue le impostazioni di pulizia e la fase di output misurato. Non è una prova che Yaps sia il migliore e non trasforma il posizionamento del prodotto in un risultato di riferimento.

03 · Evidenza più ampia

Il programma di ricerca è già più grande di un pilota.

Questi studi complementari hanno utilizzato dispositivi, corpora, metriche e protocolli di prova diversi. I loro numeri spiegano le decisioni attuali sui prodotti, ma non devono essere combinati in un'unica classifica.

Apple Silicon · multilingueStudio correlato

Cohere cambia la conversazione di routing.

Un'analisi più ampia di M1 Max ha utilizzato 144 clip sintetiche in 24 lingue e 65 clip FLEURS umane in 13 lingue.Sul sottoinsieme umano di 20 clip corrispondenti condiviso da Cohere e da ogni modello, Cohere ha registrato un WER controllato del 4,2% rispetto al 12,0% per MLX Parakeet.

Cohere WER
4.2%
MLX Parakeet
12.0%
Clip umani corrispondenti
20
Cohere supporta un set di lingue più ristretto e richiede una lingua anticipata.Cinque clip per lingua rimangono una prova direzionale, non una rivendicazione di qualità universale.
Windows 11 · CohereStudio correlato

Maggiore affidabilità multilingue, con un costo di latenza.

Su un laptop Ryzen 7 5700U Windows, Cohere e ONNX Parakeet hanno eseguito gli stessi 70 clip umani FLEURS in 14 lingue. Cohere ha restituito 70 trascrizioni non vuote; Parakeet ne ha restituite 61. Cohere ha vinto 12 delle 14 comparazioni linguistiche automatizzate, ma ha avuto in media 3,654 secondi per clip contro 1,394 secondi per Parakeet.

Cohere non vuoto
70/70
Parakeet non vuoto
61/70
Cohere media
3.654 s
I punteggi linguistici rimangono indicativi fino a quando ogni differenza non nulla non riceve una completa valutazione manuale. Le righe sanificate non fanno ancora parte di questa versione pubblica.
Android · Anteprima in araboStudio correlato

La velocità del dispositivo può passare mentre la copertura del corpus continua a fallire.

Un pacchetto FastConformer arabo funzionava su un Pixel 10 Pro. Escludendo una coppia di riferimento non valida, 39 FLEURS clip hanno prodotto il 9,8% WER e il 4,1% CER, con una mediana di 624 ms e 984 ms p95. Una fetta più ampia, pulita e rumorosa MASC sulla CPU Mac ha successivamente ottenuto un punteggio del 22,5% WER, quindi il percorso rimane Anteprima piuttosto che diventare una rivendicazione araba generale.

Clip valide
39
Decodifica mediana
624 ms
decodifica p95
984 ms
Il risultato del telefono copre il parlato letto, non l'uso spontaneo dell'MSA e dei dialetti. Il risultato più ampio di MASC è la ragione per cui l'app mantiene il percorso esplicitamente etichettato come Anteprima.
04 · Copertura della piattaforma

Mostra i vuoti invece di nasconderli.

macOS · Apple Silicon

Pilota pubblicato

Evidenze attualiL'attuale pilota a 20 apparecchi, più un separato confronto tra modelli multilingue con 144 sintetici e 65 umani.

Prossima soglia di verificaAggiungi parlato spontaneo, più generazioni di Mac, ordine termico controllato e acquisizione dal microfono dal vivo.

Windows · x64

Evidenze correlate

Evidenze attualiUna convalida FLEURS umana separata di 70 clip e 14 lingue ha confrontato Cohere e ONNX Parakeet su Windows 11.

Prossima soglia di verificaPubblicare righe sanitizzate secondo il protocollo congelato e aggiungere classi a bassa memoria e GPU aggiuntive.

Android · ARM64

Evidenze correlate

Evidenze attualiUna valutazione del Pixel 10 Pro ha misurato un pacchetto FastConformer arabo ed ha testato il percorso della tastiera reale.

Prossima soglia di verificaAggiungi parlato dialettale spontaneo, più livelli di telefoni, parità di percorso in inglese, batteria e misurazioni di utilizzo sostenuto.

Linux · x64

Lacuna nella ricerca

Evidenze attualiYaps è disponibile su Linux, ma questo report non contiene una rilevazione di precisione o latenza nativa su Linux di livello report.

Prossima soglia di verificaEsegui il replay del fixture nativo Ubuntu, dettatura dei pacchetti installati, percorsi CPU e Vulkan, X11 e Wayland.

iOS · ARM64

Lacuna nella ricerca

Evidenze attualiYaps è disponibile su iOS, ma questo report non include ancora un benchmark per dispositivi iPhone.

Prossima soglia di verificaMisura l'estensione reale della tastiera, il caricamento del modello, la pressione della memoria, l'uso di energia e la latenza di commit end-to-end.

05 · Domanda di ricerca

Una trascrizione fluente può ancora essere sbagliata.

01

Precisione

Quante parole di riferimento vengono sostituite, inserite o cancellate dopo la normalizzazione deterministica?

02

Cancellazione silenziosa

Una trascrizione perde intere parole o frasi pur risultando abbastanza fluida da sfuggire a una rapida revisione?

03

Reattività

Quanto tempo richiede l'elaborazione in una distribuzione, non solo nella singola esecuzione più veloce?

04

Comportamento di rete

Quali connessioni e payload vengono osservati durante un flusso di lavoro definito, con i limiti dell'osservazione dei pacchetti chiaramente indicati?

06 · Design della pubblicazione

Prove che puoi risalire alla fonte.

Il pilota distingue le impostazioni di pulizia semantica, assegna un punteggio all'output finale del valutatore, segnala sostituzioni, inserimenti ed eliminazioni in modo indipendente e mantiene il contenuto vocale privato al di fuori della versione pubblica. Sistemi comparabili ricevono gli stessi byte audio laddove le loro interfacce lo consentono; i percorsi di cattura incompatibili appartengono a strati chiaramente separati.

01Corpus pubblico o consentito congelato
02Sistema, modello e dispositivo dichiarato
03Esecuzioni ripetute con fallimenti mantenuti
04Allineamento Word-livello S/I/D
05Righe pubbliche senza contenuto eaggregati
07 · Leggi il record

Ispeziona il metodo e ogni riga pubblica.

Stato della Dettatura Privata 2026Versione del metodo 0.1.0Solo prove pilotaProgettato e pubblicato da Yaps