Corpus riproducibile
Discorso con licenza pubblica e script approvati, utilizzando gli stessi byte audio ove supportato per isolare il riconoscimento e il post-processing.
Metodologia · versione 0.1.0
Un protocollo in stile preregistrazione per rendere ugualmente controllabili i risultati favorevoli e sfavorevoli.La versione attuale è ancora un pilota;queste regole definiscono il punto di partenza per un futuro benchmark.
Ogni sistema è una tupla: versione pubblica del prodotto, versione del sistema operativo, revisione del motore o del modello, impostazioni che influiscono sul riconoscimento e sulla pulizia, classe del dispositivo e percorso di acquisizione.I risultati di tuple diverse non vengono mai raggruppati in modo silenzioso.
Se un prodotto non può accettare lo stesso percorso audio, viene segnalato in uno strato separato.Una cattura dal microfono dal vivo non viene presentata come direttamente paragonabile alla riproduzione di un file.
| Piattaforma | Classe di base | Classe attuale | Scopo |
|---|---|---|---|
| macOS | Voce Apple Silicon | Apple Silicon attuale | Intervallo desktop locale |
| Windows | Laptop x86 mainstream | Laptop con prestazioni attuali | Varianza CPU e GPU |
| Androide | Dispositivo di fascia media supportato | Fiore all'occhiello attuale | Variazione mobile |
Discorso con licenza pubblica e script approvati, utilizzando gli stessi byte audio ove supportato per isolare il riconoscimento e il post-processing.
Riproduzione calibrata attraverso stanze e microfoni documentati per esporre il comportamento di denoise, pre-roll, silent-gate e tail-flush.
Oratori recentemente autorizzati che leggono prompt preregistrati. Le registrazioni di supporto private non vengono mai promosse nel corpus pubblico.
Lingua, varietà regionale, durata, rumore, condizioni della stanza, nomi, numeri, termini tecnici, pause e correzioni parlate.
Word il tasso di errore è calcolato come sostituzioni più inserimenti più cancellazioni, diviso per parole di riferimento. Lo studio riporta inoltre ogni operazione separatamente perché una singola trascrizione fluente può nascondere una frase mancante.
Le tariffe aggregate sono micro-word-weighted: i conteggi delle operazioni e le parole di riferimento vengono sommati prima del calcolo della velocità. La latenza pubblica il conteggio dei campioni, la mediana, p95 e il massimo. Il pilota completato ha uno stato termico misto; le corse a freddo e a caldo controllate e la distribuzione dell'interfaccia utente in tempo reale rimangono misurazioni future.
Il tempo di elaborazione include il riconoscimento, la finalizzazione della pipeline e la pulizia locale quando abilitata. Esclude la costruzione runtime iniziale, il caricamento delle apparecchiature, la registrazione dal vivo, l'invio di scorciatoie e l'inserimento del cursore. Tutte le corsie assegnano un punteggio all'output finale del valutatore; Le corsie di pulizia possono ancora applicare modifiche al vocabolario e alla formattazione.
La latenza utilizza 60 campioni di decodifica equamente ponderati per corsia e quantili lineari R-7. Le 20 apparecchiature contengono 491 posizioni di parole di riferimento per passaggio, contate tre volte nel denominatore di 1.473 parole. Le ripetizioni non sono espressioni indipendenti. Gli errori della soglia di qualità rimangono inclusi: 3 con pulizia Core ML attivata, 3 con pulizia Core ML disattivata e 6 con Whisper.
Interpretazione corretta il 6 settembre 2026. I numeri originali rimangono invariati. Leggi le prove di audit, i riferimenti esterni, le restanti limitazioni e le istruzioni di riproduzione.
Il protocollo registra se un flusso di lavoro si completa offline dopo la configurazione, le destinazioni e i byte osservati, e se payload audio o testuali sono stati osservati uscire dal dispositivo. La cattura dei pacchetti ha punti ciechi, quindi l'affermazione difendibile è “nessun payload audio/testo è stato osservato in questo test.” Non affermare mai “niente esce mai.”
Il harness attuale testa principalmente la pipeline di trascrizione dopo la cattura. Non riproduce completamente l'audio del fixture attraverso lo stack del microfono in tempo reale, quindi clipping durante la cattura, artefatti di riduzione del rumore, pre-roll, gating del silenzio e flush della coda richiedono strumenti della Fase B.
L'osservazione della rete non può dimostrare l'assenza di contenuti crittografati né prevedere comportamenti futuri. Un corpus pubblico non può rappresentare ogni accento, disabilità, microfono, stanza o stile di parlato spontaneo. Ogni risultato è legato a una versione e a una data specifiche.