Vai al contenuto

Metodologia · versione 0.1.0

Le regole vengono prima dei risultati.

Un protocollo in stile preregistrazione per rendere ugualmente controllabili i risultati favorevoli e sfavorevoli.La versione attuale è ancora un pilota;queste regole definiscono il punto di partenza per un futuro benchmark.

01 · Definizione del sistema

Il nome di un prodotto non è una condizione di test.

Ogni sistema è una tupla: versione pubblica del prodotto, versione del sistema operativo, revisione del motore o del modello, impostazioni che influiscono sul riconoscimento e sulla pulizia, classe del dispositivo e percorso di acquisizione.I risultati di tuple diverse non vengono mai raggruppati in modo silenzioso.

Se un prodotto non può accettare lo stesso percorso audio, viene segnalato in uno strato separato.Una cattura dal microfono dal vivo non viene presentata come direttamente paragonabile alla riproduzione di un file.

Matrice dei dispositivi proposta per la prima versione completa del benchmark.
PiattaformaClasse di baseClasse attualeScopo
macOSVoce Apple SiliconApple Silicon attualeIntervallo desktop locale
WindowsLaptop x86 mainstreamLaptop con prestazioni attualiVarianza CPU e GPU
AndroideDispositivo di fascia media supportatoFiore all'occhiello attualeVariazione mobile
02 · Tre fasi

Ripetibilità in laboratorio, poi realtà del dispositivo reale.

Fase A

Corpus riproducibile

Discorso con licenza pubblica e script approvati, utilizzando gli stessi byte audio ove supportato per isolare il riconoscimento e il post-processing.

Fase B

Cattura su dispositivo reale

Riproduzione calibrata attraverso stanze e microfoni documentati per esporre il comportamento di denoise, pre-roll, silent-gate e tail-flush.

Fase C

Dettatura naturale

Oratori recentemente autorizzati che leggono prompt preregistrati. Le registrazioni di supporto private non vengono mai promosse nel corpus pubblico.

In tutte le fasi

Strati visibili

Lingua, varietà regionale, durata, rumore, condizioni della stanza, nomi, numeri, termini tecnici, pause e correzioni parlate.

03 · Metriche primarie

WER è l'inizio, non tutta la storia.

Word il tasso di errore è calcolato come sostituzioni più inserimenti più cancellazioni, diviso per parole di riferimento. Lo studio riporta inoltre ogni operazione separatamente perché una singola trascrizione fluente può nascondere una frase mancante.

Le tariffe aggregate sono micro-word-weighted: i conteggi delle operazioni e le parole di riferimento vengono sommati prima del calcolo della velocità. La latenza pubblica il conteggio dei campioni, la mediana, p95 e il massimo. Il pilota completato ha uno stato termico misto; le corse a freddo e a caldo controllate e la distribuzione dell'interfaccia utente in tempo reale rimangono misurazioni future.

Il tempo di elaborazione include il riconoscimento, la finalizzazione della pipeline e la pulizia locale quando abilitata. Esclude la costruzione runtime iniziale, il caricamento delle apparecchiature, la registrazione dal vivo, l'invio di scorciatoie e l'inserimento del cursore. Tutte le corsie assegnano un punteggio all'output finale del valutatore; Le corsie di pulizia possono ancora applicare modifiche al vocabolario e alla formattazione.

La latenza utilizza 60 campioni di decodifica equamente ponderati per corsia e quantili lineari R-7. Le 20 apparecchiature contengono 491 posizioni di parole di riferimento per passaggio, contate tre volte nel denominatore di 1.473 parole. Le ripetizioni non sono espressioni indipendenti. Gli errori della soglia di qualità rimangono inclusi: 3 con pulizia Core ML attivata, 3 con pulizia Core ML disattivata e 6 con Whisper.

Interpretazione corretta il 6 settembre 2026. I numeri originali rimangono invariati. Leggi le prove di audit, i riferimenti esterni, le restanti limitazioni e le istruzioni di riproduzione.

Osservazione della rete

Il protocollo registra se un flusso di lavoro si completa offline dopo la configurazione, le destinazioni e i byte osservati, e se payload audio o testuali sono stati osservati uscire dal dispositivo. La cattura dei pacchetti ha punti ciechi, quindi l'affermazione difendibile è “nessun payload audio/testo è stato osservato in questo test.” Non affermare mai “niente esce mai.”

04 · Porte di pubblicazione

Nessuna classifica finché ogni porta non viene superata.

Metodo congelato per primoVersione e commit di analisi registrati prima della raccolta del benchmark.
Corpus bloccatoRevisioni immutabili e digest SHA-256 per ogni file sorgente e generato.
Riferimenti esaminatiRevisione di riferimento a due persone e una politica di normalizzazione per ogni sistema.
Ingressi comparabiliStessi byte o uno strato di cattura esplicito e riportato separatamente.
Provenienza completaProdotto, modello, dispositivo, impostazioni, stato di alimentazione e percorso di acquisizione registrati.
Fallimenti mantenutiI timeout e le trascrizioni mancanti rimangono nel denominatore.
Riconciliazione operazioniSostituzioni, inserimenti e cancellazioni sommati costituiscono la distanza di modifica.
Revisione della privacyIl disinfettante passa e un umano ispeziona il confine dei reperti pubblici.
Conflitto rivelatoYaps autorialità, esclusioni, deviazioni e limitazioni rimangono prominenti.
I dati vengono forniti con le attestazioniRighe sanificate, aggregati, manifesti e canale di correzione pubblicati insieme.
05 · Limitazioni note

Cosa questo protocollo non può ancora vedere.

Il harness attuale testa principalmente la pipeline di trascrizione dopo la cattura. Non riproduce completamente l'audio del fixture attraverso lo stack del microfono in tempo reale, quindi clipping durante la cattura, artefatti di riduzione del rumore, pre-roll, gating del silenzio e flush della coda richiedono strumenti della Fase B.

L'osservazione della rete non può dimostrare l'assenza di contenuti crittografati né prevedere comportamenti futuri. Un corpus pubblico non può rappresentare ogni accento, disabilità, microfono, stanza o stile di parlato spontaneo. Ogni risultato è legato a una versione e a una data specifiche.

Stato della Dettatura Privata 2026Versione del metodo 0.1.0Solo prove pilotaProgettato e pubblicato da Yaps