Corpus reproductible
Discours sous licence publique et scripts consentis, utilisant les mêmes octets audio là où ils sont pris en charge pour isoler la reconnaissance et le post-traitement.
Méthodologie · version 0.1.0
Un protocole de type pré-enregistrement pour rendre les résultats favorables et défavorables également inspectables. La version actuelle est encore un pilote ;ces règles définissent la porte d’entrée d’un futur benchmark.
Chaque système est un tuple : version publique du produit, version du système d'exploitation, révision du moteur ou du modèle, paramètres qui affectent la reconnaissance et le nettoyage, classe de périphérique et chemin de capture. Les résultats de différents tuples ne sont jamais regroupés silencieusement.
Si un produit ne peut pas accepter le même chemin audio, il est reporté dans une strate distincte. Une capture micro live n’est pas présentée comme directement comparable à une relecture de fichier.
| Plateforme | Classe de base | Classe actuelle | Objet |
|---|---|---|---|
| macOS | Entrée Apple Silicon | Apple Silicon actuel | Gamme de postes de travail locaux |
| Windows | Ordinateur portable grand public x86 | Ordinateur portable aux performances actuelles | Variation CPU et GPU |
| Android | Appareil milieu de gamme pris en charge | Produit phare actuel | Variation mobile |
Discours sous licence publique et scripts consentis, utilisant les mêmes octets audio là où ils sont pris en charge pour isoler la reconnaissance et le post-traitement.
Lecture calibrée dans des salles et des microphones documentés pour exposer le comportement du débruitage, du pré-roll, du silence-gate et du tail-flush.
Intervenants nouvellement consentis lisant des invites préenregistrées. Les captures de supports privés ne sont jamais promues dans le corpus public.
Langue, variété régionale, durée, bruit, conditions de la pièce, noms, numéros, termes techniques, pauses et corrections orales.
Word Le taux d'erreur est calculé comme les substitutions plus les insertions plus les suppressions, divisés par les mots de référence. L’étude rapporte également chaque opération séparément, car une seule transcription fluide peut masquer une phrase manquante.
Les taux agrégés sont micro-word-weighted: les comptes d'opérations et les mots de référence sont additionnés avant le calcul du débit. La latence publie le nombre d'échantillons, la médiane, p95 et le maximum. Le pilote terminé a un état thermique mixte ; Les essais contrôlés à froid et à chaud et la livraison en direct de l'interface utilisateur restent des mesures futures.
Le temps de traitement inclut la reconnaissance, la finalisation du pipeline et le nettoyage local lorsqu'il est activé. Il exclut la construction initiale du runtime, le chargement des appareils, l'enregistrement en direct, l'envoi de raccourcis et l'insertion de curseur. Tous les couloirs obtiennent le résultat final de l'évaluateur ; les voies de nettoyage peuvent toujours appliquer des modifications de vocabulaire et de formatage.
La latence utilise 60 échantillons de décodage équipondérés par voie et des quantiles linéaires R-7. Les 20 rencontres contiennent 491 positions de mots de référence par passe, comptées trois fois dans le dénominateur de 1 473 mots. Les répétitions ne sont pas des énoncés indépendants. Les échecs de seuil de qualité restent inclus : 3 avec le nettoyage Core ML activé, 3 avec le nettoyage Core ML désactivé et 6 avec Whisper.
Interprétation corrigée le 6 septembre 2026. Les numéros originaux restent inchangés. Lire l'audit des preuves, les références externes, les limitations restantes et les instructions de reproduction.
Le protocole enregistre si un flux de travail se termine hors ligne après la configuration, les destinations et les octets observés, et si des charges utiles audio ou textuelles ont été observées quittant l'appareil. La capture de paquets présente des angles morts, de sorte que la déclaration défendable est « aucune charge utile audio/texte n’a été observée dans ce test ».Ne prétendez jamais que « rien ne part jamais ».
Le harnais actuel teste principalement le pipeline de transcription après capture. Il ne relit pas entièrement l'audio de l'appareil via la pile de microphones en direct, donc la capture d'écrêtage, le débruitage des artefacts, le pré-roll, le déclenchement du silence et le tail flush nécessitent une instrumentation de phase B.
L'observation du réseau ne peut prouver l'absence de contenu chiffré ni prédire le comportement futur. Un corpus public ne peut pas représenter tous les accents, handicaps, microphones, pièces ou styles de parole spontanés. Chaque résultat est lié à une version et une date spécifiques.