Passer au contenu

Méthodologie · version 0.1.0

Les règles viennent avant les résultats.

Un protocole de type pré-enregistrement pour rendre les résultats favorables et défavorables également inspectables. La version actuelle est encore un pilote ;ces règles définissent la porte d’entrée d’un futur benchmark.

01 · Définition du système

Un nom de produit n'est pas une condition de test.

Chaque système est un tuple : version publique du produit, version du système d'exploitation, révision du moteur ou du modèle, paramètres qui affectent la reconnaissance et le nettoyage, classe de périphérique et chemin de capture. Les résultats de différents tuples ne sont jamais regroupés silencieusement.

Si un produit ne peut pas accepter le même chemin audio, il est reporté dans une strate distincte. Une capture micro live n’est pas présentée comme directement comparable à une relecture de fichier.

Matrice de périphériques proposée pour la première version complète du benchmark.
PlateformeClasse de baseClasse actuelleObjet
macOSEntrée Apple SiliconApple Silicon actuelGamme de postes de travail locaux
WindowsOrdinateur portable grand public x86Ordinateur portable aux performances actuellesVariation CPU et GPU
AndroidAppareil milieu de gamme pris en chargeProduit phare actuelVariation mobile
02 · Trois phases

Répétabilité en laboratoire, puis réalité réelle de l'appareil.

Phase A

Corpus reproductible

Discours sous licence publique et scripts consentis, utilisant les mêmes octets audio là où ils sont pris en charge pour isoler la reconnaissance et le post-traitement.

Phase B

Capture d'appareil réel

Lecture calibrée dans des salles et des microphones documentés pour exposer le comportement du débruitage, du pré-roll, du silence-gate et du tail-flush.

Phase C

Dictée naturelle

Intervenants nouvellement consentis lisant des invites préenregistrées. Les captures de supports privés ne sont jamais promues dans le corpus public.

Sur toutes les phases

Strates visibles

Langue, variété régionale, durée, bruit, conditions de la pièce, noms, numéros, termes techniques, pauses et corrections orales.

03 · Métriques primaires

WER est le début, pas toute l’histoire.

Word Le taux d'erreur est calculé comme les substitutions plus les insertions plus les suppressions, divisés par les mots de référence. L’étude rapporte également chaque opération séparément, car une seule transcription fluide peut masquer une phrase manquante.

Les taux agrégés sont micro-word-weighted: les comptes d'opérations et les mots de référence sont additionnés avant le calcul du débit. La latence publie le nombre d'échantillons, la médiane, p95 et le maximum. Le pilote terminé a un état thermique mixte ; Les essais contrôlés à froid et à chaud et la livraison en direct de l'interface utilisateur restent des mesures futures.

Le temps de traitement inclut la reconnaissance, la finalisation du pipeline et le nettoyage local lorsqu'il est activé. Il exclut la construction initiale du runtime, le chargement des appareils, l'enregistrement en direct, l'envoi de raccourcis et l'insertion de curseur. Tous les couloirs obtiennent le résultat final de l'évaluateur ; les voies de nettoyage peuvent toujours appliquer des modifications de vocabulaire et de formatage.

La latence utilise 60 échantillons de décodage équipondérés par voie et des quantiles linéaires R-7. Les 20 rencontres contiennent 491 positions de mots de référence par passe, comptées trois fois dans le dénominateur de 1 473 mots. Les répétitions ne sont pas des énoncés indépendants. Les échecs de seuil de qualité restent inclus : 3 avec le nettoyage Core ML activé, 3 avec le nettoyage Core ML désactivé et 6 avec Whisper.

Interprétation corrigée le 6 septembre 2026. Les numéros originaux restent inchangés. Lire l'audit des preuves, les références externes, les limitations restantes et les instructions de reproduction.

Observation du réseau

Le protocole enregistre si un flux de travail se termine hors ligne après la configuration, les destinations et les octets observés, et si des charges utiles audio ou textuelles ont été observées quittant l'appareil. La capture de paquets présente des angles morts, de sorte que la déclaration défendable est « aucune charge utile audio/texte n’a été observée dans ce test ».Ne prétendez jamais que « rien ne part jamais ».

04 · Portes de publication

Pas de classement jusqu'à ce que chaque porte soit passée.

Méthode figée en premierValidation de version et d’analyse enregistrée avant la collecte du benchmark.
Corpus épingléRévisions immuables et résumés SHA-256 pour chaque source et fichier émis.
Références consultéesRevue de référence à deux et une politique de normalisation pour chaque système.
Entrées comparablesMêmes octets ou strate de capture explicite et déclarée séparément.
Provenance terminéeProduit, modèle, appareil, paramètres, état d'alimentation et chemin de capture enregistrés.
Échecs retenusLes timeouts et les transcriptions manquantes restent dans le dénominateur.
Réconciliation des opérationsLes substitutions, insertions et suppressions s’additionnent pour modifier la distance.
Examen de la confidentialitéLe désinfectant passe et un humain inspecte la limite de l'artefact public.
Conflit révéléLa paternité, les exclusions, les écarts et les limitations de Yaps restent importants.
Données livrées avec les sinistresLes lignes, agrégats, manifestes et canaux de correction nettoyés sont publiés ensemble.
05 · Limites connues

Ce que ce protocole ne peut toujours pas voir.

Le harnais actuel teste principalement le pipeline de transcription après capture. Il ne relit pas entièrement l'audio de l'appareil via la pile de microphones en direct, donc la capture d'écrêtage, le débruitage des artefacts, le pré-roll, le déclenchement du silence et le tail flush nécessitent une instrumentation de phase B.

L'observation du réseau ne peut prouver l'absence de contenu chiffré ni prédire le comportement futur. Un corpus public ne peut pas représenter tous les accents, handicaps, microphones, pièces ou styles de parole spontanés. Chaque résultat est lié à une version et une date spécifiques.

Etat de la Dictée Privée 2026Méthode version 0.1.0Pilote preuves uniquementConçu et publié par Yaps