Passer au contenu

Etat de la Dictée Privée · 2026

Mesurez ce que la dictée omet.

Précision, suppressions, latence et comportement réseau observable dans les outils vocaux intégrés à l'appareil. Nous publions la méthode, les limites et les données épurées à côté des chiffres.

01 · Résultats pilotes

Les premiers numéros, bien en vue.

Avec le nettoyage local activé, le pilote a enregistré un temps de traitement médian de 1 124 ms et un taux d'erreur de mot de 3,46 %. Les mêmes 20 luminaires synthétiques propres ont été décodés trois fois par voie sur un M1 Max MacBook Pro en utilisant Yaps 2.3.2129. Des valeurs d’erreur et de latence plus faibles sont meilleures dans cette configuration exacte. Il s'agit de configurations Yaps, et non de produits concurrents.

Calendrier
20
Courses par voie
60
Mots, avec répétitions
1,473
Origine de la parole
Synthétique
Test appareil
1
Agrégation d'erreurs
Micro
Cleanup sur60 s'exécute

Core ML Parakeet + nettoyage local

Micro WER
3.46%
Taux de suppression
0.41%
Traitement médian
1,124 ms
Traitement p95
2,807 ms
Traitement maximum
2,958 ms
Nettoyage désactivé60 s'exécute

Core ML Parakeet, nettoyage désactivé

Micro WER
3.67%
Taux de suppression
0.20%
Traitement médian
250 ms
Traitement p95
722 ms
Traitement maximum
1,863 ms
Nettoyage désactivé60 s'exécute

Whisper Base, nettoyage de

Micro WER
6.52%
Taux de suppression
0.41%
Traitement médian
844 ms
Traitement p95
1,669 ms
Traitement maximum
2,189 ms

Le temps de traitement inclut la reconnaissance, la finalisation du pipeline et le nettoyage local lorsqu'il est activé. Il exclut la construction initiale du runtime, le chargement des appareils, l'enregistrement en direct, l'envoi de raccourcis et l'insertion de curseur. Tous les couloirs obtiennent le résultat final de l'évaluateur ; les voies de nettoyage peuvent toujours appliquer des modifications de vocabulaire et de formatage.

La latence utilise 60 échantillons de décodage équipondérés par voie et des quantiles linéaires R-7. Les 20 rencontres contiennent 491 positions de mots de référence par passe, comptées trois fois dans le dénominateur de 1 473 mots. Les répétitions ne sont pas des énoncés indépendants. Les échecs de seuil de qualité restent inclus : 3 avec le nettoyage Core ML activé, 3 avec le nettoyage Core ML désactivé et 6 avec Whisper.

Interprétation corrigée le 6 septembre 2026. Les numéros originaux restent inchangés. Lire l'audit des preuves, les références externes, les limitations restantes et les instructions de reproduction.

Ce que ce pilote supporte

Un nettoyage correspondant observation.

Dans ces exécutions, Whisper Base avec nettoyage désactivé avait 2,85 points de pourcentage de plus WER, un taux de suppression supérieur de 0,20 point, une médiane supérieure de 595 ms et un p95 supérieur de 947 ms à celui de Core ML Parakeet avec le nettoyage désactivé.

Ce qu'il ne peut pas prendre en charge

Une réclamation générale relative au produit ou à la confidentialité.

Le pilote exclut la parole humaine, les accents, la parole multilingue, la capture de microphone en direct, l'ordre thermique contrôlé, l'observation du réseau, les appareils supplémentaires et les produits tiers.

02 · Couche produit

Un modèle n'est pas une expérience de dictée.

Pourquoi Yaps a sa place dans le rapport

Télécharger les poids des modèles est la partie la plus simple. Un système de dictée utile doit capturer l'audio de manière fiable, choisir le bon moment d'exécution, préparer la parole pour ce modèle, détecter les sorties incomplètes, préserver l'intention de l'utilisateur et placer le résultat là où il travaille.

. Yaps transforme les modèles vocaux locaux performants en un outil privé unique que les utilisateurs peuvent utiliser dans leurs applications quotidiennes, sans assembler eux-mêmes des serveurs de modèles, des scripts, des pipelines audio ou des étapes d'exportation.
01

Capturer

Un raccourci ou un clavier mobile démarre un enregistrement privé sans déplacer l'utilisateur vers un outil de transcription distinct.

02

Préparer

Yaps applique la détection de la parole, la gestion du silence et la préparation audio en forme de périphérique avant la reconnaissance.

03

Itinéraire

L'application sélectionne un moteur local installé pour l'appareil, la langue, les préférences de qualité et le matériel disponible.

04

Reconnaître l'enregistrement

Parakeet , Cohere , Whisper , ou un itinéraire spécialisé convertit l'audio préparé en texte candidat.

05

Garde

Les contrôles d'exhaustivité, les chemins de secours, la gestion du vocabulaire et le nettoyage local protègent le résultat fourni.

06

Livrer

Le texte fini est validé au niveau du curseur ou dans le workflow du clavier mobile, prêt à être utilisé immédiatement.

Ce contexte produit explique pourquoi le rapport distingue les paramètres de nettoyage et l'étage de sortie mesuré. Cela ne constitue pas une preuve que Yaps est le meilleur et cela ne transforme pas le positionnement du produit en un résultat de référence.

03 · Preuves plus larges

Le programme de recherche dépasse déjà un projet pilote.

Ces études complémentaires ont utilisé différents appareils, corpus, mesures et protocoles de test. Leurs chiffres expliquent les décisions actuelles en matière de produits, mais ils ne doivent pas être combinés en un seul classement.

Apple Silicon · multilingueÉtude connexe

Cohere modifie la conversation de routage.

Une étude plus large de M1 Max a utilisé 144 clips synthétiques dans 24 langues et 65 clips FLEURS humains dans 13 langues. Sur le sous-ensemble humain correspondant de 20 clips partagé par Cohere et chaque modèle, Cohere a enregistré 4,2 % de WER audité contre 12,0 % pour MLX Parakeet.

Cohere WER
4.2%
MLX Parakeet
12.0%
Clips humains correspondants
20
Cohere prend en charge un ensemble de langues plus restreint et nécessite une langue anticipée. Cinq clips par langue restent une preuve directionnelle et non une revendication de qualité universelle.
Windows 11 · CohereÉtude connexe

Fiabilité multilingue supérieure, avec un coût de latence.

Sur un ordinateur portable Windows Ryzen 7 5700U, Cohere et ONNX Parakeet ont exécuté les mêmes 70 clips FLEURS humains dans 14 langues. Cohere a renvoyé 70 relevés de notes non vides ;Parakeet en a renvoyé 61. Cohere a remporté 12 des 14 comparaisons de langues automatisées, mais en moyenne 3,654 secondes par clip contre 1,394 secondes pour Parakeet.

Cohere non vide
70/70
Parakeet non vide
61/70
Cohere signifie
3,654 s
Les scores linguistiques restent directionnels jusqu'à ce que chaque différence non nulle fasse l'objet d'une évaluation manuelle complète. Les lignes nettoyées ne font pas encore partie de cette version publique.
Android · Aperçu arabeÉtude connexe

La vitesse de l'appareil peut passer alors que la couverture du corpus échoue toujours.

Un pack FastConformer arabe fonctionnait sur un Pixel 10 Pro. En excluant une paire de référence invalide, 39 clips FLEURS ont produit 9,8 % WER et 4,1 % CER, avec une médiane de 624 ms et 984 ms p95. Une tranche MASC plus propre et plus bruyante sur le processeur Mac a ensuite obtenu un score de 22,5 % WER, de sorte que l'itinéraire reste un aperçu plutôt que de devenir une revendication arabe générale.

Clips valides
39
Décodage médian
624 ms
décodage p95
984 ms
Le résultat téléphonique couvre la parole lue, et non l'utilisation spontanée du MSA et du dialecte. Le résultat MASC plus large est la raison pour laquelle l'application conserve l'itinéraire explicitement étiqueté Aperçu.
04 · Couverture de la plateforme

Montrez les lacunes au lieu de les cacher.

macOS · Apple Silicon

Publié pilote

Preuves actuellesLe projet pilote actuel de 20 appareils, plus une préparation distincte de modèles multilingues de 144 synthétiques et 65 humains.

Prochaine porte de preuveAjoutez la parole spontanée, plus de générations de Mac, un ordre thermique contrôlé et une capture de microphone en direct.

Windows · x64

Preuve connexe

Preuves actuellesUne validation FLEURS humaine distincte de 70 clips et 14 langues compare Cohere et ONNX Parakeet sur Windows 11.

Prochaine porte de preuvePubliez des lignes nettoyées sous le protocole gelé et ajoutez des classes GPU supplémentaires et moins de mémoire.

Android · ARM64

Preuve connexe

Preuves actuellesUne évaluation du Pixel 10 Pro a mesuré un pack FastConformer arabe et a testé le véritable chemin du clavier.

Prochaine porte de preuveAjoutez la parole spontanée en dialecte, davantage de niveaux téléphoniques, la parité des itinéraires en anglais, la batterie et les mesures d'utilisation soutenue.

Linux · x64

Lacune de recherche

Preuves actuellesYaps est disponible sur Linux, mais ce rapport ne contient pas d'analyse native de précision ou de latence Linux de qualité rapport.

Prochaine porte de preuveExécutez la relecture native des appareils Ubuntu, la dictée des packages installés, les chemins CPU et Vulkan, X11 et Wayland .

iOS · ARM64

Lacune de recherche

Preuves actuellesYaps est disponible sur iOS, mais ce rapport n'inclut pas encore de référence sur les appareils iPhone.

Prochaine porte de preuveMesurez l'extension réelle du clavier, le chargement du modèle, la pression mémoire, la consommation d'énergie et la latence de validation de bout en bout.

05 · Question de recherche

Un relevé de notes fluide peut toujours être erroné.

01

Précision

Combien de mots de référence sont substitués, insérés ou supprimés après normalisation déterministe ?

02

Suppression silencieuse

Une transcription perd-elle des mots ou des phrases entières tout en restant suffisamment fluide pour échapper à une révision rapide ?

03

Réactivité

Combien de temps prend le traitement dans une distribution, pas seulement pour l'exécution la plus rapide ?

04

Comportement du réseau

Quelles connexions et charges utiles sont observées lors d'un workflow défini, avec les limites de l'observation des paquets clairement énoncées ?

06 · Conception de la publication

Preuve que vous pouvez suivre jusqu'à sa source.

Le pilote distingue les paramètres de nettoyage sémantique, note le résultat final de l'évaluateur, rapporte les substitutions, insertions et suppressions de manière indépendante et conserve le contenu vocal privé en dehors de la diffusion publique. Des systèmes comparables reçoivent les mêmes octets audio là où leurs interfaces le permettent ; les chemins de capture incompatibles appartiennent à des strates clairement séparées.

01Corpus public ou consenti gelé
02Système, modèle et appareil déclarés
03Exécutions répétées avec échecs conservés
04Alignement S/I/D au niveau Word
05Lignes et agrégats publics sans contenu
07 · Lire la notice

Inspecter la méthode et chaque ligne publique.

Etat de la Dictée Privée 2026Méthode version 0.1.0Pilote preuves uniquementConçu et publié par Yaps