Core ML Parakeet + nettoyage local
- Micro WER
- 3.46%
- Taux de suppression
- 0.41%
- Traitement médian
- 1,124 ms
- Traitement p95
- 2,807 ms
- Traitement maximum
- 2,958 ms
Etat de la Dictée Privée · 2026
Précision, suppressions, latence et comportement réseau observable dans les outils vocaux intégrés à l'appareil. Nous publions la méthode, les limites et les données épurées à côté des chiffres.
Avec le nettoyage local activé, le pilote a enregistré un temps de traitement médian de 1 124 ms et un taux d'erreur de mot de 3,46 %. Les mêmes 20 luminaires synthétiques propres ont été décodés trois fois par voie sur un M1 Max MacBook Pro en utilisant Yaps 2.3.2129. Des valeurs d’erreur et de latence plus faibles sont meilleures dans cette configuration exacte. Il s'agit de configurations Yaps, et non de produits concurrents.
Le temps de traitement inclut la reconnaissance, la finalisation du pipeline et le nettoyage local lorsqu'il est activé. Il exclut la construction initiale du runtime, le chargement des appareils, l'enregistrement en direct, l'envoi de raccourcis et l'insertion de curseur. Tous les couloirs obtiennent le résultat final de l'évaluateur ; les voies de nettoyage peuvent toujours appliquer des modifications de vocabulaire et de formatage.
La latence utilise 60 échantillons de décodage équipondérés par voie et des quantiles linéaires R-7. Les 20 rencontres contiennent 491 positions de mots de référence par passe, comptées trois fois dans le dénominateur de 1 473 mots. Les répétitions ne sont pas des énoncés indépendants. Les échecs de seuil de qualité restent inclus : 3 avec le nettoyage Core ML activé, 3 avec le nettoyage Core ML désactivé et 6 avec Whisper.
Interprétation corrigée le 6 septembre 2026. Les numéros originaux restent inchangés. Lire l'audit des preuves, les références externes, les limitations restantes et les instructions de reproduction.
Dans ces exécutions, Whisper Base avec nettoyage désactivé avait 2,85 points de pourcentage de plus WER, un taux de suppression supérieur de 0,20 point, une médiane supérieure de 595 ms et un p95 supérieur de 947 ms à celui de Core ML Parakeet avec le nettoyage désactivé.
Le pilote exclut la parole humaine, les accents, la parole multilingue, la capture de microphone en direct, l'ordre thermique contrôlé, l'observation du réseau, les appareils supplémentaires et les produits tiers.
Télécharger les poids des modèles est la partie la plus simple. Un système de dictée utile doit capturer l'audio de manière fiable, choisir le bon moment d'exécution, préparer la parole pour ce modèle, détecter les sorties incomplètes, préserver l'intention de l'utilisateur et placer le résultat là où il travaille.
. Yaps transforme les modèles vocaux locaux performants en un outil privé unique que les utilisateurs peuvent utiliser dans leurs applications quotidiennes, sans assembler eux-mêmes des serveurs de modèles, des scripts, des pipelines audio ou des étapes d'exportation.
Un raccourci ou un clavier mobile démarre un enregistrement privé sans déplacer l'utilisateur vers un outil de transcription distinct.
Yaps applique la détection de la parole, la gestion du silence et la préparation audio en forme de périphérique avant la reconnaissance.
L'application sélectionne un moteur local installé pour l'appareil, la langue, les préférences de qualité et le matériel disponible.
Parakeet , Cohere , Whisper , ou un itinéraire spécialisé convertit l'audio préparé en texte candidat.
Les contrôles d'exhaustivité, les chemins de secours, la gestion du vocabulaire et le nettoyage local protègent le résultat fourni.
Le texte fini est validé au niveau du curseur ou dans le workflow du clavier mobile, prêt à être utilisé immédiatement.
Ce contexte produit explique pourquoi le rapport distingue les paramètres de nettoyage et l'étage de sortie mesuré. Cela ne constitue pas une preuve que Yaps est le meilleur et cela ne transforme pas le positionnement du produit en un résultat de référence.
Ces études complémentaires ont utilisé différents appareils, corpus, mesures et protocoles de test. Leurs chiffres expliquent les décisions actuelles en matière de produits, mais ils ne doivent pas être combinés en un seul classement.
Une étude plus large de M1 Max a utilisé 144 clips synthétiques dans 24 langues et 65 clips FLEURS humains dans 13 langues. Sur le sous-ensemble humain correspondant de 20 clips partagé par Cohere et chaque modèle, Cohere a enregistré 4,2 % de WER audité contre 12,0 % pour MLX Parakeet.
Sur un ordinateur portable Windows Ryzen 7 5700U, Cohere et ONNX Parakeet ont exécuté les mêmes 70 clips FLEURS humains dans 14 langues. Cohere a renvoyé 70 relevés de notes non vides ;Parakeet en a renvoyé 61. Cohere a remporté 12 des 14 comparaisons de langues automatisées, mais en moyenne 3,654 secondes par clip contre 1,394 secondes pour Parakeet.
Un pack FastConformer arabe fonctionnait sur un Pixel 10 Pro. En excluant une paire de référence invalide, 39 clips FLEURS ont produit 9,8 % WER et 4,1 % CER, avec une médiane de 624 ms et 984 ms p95. Une tranche MASC plus propre et plus bruyante sur le processeur Mac a ensuite obtenu un score de 22,5 % WER, de sorte que l'itinéraire reste un aperçu plutôt que de devenir une revendication arabe générale.
Preuves actuellesLe projet pilote actuel de 20 appareils, plus une préparation distincte de modèles multilingues de 144 synthétiques et 65 humains.
Prochaine porte de preuveAjoutez la parole spontanée, plus de générations de Mac, un ordre thermique contrôlé et une capture de microphone en direct.
Preuves actuellesUne validation FLEURS humaine distincte de 70 clips et 14 langues compare Cohere et ONNX Parakeet sur Windows 11.
Prochaine porte de preuvePubliez des lignes nettoyées sous le protocole gelé et ajoutez des classes GPU supplémentaires et moins de mémoire.
Preuves actuellesUne évaluation du Pixel 10 Pro a mesuré un pack FastConformer arabe et a testé le véritable chemin du clavier.
Prochaine porte de preuveAjoutez la parole spontanée en dialecte, davantage de niveaux téléphoniques, la parité des itinéraires en anglais, la batterie et les mesures d'utilisation soutenue.
Preuves actuellesYaps est disponible sur Linux, mais ce rapport ne contient pas d'analyse native de précision ou de latence Linux de qualité rapport.
Prochaine porte de preuveExécutez la relecture native des appareils Ubuntu, la dictée des packages installés, les chemins CPU et Vulkan, X11 et Wayland .
Preuves actuellesYaps est disponible sur iOS, mais ce rapport n'inclut pas encore de référence sur les appareils iPhone.
Prochaine porte de preuveMesurez l'extension réelle du clavier, le chargement du modèle, la pression mémoire, la consommation d'énergie et la latence de validation de bout en bout.
Combien de mots de référence sont substitués, insérés ou supprimés après normalisation déterministe ?
Une transcription perd-elle des mots ou des phrases entières tout en restant suffisamment fluide pour échapper à une révision rapide ?
Combien de temps prend le traitement dans une distribution, pas seulement pour l'exécution la plus rapide ?
Quelles connexions et charges utiles sont observées lors d'un workflow défini, avec les limites de l'observation des paquets clairement énoncées ?
Le pilote distingue les paramètres de nettoyage sémantique, note le résultat final de l'évaluateur, rapporte les substitutions, insertions et suppressions de manière indépendante et conserve le contenu vocal privé en dehors de la diffusion publique. Des systèmes comparables reçoivent les mêmes octets audio là où leurs interfaces le permettent ; les chemins de capture incompatibles appartiennent à des strates clairement séparées.