Saltar al contenido

Estado del Dictado Privado · 2026

Mida lo que omite el dictado.

Precisión, eliminaciones, latencia y comportamiento de red observable en las herramientas de voz del dispositivo. Publicamos el método, los límites y los datos desinfectados junto a los números.

01 · Resultados piloto

Los primeros números, a la vista.

Con la limpieza local habilitada, el piloto registró un tiempo de procesamiento medio de 1124 ms y una tasa de error de palabras del 3,46 %. Los mismos 20 dispositivos sintéticos limpios se decodificaron tres veces por carril en un M1 Max MacBook Pro usando Yaps 2.3.2129. Los valores de error y latencia más bajos son mejores dentro de esta configuración exacta. Estas son configuraciones Yaps, no productos de la competencia.

Accesorios
20
Carreras por carril
60
Palabras, con repeticiones
1,473
Origen del habla
Sintético
Dispositivo de prueba
1
Error de agregación
Micro
Limpieza en60 se ejecuta

Core ML Parakeet + limpieza local

Micro WER
3.46%
Tasa de eliminación
0.41%
Procesamiento mediano
1,124 ms
procesamiento p95
2,807 ms
Procesamiento máximo
2,958 ms
Limpia el60 se ejecuta

Core ML Parakeet, limpieza desactivada

Micro WER
3.67%
Tasa de eliminación
0.20%
Procesamiento mediano
250 ms
procesamiento p95
722 ms
Procesamiento máximo
1,863 ms
Limpia el60 se ejecuta

Whisper Base, limpieza de

Micro WER
6.52%
Tasa de eliminación
0.41%
Procesamiento mediano
844 ms
procesamiento p95
1,669 ms
Procesamiento máximo
2,189 ms

El tiempo de procesamiento incluye reconocimiento, finalización de canalización y limpieza local cuando está habilitado. Excluye la construcción del tiempo de ejecución inicial, la carga de dispositivos, la grabación en vivo, el envío de accesos directos y la inserción del cursor. Todos los carriles califican el resultado final del evaluador; Los carriles de limpieza aún pueden aplicar cambios de vocabulario y formato.

La latencia utiliza 60 muestras de decodificación igualmente ponderadas por carril y cuantiles lineales R-7. Los 20 partidos contienen 491 posiciones de palabras de referencia por pase, contadas tres veces en el denominador de 1.473 palabras. Las repeticiones no son expresiones independientes. Las fallas de umbral de calidad permanecen incluidas: 3 con la limpieza Core ML activada, 3 con la limpieza Core ML desactivada y 6 con Whisper.

Interpretación corregido el 6 de septiembre de 2026. Los números originales no cambian. Leer la auditoría de evidencias, referencias externas, restantes limitaciones e instrucciones de reproducción.

Lo que soporta este piloto

Una limpieza coincidente observación.

En estas ejecuciones, Whisper Base con limpieza desactivada tuvo 2,85 puntos porcentuales más WER, tasa de eliminación 0,20 puntos más alta, una mediana 595 ms más alta y un p95 947 ms más alto que Core ML Parakeet con la limpieza desactivada.

Qué no admite

Un producto general o un reclamo de privacidad.

El piloto excluye el habla humana, acentos, habla multilingüe, captura de micrófono en vivo, orden térmico controlado, observación de red, dispositivos adicionales y productos de terceros.

02 · Capa de producto

Un modelo no es una experiencia de dictado.

Por qué Yaps pertenece al informe

Descargar los pesos de los modelos es la parte fácil. Un sistema de dictado útil debe capturar audio de manera confiable, elegir el tiempo de ejecución correcto, preparar el habla para ese modelo, detectar resultados incompletos, preservar la intención del usuario y colocar el resultado dondequiera que esté trabajando.

. Yaps convierte modelos de voz locales capaces en una única herramienta privada que las personas pueden usar en sus aplicaciones cotidianas, sin ensamblar servidores de modelos, scripts, canales de audio ni pasos de exportación.
01

Capturar

Un atajo o teclado móvil inicia una grabación privada sin mover al usuario a una herramienta de transcripción separada.

02

Preparar

Yaps aplica detección de voz, manejo de silencio y preparación de audio en forma de dispositivo antes del reconocimiento.

03

Ruta

La aplicación selecciona un motor local instalado para el dispositivo, el idioma, la preferencia de calidad y el hardware disponible.

04

Reconocer registro

Parakeet, Cohere, Whisper, o una ruta especializada convierte el audio preparado en texto candidato.

05

Guardia

Las comprobaciones de integridad, las rutas de rescate, el manejo de vocabulario y la limpieza local protegen el resultado entregado.

06

Entregar

El texto terminado se confirma en el cursor o en el flujo de trabajo del teclado móvil, listo para usar de inmediato.

Este contexto de producto explica por qué el informe distingue la configuración de limpieza y la etapa de salida medida. No es evidencia de que Yaps sea mejor y no convierte el posicionamiento del producto en un resultado de referencia.

03 · Evidencia más amplia

El programa de investigación ya es más grande que un piloto.

Estos estudios complementarios utilizaron diferentes dispositivos, corpus, métricas y protocolos de prueba. Sus cifras explican las decisiones actuales sobre productos, pero no deben combinarse en una única tabla de clasificación.

Apple Silicon · multilingüeEstudio relacionado

Cohere cambia la conversación de enrutamiento.

Una prueba más amplia de M1 Max utilizó 144 clips sintéticos en 24 idiomas y 65 clips FLEURS humanos en 13 idiomas. En el subconjunto humano coincidente de 20 clips compartido por Cohere y cada modelo, Cohere registró un WER auditado del 4,2 % frente al 12,0 % de MLX Parakeet.

Cohere WER
4.2%
MLX Parakeet
12.0%
Clips humanos coincidentes
20
Cohere admite un conjunto de lenguajes más limitado y requiere un lenguaje anticipado. Cinco clips por idioma siguen siendo una evidencia direccional, no una afirmación de calidad universal.
Windows 11 · CohereEstudio relacionado

Mayor confiabilidad multilingüe, con un costo de latencia.

En una computadora portátil con Windows Ryzen 7 5700U, Cohere y ONNX Parakeet ejecutaron los mismos 70 clips de FLEURS humanos en 14 idiomas. Cohere devolvió 70 transcripciones no vacías;Parakeet obtuvo 61. Cohere ganó 12 de 14 comparaciones automatizadas de idiomas, pero promedió 3,654 segundos por clip frente a 1,394 segundos para Parakeet.

Cohere no vacío
70/70
Parakeet no vacío
61/70
Cohere media
3.654 s
Las puntuaciones de lenguaje siguen siendo direccionales hasta que cada diferencia distinta de cero recibe una adjudicación manual completa. Las filas desinfectadas aún no forman parte de este comunicado público.
Android · Vista previa árabeEstudio relacionado

La velocidad del dispositivo puede disminuir mientras la cobertura del corpus aún falla.

Un paquete FastConformer árabe corría sobre un Pixel 10 Pro. Excluyendo un par de referencia no válido, 39 clips FLEURS produjeron 9,8% WER y 4,1% CER, con una mediana de 624 ms y 984 ms p95. Una porción más amplia, limpia y ruidosa MASC en la CPU Mac obtuvo posteriormente un 22,5% WER, por lo que la ruta sigue siendo Vista previa en lugar de convertirse en una afirmación árabe general.

Clips válidos
39
Decodificar mediana
624 ms
decodificación p95
984 ms
El resultado del teléfono cubre el habla leída, no el MSA espontáneo ni el uso del dialecto. El resultado MASC más amplio es la razón por la que la aplicación mantiene la ruta etiquetada explícitamente como Vista previa.
04 · Cobertura de plataforma

Muestra los huecos en lugar de ocultarlos.

macOS · Apple Silicon

Publicado piloto

Evidencia actualEl piloto actual de 20 dispositivos, más un modelo multilingüe independiente de 144 sintéticos y 65 humanos.

Próxima puerta de pruebasAñade voz espontánea, más generaciones de Mac, orden térmico controlado y captura de micrófono en directo.

Windows · x64

Evidencias relacionadas

Evidencia actualUna validación separada de FLEURS humana de 70 clips y 14 idiomas comparó Cohere y ONNX Parakeet en Windows 11.

Próxima puerta de pruebasPublicar filas desinfectadas bajo el protocolo congelado y agregar clases de GPU adicionales y de menor memoria.

Android · ARM64

Evidencias relacionadas

Evidencia actualUna evaluación de Pixel 10 Pro midió un paquete FastConformer árabe y practicó la ruta real del teclado.

Próxima puerta de pruebasAgregue habla dialectal espontánea, más niveles telefónicos, paridad de ruta en inglés, batería y mediciones de uso sostenido.

Linux · x64

Brecha de investigación

Evidencia actualYaps está disponible en Linux, pero este informe no contiene una ejecución de latencia o precisión nativa de Linux con nivel de informe.

Próxima puerta de pruebasEjecute la reproducción nativa de dispositivos de Ubuntu, el dictado de paquetes instalados, las rutas de CPU y Vulkan, X11 y Wayland.

iOS · ARM64

Brecha de investigación

Evidencia actualYaps está disponible en iOS, pero este informe aún no incluye una prueba comparativa del dispositivo iPhone.

Próxima puerta de pruebasMide la extensión real del teclado, la carga del modelo, la presión de la memoria, el uso de energía y la latencia de confirmación de un extremo a otro.

05 · Pregunta de investigación

Una transcripción fluida aún puede estar equivocada.

01

Precisión

¿Cuántas palabras de referencia se sustituyen, insertan o eliminan tras la normalización determinista?

02

Eliminación silenciosa

¿Una transcripción pierde palabras o frases completas y al mismo tiempo suena lo suficientemente fluida como para escapar de una revisión rápida?

03

Capacidad de respuesta

¿Cuánto tiempo lleva el procesamiento en una distribución, no sólo en la ejecución más rápida?

04

Comportamiento de la red

¿Qué conexiones y cargas útiles se observan durante un flujo de trabajo definido, con los límites de observación de paquetes establecidos claramente?

06 · Diseño de publicación

Evidencia que puedes seguir hasta su fuente.

El piloto distingue configuraciones de limpieza semántica, califica el resultado final del evaluador, informa sustituciones, inserciones y eliminaciones de forma independiente y mantiene el contenido del discurso privado fuera de la publicación pública. Sistemas comparables reciben los mismos bytes de audio cuando sus interfaces lo permiten; Las rutas de captura incompatibles pertenecen a estratos claramente separados.

01Corpus público congelado o consentido
02Sistema, modelo y dispositivo declarado
03Ejecuciones repetidas con fallas retenidas
04Alineación S/I/D nivel Word
05Filas públicas y agregados sin contenido
07 · Leer el registro

Inspeccionar el método y cada fila pública.

Estado del Dictado Privado 2026Versión del método 0.1.0Solo evidencia pilotoDiseñado y publicado por Yaps