Corpus reproducible
Discurso con licencia pública y guiones consentidos, utilizando los mismos bytes de audio cuando se admitieron para aislar el reconocimiento y el posprocesamiento.
Metodología · versión 0.1.0
Un protocolo estilo prerregistro para hacer que los resultados favorables y desfavorables sean igualmente inspeccionables. La versión actual sigue siendo piloto;estas reglas definen la puerta para un futuro punto de referencia.
Cada sistema es una tupla: versión pública del producto, versión del sistema operativo, revisión del motor o modelo, configuraciones que afectan el reconocimiento y la limpieza, clase de dispositivo y ruta de captura. Los resultados de diferentes tuplas nunca se agrupan de forma silenciosa.
Si un producto no puede aceptar la misma ruta de audio, se reporta en un estrato separado. Una captura de micrófono en vivo no se presenta como directamente comparable con la reproducción de un archivo.
| Plataforma | Clase de referencia | Clase actual | Finalidad |
|---|---|---|---|
| macOS | Entrada Apple Silicon | Apple Silicon actual | Rango de escritorio local |
| Windows | Portátil x86 convencional | Rendimiento actual portátil | Variación de CPU y GPU |
| Android | Dispositivo de gama media compatible | Actual buque insignia | Variación móvil |
Discurso con licencia pública y guiones consentidos, utilizando los mismos bytes de audio cuando se admitieron para aislar el reconocimiento y el posprocesamiento.
Reproducción calibrada a través de salas y micrófonos documentados para exponer el comportamiento de eliminación de ruido, pre-roll, silencio y cola.
Oradores recién consentidos leyendo mensajes preinscritos. Las capturas de apoyo privado nunca se promueven al corpus público.
Idioma, variedad regional, duración, ruido, condiciones de la sala, nombres, números, términos técnicos, pausas y correcciones habladas.
Word La tasa de error se calcula como sustituciones más inserciones más eliminaciones, divididas por palabras de referencia. El estudio también informa cada operación por separado porque una sola transcripción fluida puede ocultar una frase faltante.
Las tasas agregadas son micro-word-weighted: los recuentos de operaciones y las palabras de referencia se suman antes de calcular la tarifa. Latencia publica el recuento de muestras, la mediana, p95 y el máximo. El piloto completado tiene un estado térmico mixto; Las ejecuciones controladas en frío y en caliente y la entrega de UI en vivo siguen siendo medidas futuras.
El tiempo de procesamiento incluye reconocimiento, finalización de canalización y limpieza local cuando está habilitado. Excluye la construcción del tiempo de ejecución inicial, la carga de dispositivos, la grabación en vivo, el envío de accesos directos y la inserción del cursor. Todos los carriles califican el resultado final del evaluador; Los carriles de limpieza aún pueden aplicar cambios de vocabulario y formato.
La latencia utiliza 60 muestras de decodificación igualmente ponderadas por carril y cuantiles lineales R-7. Los 20 partidos contienen 491 posiciones de palabras de referencia por pase, contadas tres veces en el denominador de 1.473 palabras. Las repeticiones no son expresiones independientes. Las fallas de umbral de calidad permanecen incluidas: 3 con la limpieza Core ML activada, 3 con la limpieza Core ML desactivada y 6 con Whisper.
Interpretación corregido el 6 de septiembre de 2026. Los números originales no cambian. Leer la auditoría de evidencias, referencias externas, restantes limitaciones e instrucciones de reproducción.
El protocolo registra si un flujo de trabajo se completa sin conexión después de la configuración, los destinos y bytes observados, y si se observaron cargas útiles de audio o texto saliendo del dispositivo. La captura de paquetes tiene puntos ciegos, por lo que la afirmación defendible es "no se observó ninguna carga útil de audio/texto en esta prueba".Nunca digas que “nunca nada se va”.
El arnés actual prueba principalmente la canalización de transcripción después de la captura. No reproduce completamente el audio del dispositivo a través de la pila de micrófonos en vivo, por lo que capturar recortes, artefactos de eliminación de ruido, pre-roll, activación de silencio y descarga de cola requieren instrumentación de Fase B.
La observación de la red no puede demostrar la ausencia de contenido cifrado ni predecir el comportamiento futuro. Un corpus público no puede representar todos los acentos, discapacidades, micrófonos, salas o estilos de habla espontánea. Cada resultado está vinculado a una versión y fecha específicas.