Corpus reproduzível
Discurso licenciado publicamente e scripts consentidos, usando os mesmos bytes de áudio quando suportados para isolar o reconhecimento e o pós-processamento.
Metodologia · versão 0.1.0
Um protocolo estilo pré-registro para tornar resultados favoráveis e desfavoráveis igualmente inspecionáveis. A versão atual ainda é um piloto;essas regras definem a porta para um benchmark futuro.
Cada sistema é uma tupla: versão pública do produto, versão do sistema operacional, mecanismo ou revisão do modelo, configurações que afetam o reconhecimento e a limpeza, classe do dispositivo e caminho de captura. Os resultados de tuplas diferentes nunca são agrupados silenciosamente.
Se um produto não puder aceitar o mesmo caminho de áudio, ele será reportado em um estrato separado. Uma captura de microfone ao vivo não é apresentada como diretamente comparável a uma reprodução de arquivo.
| Plataforma | Classe de linha de base | Classe atual | Finalidade |
|---|---|---|---|
| macOS | Entrada Apple Silicon | Atual Apple Silicon | Faixa de desktop local |
| Windows | Laptop x86 convencional | Laptop de desempenho atual | Variação de CPU e GPU |
| Android | Dispositivo de médio alcance compatível | Carro-chefe atual | Variação móvel |
Discurso licenciado publicamente e scripts consentidos, usando os mesmos bytes de áudio quando suportados para isolar o reconhecimento e o pós-processamento.
Reprodução calibrada por meio de salas e microfones documentados para expor comportamento de redução de ruído, pré-rolagem, porta de silêncio e descarga traseira.
Palestrantes recém-consentidos lendo prompts pré-registrados. As capturas de apoio privado nunca são promovidas para o corpus público.
Idioma, variedade regional, duração, ruído, condições do ambiente, nomes, números, termos técnicos, pausas e correções faladas.
Word a taxa de erro é calculada como substituições mais inserções mais exclusões, dividida por palavras de referência. O estudo também relata cada operação separadamente porque uma única transcrição fluente pode esconder uma frase faltante.
As taxas agregadas são micro-word-weighted: contagens de operações e palavras de referência são somadas antes do cálculo da taxa. Latência publica contagem de amostras, mediana, p95 e máximo. O piloto concluído possui estado térmico misto; execuções controladas a frio e a quente e entrega de UI ao vivo permanecem medidas futuras.
O tempo de processamento inclui reconhecimento, finalização do pipeline e limpeza local quando habilitado. Exclui a construção inicial do tempo de execução, carregamento de fixtures, gravação ao vivo, envio de atalhos e inserção de cursor. Todas as pistas pontuam o resultado final do avaliador; As pistas de limpeza ainda podem aplicar alterações de vocabulário e formatação.
A latência usa 60 amostras de decodificação igualmente ponderadas por pista e quantis lineares R-7. Os 20 equipamentos contêm 491 posições de palavras de referência por passagem, contadas três vezes no denominador de 1.473 palavras. As repetições não são declarações independentes. As falhas no limite de qualidade permanecem incluídas: 3 com Core ML limpeza ativada, 3 com Core ML limpeza desativada e 6 com Whisper.
Interpretação corrigida em 6 de setembro de 2026. Os números originais permanecem inalterados. Leia a auditoria de evidências, referências externas, demais limitações e instruções de reprodução.
O protocolo registra se um fluxo de trabalho é concluído off-line após a configuração, destinos e bytes observados e se cargas úteis de áudio ou texto foram observadas saindo do dispositivo. A captura de pacotes tem pontos cegos, portanto a afirmação defensável é “nenhuma carga útil de áudio/texto foi observada neste teste”.Nunca diga que “nada nunca vai embora”.
O chicote atual testa principalmente o pipeline de transcrição após a captura. Ele não reproduz totalmente o áudio do equipamento através da pilha de microfones ao vivo, portanto, captura de recorte, artefatos de redução de ruído, pré-rolagem, silenciamento e descarga traseira requerem instrumentação da Fase B.
A observação da rede não pode provar a ausência de conteúdo criptografado ou prever comportamento futuro. Um corpus público não pode representar todos os sotaques, deficiências, microfones, ambientes ou estilos de fala espontânea. Cada resultado está vinculado a uma versão e data específicas.