Pular para o conteúdo

Metodologia · versão 0.1.0

As regras vêm antes dos resultados.

Um protocolo estilo pré-registro para tornar resultados favoráveis ​​e desfavoráveis ​​igualmente inspecionáveis. A versão atual ainda é um piloto;essas regras definem a porta para um benchmark futuro.

01 · Definição do sistema

O nome de um produto não é uma condição de teste.

Cada sistema é uma tupla: versão pública do produto, versão do sistema operacional, mecanismo ou revisão do modelo, configurações que afetam o reconhecimento e a limpeza, classe do dispositivo e caminho de captura. Os resultados de tuplas diferentes nunca são agrupados silenciosamente.

Se um produto não puder aceitar o mesmo caminho de áudio, ele será reportado em um estrato separado. Uma captura de microfone ao vivo não é apresentada como diretamente comparável a uma reprodução de arquivo.

Proposta de matriz de dispositivos para o primeiro lançamento completo do benchmark.
PlataformaClasse de linha de baseClasse atualFinalidade
macOSEntrada Apple SiliconAtual Apple SiliconFaixa de desktop local
WindowsLaptop x86 convencionalLaptop de desempenho atualVariação de CPU e GPU
AndroidDispositivo de médio alcance compatívelCarro-chefe atualVariação móvel
02 · Três fases

Repetibilidade do laboratório, depois realidade do dispositivo real.

Fase A

Corpus reproduzível

Discurso licenciado publicamente e scripts consentidos, usando os mesmos bytes de áudio quando suportados para isolar o reconhecimento e o pós-processamento.

Fase B

Captura de dispositivo real

Reprodução calibrada por meio de salas e microfones documentados para expor comportamento de redução de ruído, pré-rolagem, porta de silêncio e descarga traseira.

Fase C

Ditado natural

Palestrantes recém-consentidos lendo prompts pré-registrados. As capturas de apoio privado nunca são promovidas para o corpus público.

Em todas as fases

Estratos visíveis

Idioma, variedade regional, duração, ruído, condições do ambiente, nomes, números, termos técnicos, pausas e correções faladas.

03 · Métricas primárias

WER é o começo, não a história toda.

Word a taxa de erro é calculada como substituições mais inserções mais exclusões, dividida por palavras de referência. O estudo também relata cada operação separadamente porque uma única transcrição fluente pode esconder uma frase faltante.

As taxas agregadas são micro-word-weighted: contagens de operações e palavras de referência são somadas antes do cálculo da taxa. Latência publica contagem de amostras, mediana, p95 e máximo. O piloto concluído possui estado térmico misto; execuções controladas a frio e a quente e entrega de UI ao vivo permanecem medidas futuras.

O tempo de processamento inclui reconhecimento, finalização do pipeline e limpeza local quando habilitado. Exclui a construção inicial do tempo de execução, carregamento de fixtures, gravação ao vivo, envio de atalhos e inserção de cursor. Todas as pistas pontuam o resultado final do avaliador; As pistas de limpeza ainda podem aplicar alterações de vocabulário e formatação.

A latência usa 60 amostras de decodificação igualmente ponderadas por pista e quantis lineares R-7. Os 20 equipamentos contêm 491 posições de palavras de referência por passagem, contadas três vezes no denominador de 1.473 palavras. As repetições não são declarações independentes. As falhas no limite de qualidade permanecem incluídas: 3 com Core ML limpeza ativada, 3 com Core ML limpeza desativada e 6 com Whisper.

Interpretação corrigida em 6 de setembro de 2026. Os números originais permanecem inalterados. Leia a auditoria de evidências, referências externas, demais limitações e instruções de reprodução.

Observação da rede

O protocolo registra se um fluxo de trabalho é concluído off-line após a configuração, destinos e bytes observados e se cargas úteis de áudio ou texto foram observadas saindo do dispositivo. A captura de pacotes tem pontos cegos, portanto a afirmação defensável é “nenhuma carga útil de áudio/texto foi observada neste teste”.Nunca diga que “nada nunca vai embora”.

04 · Portões de publicação

Nenhuma tabela de classificação até que todos os portões passem.

Método congelado primeiroConfirmação de versão e análise registrada antes da coleta de benchmark.
Corpus fixadoRevisões imutáveis ​​e resumos SHA-256 para cada fonte e arquivo emitido.
Referências revisadasRevisão de referência por duas pessoas e uma política de normalização para cada sistema.
Entradas comparáveis ​​Mesmos bytes ou um estrato de captura explícito e relatado separadamente.
Procedência completaProduto, modelo, dispositivo, configurações, estado de energia e caminho de captura registrados.
Falhas retidasTimeouts e transcrições ausentes permanecem no denominador.
Operações reconciliadasSubstituições, inserções e exclusões somam-se à distância de edição.
Revisão de privacidadeDesinfetante passa e um humano inspeciona o limite do artefato público.
Conflito divulgadoAutoria, exclusões, desvios e limitações de Yaps permanecem proeminentes.
Os dados são enviados com declaraçõesLinhas higienizadas, agregados, manifestos e canal de correção são publicados juntos.
05 · Limitações conhecidas

O que este protocolo ainda não consegue ver.

O chicote atual testa principalmente o pipeline de transcrição após a captura. Ele não reproduz totalmente o áudio do equipamento através da pilha de microfones ao vivo, portanto, captura de recorte, artefatos de redução de ruído, pré-rolagem, silenciamento e descarga traseira requerem instrumentação da Fase B.

A observação da rede não pode provar a ausência de conteúdo criptografado ou prever comportamento futuro. Um corpus público não pode representar todos os sotaques, deficiências, microfones, ambientes ou estilos de fala espontânea. Cada resultado está vinculado a uma versão e data específicas.

Estado do Ditado Privado 2026Método versão 0.1.0Somente evidência pilotoProjetado e publicado por Yaps