Core ML Parakeet + limpeza local
- Micro WER
- 3.46%
- Taxa de exclusão
- 0.41%
- Processamento de mediana
- 1,124 ms
- processamento p95
- 2,807 ms
- Processamento máximo
- 2,958 ms
Estado do Ditado Privado · 2026
Precisão, exclusões, latência e comportamento de rede observável em ferramentas de fala no dispositivo. Estamos publicando o método, os limites e os dados higienizados ao lado dos números.
Com a limpeza local habilitada, o piloto registrou um tempo médio de processamento de 1.124 ms e uma taxa de erro de palavras de 3,46%. Os mesmos 20 acessórios sintéticos limpos foram decodificados três vezes por pista em um M1 Max MacBook Pro usando Yaps 2.3.2129. Valores mais baixos de erro e latência são melhores nesta configuração exata. Estas são configurações Yaps, não produtos concorrentes.
O tempo de processamento inclui reconhecimento, finalização do pipeline e limpeza local quando habilitado. Exclui a construção inicial do tempo de execução, carregamento de fixtures, gravação ao vivo, envio de atalhos e inserção de cursor. Todas as pistas pontuam o resultado final do avaliador; As pistas de limpeza ainda podem aplicar alterações de vocabulário e formatação.
A latência usa 60 amostras de decodificação igualmente ponderadas por pista e quantis lineares R-7. Os 20 equipamentos contêm 491 posições de palavras de referência por passagem, contadas três vezes no denominador de 1.473 palavras. As repetições não são declarações independentes. As falhas no limite de qualidade permanecem incluídas: 3 com Core ML limpeza ativada, 3 com Core ML limpeza desativada e 6 com Whisper.
Interpretação corrigida em 6 de setembro de 2026. Os números originais permanecem inalterados. Leia a auditoria de evidências, referências externas, demais limitações e instruções de reprodução.
Nessas execuções, Whisper Base com limpeza desligada teve 2,85 pontos percentuais mais altos WER, taxa de exclusão 0,20 pontos mais alta, uma mediana 595 ms mais alta e um p95 947 ms mais alto do que Core ML Parakeet com limpeza desativada.
O piloto exclui fala humana, sotaques, fala multilíngue, captura de microfone ao vivo, ordem térmica controlada, observação de rede, dispositivos adicionais e produtos de terceiros.
Baixar pesos de modelo é a parte fácil. Um sistema de ditado útil deve capturar áudio de forma confiável, escolher o tempo de execução correto, preparar a fala para esse modelo, detectar saída incompleta, preservar a intenção do usuário e colocar o resultado onde quer que esteja trabalhando.
O Yaps transforma modelos de fala locais capazes em uma única ferramenta privada que as pessoas podem usar em seus aplicativos diários, sem montar servidores de modelo, scripts, pipelines de áudio ou etapas de exportação.
Um atalho ou teclado móvel inicia uma gravação privada sem mover o usuário para uma ferramenta de transcrição separada.
O Yaps aplica detecção de fala, tratamento de silêncio e preparação de áudio em formato de dispositivo antes do reconhecimento.
O aplicativo seleciona um mecanismo local instalado para o dispositivo, idioma, preferência de qualidade e hardware disponível.
Parakeet, Cohere, Whisper, ou uma rota especializada converte o áudio preparado em texto candidato.
Verificações de integridade, caminhos de resgate, manipulação de vocabulário e limpeza local protegem o resultado entregue.
O texto finalizado é enviado no cursor ou no fluxo de trabalho do teclado móvel, pronto para uso imediato.
Este contexto de produto explica por que o relatório distingue as configurações de limpeza e o estágio de saída medido. Não há evidência de que Yaps seja o melhor e não transforma o posicionamento do produto em um resultado de referência.
Esses estudos complementares usaram diferentes dispositivos, corpora, métricas e protocolos de teste. Seus números explicam as decisões atuais sobre produtos, mas não devem ser combinados em um único placar.
Uma preparação mais ampla do M1 Max usou 144 clipes sintéticos em 24 idiomas e 65 clipes FLEURS humanos em 13 idiomas. No subconjunto humano de 20 clipes compartilhado por Cohere e todos os modelos, Cohere registrou 4,2% de WER auditado contra 12,0% para MLX Parakeet.
Em um laptop Ryzen 7 5700U Windows, Cohere e ONNX Parakeet executaram os mesmos 70 clipes FLEURS humanos em 14 idiomas. Cohere retornou 70 transcrições não vazias;Periquito retornou 61. Cohere venceu 12 de 14 comparações automatizadas de idiomas, mas obteve média de 3,654 segundos por clipe contra 1,394 segundos de Parakeet.
Um pacote FastConformer árabe rodava em um Pixel 10 Pro. Excluindo um par de referência inválido, 39 clipes FLEURS produziram 9,8% WER e 4,1% CER, com mediana de 624 ms e 984 ms p95. Uma fatia MASC mais ampla, limpa e barulhenta na CPU Mac posteriormente obteve 22,5% WER, então a rota permanece como Pré-visualização em vez de se tornar uma reivindicação geral em árabe.
Evidência atualO piloto atual de 20 luminárias, além de um modelo separado de 144 sintéticos e 65 humanos multilíngues.
Próxima porta de evidênciasAdicione fala espontânea, mais gerações de Mac, ordem térmica controlada e captura de microfone ao vivo.
Evidência atualUma validação FLEURS humana separada de 70 clipes e 14 idiomas comparou Cohere e ONNX Parakeet no Windows 11.
Próxima porta de evidênciasPublique linhas higienizadas sob o protocolo congelado e adicione menos memória e classes de GPU adicionais.
Evidência atualUma avaliação do Pixel 10 Pro mediu um pacote FastConformer árabe e testou a direção real do teclado.
Próxima porta de evidênciasAdicione fala em dialeto espontâneo, mais níveis de telefone, paridade de rota em inglês, bateria e medições de uso sustentado.
Evidência atualYaps está disponível no Linux, mas este relatório não contém uma precisão de relatório nativa do Linux ou execução de latência.
Próxima porta de evidênciasExecute a reprodução nativa do dispositivo Ubuntu, ditado do pacote instalado, caminhos de CPU e Vulkan, X11 e Wayland .
Evidência atualO Yaps está disponível para iOS, mas este relatório ainda não inclui um benchmark de dispositivos iPhone.
Próxima porta de evidênciasMeça a extensão real do teclado, carregamento do modelo, pressão de memória, uso de energia e latência de commit ponta a ponta.
Quantas palavras de referência são substituídas, inseridas ou excluídas após a normalização determinística?
Uma transcrição perde palavras ou frases inteiras e ainda parece fluente o suficiente para escapar de uma revisão rápida?
Quanto tempo leva o processamento em uma distribuição, e não apenas na execução mais rápida?
Quais conexões e cargas úteis são observadas durante um fluxo de trabalho definido, com os limites de observação de pacotes declarados claramente?
O piloto distingue configurações de limpeza semântica, pontua a saída final do avaliador, relata substituições, inserções e exclusões de forma independente e mantém o conteúdo do discurso privado fora da divulgação pública. Sistemas comparáveis recebem os mesmos bytes de áudio onde suas interfaces permitem; caminhos de captura incompatíveis pertencem a estratos claramente separados.