Pular para o conteúdo

Estado do Ditado Privado · 2026

Meça o que a ditado deixa de fora.

Precisão, exclusões, latência e comportamento de rede observável em ferramentas de fala no dispositivo. Estamos publicando o método, os limites e os dados higienizados ao lado dos números.

01 · Resultados do piloto

Os primeiros números, à vista.

Com a limpeza local habilitada, o piloto registrou um tempo médio de processamento de 1.124 ms e uma taxa de erro de palavras de 3,46%. Os mesmos 20 acessórios sintéticos limpos foram decodificados três vezes por pista em um M1 Max MacBook Pro usando Yaps 2.3.2129. Valores mais baixos de erro e latência são melhores nesta configuração exata. Estas são configurações Yaps, não produtos concorrentes.

Jogos
20
Corridas por pista
60
Palavras, com repetições
1,473
Origem da fala
Sintético
Teste o dispositivo
1
Erro de agregação
Micro
Limpeza em60 executa

Core ML Parakeet + limpeza local

Micro WER
3.46%
Taxa de exclusão
0.41%
Processamento de mediana
1,124 ms
processamento p95
2,807 ms
Processamento máximo
2,958 ms
Limpeza desativada60 executa

Core ML Parakeet, limpeza off

Micro WER
3.67%
Taxa de exclusão
0.20%
Processamento de mediana
250 ms
processamento p95
722 ms
Processamento máximo
1,863 ms
Limpeza desativada60 executa

Whisper Base, limpeza de

Micro WER
6.52%
Taxa de exclusão
0.41%
Processamento de mediana
844 ms
processamento p95
1,669 ms
Processamento máximo
2,189 ms

O tempo de processamento inclui reconhecimento, finalização do pipeline e limpeza local quando habilitado. Exclui a construção inicial do tempo de execução, carregamento de fixtures, gravação ao vivo, envio de atalhos e inserção de cursor. Todas as pistas pontuam o resultado final do avaliador; As pistas de limpeza ainda podem aplicar alterações de vocabulário e formatação.

A latência usa 60 amostras de decodificação igualmente ponderadas por pista e quantis lineares R-7. Os 20 equipamentos contêm 491 posições de palavras de referência por passagem, contadas três vezes no denominador de 1.473 palavras. As repetições não são declarações independentes. As falhas no limite de qualidade permanecem incluídas: 3 com Core ML limpeza ativada, 3 com Core ML limpeza desativada e 6 com Whisper.

Interpretação corrigida em 6 de setembro de 2026. Os números originais permanecem inalterados. Leia a auditoria de evidências, referências externas, demais limitações e instruções de reprodução.

O que este piloto suporta

Uma observação de limpeza correspondente.

Nessas execuções, Whisper Base com limpeza desligada teve 2,85 pontos percentuais mais altos WER, taxa de exclusão 0,20 pontos mais alta, uma mediana 595 ms mais alta e um p95 947 ms mais alto do que Core ML Parakeet com limpeza desativada.

O que não suporta

Um produto geral ou reivindicação de privacidade.

O piloto exclui fala humana, sotaques, fala multilíngue, captura de microfone ao vivo, ordem térmica controlada, observação de rede, dispositivos adicionais e produtos de terceiros.

02 · Camada de produto

Um modelo não é uma experiência de ditado.

Por que Yaps pertence ao relatório

Baixar pesos de modelo é a parte fácil. Um sistema de ditado útil deve capturar áudio de forma confiável, escolher o tempo de execução correto, preparar a fala para esse modelo, detectar saída incompleta, preservar a intenção do usuário e colocar o resultado onde quer que esteja trabalhando.

O Yaps transforma modelos de fala locais capazes em uma única ferramenta privada que as pessoas podem usar em seus aplicativos diários, sem montar servidores de modelo, scripts, pipelines de áudio ou etapas de exportação.
01

Capturar

Um atalho ou teclado móvel inicia uma gravação privada sem mover o usuário para uma ferramenta de transcrição separada.

02

Preparar

O Yaps aplica detecção de fala, tratamento de silêncio e preparação de áudio em formato de dispositivo antes do reconhecimento.

03

Rota

O aplicativo seleciona um mecanismo local instalado para o dispositivo, idioma, preferência de qualidade e hardware disponível.

04

Reconhecer registro

Parakeet, Cohere, Whisper, ou uma rota especializada converte o áudio preparado em texto candidato.

05

Guarda

Verificações de integridade, caminhos de resgate, manipulação de vocabulário e limpeza local protegem o resultado entregue.

06

Entregar

O texto finalizado é enviado no cursor ou no fluxo de trabalho do teclado móvel, pronto para uso imediato.

Este contexto de produto explica por que o relatório distingue as configurações de limpeza e o estágio de saída medido. Não há evidência de que Yaps seja o melhor e não transforma o posicionamento do produto em um resultado de referência.

03 · Evidências mais amplas

O programa de pesquisa já é maior que um piloto.

Esses estudos complementares usaram diferentes dispositivos, corpora, métricas e protocolos de teste. Seus números explicam as decisões atuais sobre produtos, mas não devem ser combinados em um único placar.

Apple Silicon · multilíngueEstudo relacionado

Cohere altera a conversa de roteamento.

Uma preparação mais ampla do M1 Max usou 144 clipes sintéticos em 24 idiomas e 65 clipes FLEURS humanos em 13 idiomas. No subconjunto humano de 20 clipes compartilhado por Cohere e todos os modelos, Cohere registrou 4,2% de WER auditado contra 12,0% para MLX Parakeet.

Cohere WER
4.2%
MLX Parakeet
12.0%
Clipes humanos correspondentes
20
Cohere oferece suporte a um conjunto de idiomas mais restrito e requer um idioma antecipado. Cinco clipes por idioma continuam sendo uma evidência direcional, e não uma reivindicação universal de qualidade.
Windows 11 · CohereEstudo relacionado

Maior confiabilidade multilíngue, com custo de latência.

Em um laptop Ryzen 7 5700U Windows, Cohere e ONNX Parakeet executaram os mesmos 70 clipes FLEURS humanos em 14 idiomas. Cohere retornou 70 transcrições não vazias;Periquito retornou 61. Cohere venceu 12 de 14 comparações automatizadas de idiomas, mas obteve média de 3,654 segundos por clipe contra 1,394 segundos de Parakeet.

Cohere não vazio
70/70
Parakeet não vazio
61/70
Cohere significa
3.654 s
As pontuações de idioma permanecem direcionais até que cada diferença diferente de zero receba julgamento manual completo. As linhas higienizadas ainda não fazem parte deste lançamento público.
Android · Visualização em árabeEstudo relacionado

A velocidade do dispositivo pode diminuir enquanto a cobertura do corpus ainda falha.

Um pacote FastConformer árabe rodava em um Pixel 10 Pro. Excluindo um par de referência inválido, 39 clipes FLEURS produziram 9,8% WER e 4,1% CER, com mediana de 624 ms e 984 ms p95. Uma fatia MASC mais ampla, limpa e barulhenta na CPU Mac posteriormente obteve 22,5% WER, então a rota permanece como Pré-visualização em vez de se tornar uma reivindicação geral em árabe.

Clipes válidos
39
Decodificação mediana
624ms
decodificação p95
984 ms
O resultado do telefone abrange a fala lida, não o MSA espontâneo e o uso de dialeto. O resultado MASC mais amplo é o motivo pelo qual o aplicativo mantém a rota explicitamente rotulada como Visualização.
04 · Cobertura da plataforma

Mostre as lacunas em vez de ocultá-las.

macOS · Apple Silicon

Publicado piloto

Evidência atualO piloto atual de 20 luminárias, além de um modelo separado de 144 sintéticos e 65 humanos multilíngues.

Próxima porta de evidênciasAdicione fala espontânea, mais gerações de Mac, ordem térmica controlada e captura de microfone ao vivo.

Windows · x64

Evidências relacionadas

Evidência atualUma validação FLEURS humana separada de 70 clipes e 14 idiomas comparou Cohere e ONNX Parakeet no Windows 11.

Próxima porta de evidênciasPublique linhas higienizadas sob o protocolo congelado e adicione menos memória e classes de GPU adicionais.

Android · ARM64

Evidências relacionadas

Evidência atualUma avaliação do Pixel 10 Pro mediu um pacote FastConformer árabe e testou a direção real do teclado.

Próxima porta de evidênciasAdicione fala em dialeto espontâneo, mais níveis de telefone, paridade de rota em inglês, bateria e medições de uso sustentado.

Linux · x64

Lacuna de pesquisa

Evidência atualYaps está disponível no Linux, mas este relatório não contém uma precisão de relatório nativa do Linux ou execução de latência.

Próxima porta de evidênciasExecute a reprodução nativa do dispositivo Ubuntu, ditado do pacote instalado, caminhos de CPU e Vulkan, X11 e Wayland .

iOS · ARM64

Lacuna de pesquisa

Evidência atualO Yaps está disponível para iOS, mas este relatório ainda não inclui um benchmark de dispositivos iPhone.

Próxima porta de evidênciasMeça a extensão real do teclado, carregamento do modelo, pressão de memória, uso de energia e latência de commit ponta a ponta.

05 · Pergunta de pesquisa

Uma transcrição fluente ainda pode estar errada.

01

Precisão

Quantas palavras de referência são substituídas, inseridas ou excluídas após a normalização determinística?

02

Exclusão silenciosa

Uma transcrição perde palavras ou frases inteiras e ainda parece fluente o suficiente para escapar de uma revisão rápida?

03

Responsividade

Quanto tempo leva o processamento em uma distribuição, e não apenas na execução mais rápida?

04

Comportamento da rede

Quais conexões e cargas úteis são observadas durante um fluxo de trabalho definido, com os limites de observação de pacotes declarados claramente?

06 · Design da publicação

Evidência que você pode seguir até sua fonte.

O piloto distingue configurações de limpeza semântica, pontua a saída final do avaliador, relata substituições, inserções e exclusões de forma independente e mantém o conteúdo do discurso privado fora da divulgação pública. Sistemas comparáveis ​​recebem os mesmos bytes de áudio onde suas interfaces permitem; caminhos de captura incompatíveis pertencem a estratos claramente separados.

01Corpus público ou consentido congelado
02Sistema, modelo e dispositivo declarados
03Execuções repetidas com falhas retidas
04Word-nível S/I/D alinhamento
05Linhas e agregados públicos sem conteúdo
07 · Leia o registro

Inspecione o método e cada linha pública.

Estado do Ditado Privado 2026Método versão 0.1.0Somente evidência pilotoProjetado e publicado por Yaps