Liberdade de expressão para texto, diretamente no seu browser.
Toque no microfone, fale normalmente e observe-o se transformar em texto. O modelo de fala é baixado uma vez e depois executado em sua própria máquina, portanto, nenhum áudio é carregado, não há conta e não há limite de tempo.
Funciona na sua máquina · Sua voz nunca sai deste dispositivo
Iniciando digitação por voz
Só estou me preparando…
Sobre esta ferramenta
Como funciona a digitação por voz online sem carregar sua voz
Quando a página carrega, ela baixa um modelo de reconhecimento de fala chamado Whisper em seu navegador. É o tamanho base, quantizado em int8, e chega a cerca de 80 MB. Uma barra de progresso mostra o download. O modelo viaja até você em vez de sua voz viajar para um servidor.
Depois disso, a ferramenta é push to talk. Você toca no microfone, seu navegador pede permissão para microfone e um medidor de nível mostra que está ouvindo você. Toque novamente e a gravação vai direto para o modelo em execução na mesma aba. O áudio é tratado em janelas de 30 segundos com uma sobreposição de 5 segundos, para que um longo período de conversa não seja interrompido no meio da frase.
Onde o seu navegador suporta WebGPU, o modelo roda na placa gráfica e é várias vezes mais rápido. Onde isso não acontece, ele recorre ao WebAssembly na CPU, que é mais lento, mas ainda funciona. Seu navegador armazena em cache os arquivos do modelo após a primeira execução, para que as visitas posteriores comecem imediatamente. Uma contagem de palavras e um número aproximado de palavras por minuto ficam acima da caixa de texto.
Digitação por voz sem upload, sem inscrição e sem conta
A maioria dos sites gratuitos de digitação por voz assume um de dois formatos. Alguns gravam seu áudio e o publicam em seus servidores para transcrição. Outros chamam o reconhecimento de voz integrado ao Chrome ou Edge, que envia o áudio para o serviço do fornecedor do navegador. De qualquer forma, sua voz sai da sua máquina e você confia em uma política de privacidade que não escreveu.
Esta página tem um formato diferente. Não há upload, nem conta, nem servidor de transcrição. O arquivo do modelo é um download estático e a transcrição é executada na guia à sua frente. Você pode verificar isso sozinho. Carregue a página, espere a modelo chegar, desligue o wifi e continue ditando. Continua funcionando, porque o reconhecimento nunca foi pela rede.
Essa estrutura também tem efeitos práticos. Nada é medido, então não há limite de minutos, limite diário e nenhum mural solicitando que você se inscreva no meio de uma gravação. Isso também significa que não podemos ler, armazenar ou perder sua transcrição. Se você fechar a guia, o texto desaparecerá, então copie ou baixe tudo o que deseja manter.
Como usar a ferramenta de digitação por voz, passo a passo
Aguarde o download do modelo terminar. O botão do microfone permanece inativo até que esteja pronto, porque não há nada para transcrever antes disso. Em uma conexão normal, isso leva alguns segundos e só acontece na sua primeira visita.
Toque no microfone. Na primeira vez, seu navegador pedirá permissão para usar o microfone. Permita. Observe o movimento do medidor de nível enquanto você fala, que é a maneira mais rápida de confirmar se o dispositivo de entrada correto está selecionado. Se o medidor estiver plano, altere sua entrada nas configurações de som do sistema e recarregue.
Fale no seu ritmo normal. Não há necessidade de desacelerar ou enunciar demais, e gritar piora os resultados em vez de melhorar. Toque no microfone novamente quando terminar um pensamento. O texto aparece na caixa abaixo.
Você pode continuar. Cada nova gravação é adicionada ao final do que já existe, para que você possa ditar em pequenos intervalos. A caixa é um campo editável normal, então corrija o que quiser e copie-o ou baixe-o como um arquivo .txt.
Quão preciso é e com quais idiomas e sotaques ele suporta?
O modelo é multilíngue e detecta o idioma automaticamente, para que você possa começar a falar sem escolher nada no menu. Na prática, isso abrange a maioria dos principais idiomas e é visivelmente mais forte naqueles com mais dados de treinamento, sendo o inglês o principal deles.
Seja realista quanto ao tamanho do modelo. Esta é a base do Whisper, escolhida porque um download de 80 MB é algo que o visitante realmente esperará. É bom na fala conectada comum e suporta uma variedade de sotaques, mas não é o maior modelo disponível e cometerá mais erros do que um modelo dez vezes maior. Nomes próprios, nomes de produtos, jargões técnicos e nomes de pessoas são onde isso ocorre com mais frequência.
Uma sala silenciosa e um microfone decente ajudam mais do que qualquer outra coisa que você possa mudar. Os microfones dos laptops captam o ruído do teclado e o eco da sala, e ambos pioram o texto. Se você dita muito, um fone de ouvido barato é a maior atualização disponível para você.
Para que as pessoas usam a digitação por voz gratuita
O uso mais comum é um primeiro rascunho. Para a maioria das pessoas, falar é mais rápido do que digitar, e um rascunho falado que você edita tende a superar uma página em branco. Ensaios, postagens em blogs, cartas de apresentação, e-mails longos, entradas de diário e notas de reuniões funcionam bem dessa maneira.
É também uma ferramenta de acessibilidade simples. Se a digitação for dolorosa, se você tiver uma lesão ou se o teclado estiver simplesmente lento para você, ditar em uma guia do navegador não precisa de instalação, direitos de administrador e nenhuma compra. Isso é importante em um laptop de trabalho bloqueado ou em uma máquina de biblioteca compartilhada onde você não pode instalar software.
Os alunos o usam para anotações e para obter citações longas rapidamente. As pessoas que escrevem em um segundo idioma geralmente acham mais fácil dizer uma frase do que digitá-la. E é útil como bloco de notas: capture a ideia enquanto a tem e arrume-a depois.
Se o que você tem é uma gravação existente em vez de uma voz ao vivo, esse é um trabalho diferente. Use a ferramenta de áudio para texto para isso.
Digitação por voz offline, sem conexão com a internet
Depois que o modelo estiver no cache do navegador, esta página continuará funcionando sem conexão. A transcrição nunca usou a rede, então um avião, um trem ou um wi-fi de hotel morto não a impede. Você precisa que a própria página carregue, então abra-a antes de perder o sinal.
Duas coisas o levam de volta ao download. Limpar o armazenamento do navegador remove o modelo em cache, e uma janela privada ou anônima geralmente começa com um cache vazio, então busca o arquivo novamente. Navegadores diferentes também mantêm caches separados, então mudar de um para outro significa mais um download.
Esse primeiro download é o único momento em que esta ferramenta precisa da internet. Todo o resto, a gravação, o reconhecimento e o texto, acontece no seu próprio hardware. Vale a pena dizer claramente porque é incomum. A maioria dos sites de ditado gratuitos para de funcionar no momento em que você fica offline, porque o reconhecimento está acontecendo em outro lugar.
Os limites da digitação por voz do navegador e o que o aplicativo de desktop adiciona
Esta ferramenta digita em uma caixa em uma página da web. Esse é o limite honesto. Ele não pode colocar texto em seu editor, cliente de e-mail, Slack ou documento, então você sempre copia o resultado manualmente. Se você quiser ditar outra coisa, este é um trabalho de duas etapas.
O texto também chega depois que você para, e não palavra por palavra enquanto você fala, porque a gravação é transcrita de uma só vez quando você toca novamente no microfone. E não há passe de limpeza. Tudo o que você disse é o que você obtém, incluindo os hums, os falsos começos e a frase que você abandonou no meio.
O aplicativo de desktop Yaps é a mesma ideia no dispositivo, sem esses limites. Você segura uma tecla de atalho, fala em qualquer aplicativo em que já esteja e o texto chega ao seu cursor. Ele limpa palavras de preenchimento e pontuação e funciona offline depois de instalado. Também existe um teclado Android, que é muito melhor adequado para o ditado do telefone do que uma guia do navegador.
Como usar a digitação por voz em seu navegador
Aguarde o download do modelo
Na sua primeira visita a página busca um modelo de reconhecimento de fala de cerca de 80MB e mostra uma barra de progresso. O microfone permanece inativo até que esteja pronto. Seu navegador armazena em cache, então isso só acontece uma vez.
Toque no microfone e permita o acesso ao microfone
Seu navegador pedirá permissão para usar o microfone pela primeira vez. Permita e verifique se o medidor de nível se move quando você fala para saber se o dispositivo de entrada correto está selecionado.
Fale no seu ritmo normal
Fale como você falaria com uma pessoa. Não há necessidade de desacelerar, enunciar demais ou levantar a voz. Uma sala silenciosa e um fone de ouvido oferecem melhores resultados do que um microfone de laptop em um espaço com eco.
Toque no microfone novamente para parar
A gravação é transcrita no seu aparelho e o texto aparece na caixa abaixo. Cada nova gravação é adicionada ao final, para que você possa ditar em sequências curtas em vez de uma tomada longa.
Edite e copie ou baixe
A caixa de texto é totalmente editável, então corrija qualquer erro que o modelo tenha feito. Em seguida, copie o texto para a área de transferência ou baixe-o como um arquivo .txt. Nada é salvo quando você fecha a guia.
Perguntas
Esta ferramenta de digitação por voz é realmente gratuita?
Sim, e não há nada para se inscrever. A ferramenta funciona em sua própria máquina, portanto não há fatura de transcrição para repassarmos a você. Não há limite de minutos, limite diário e nenhum teste que termine.
Minha voz é carregada em algum lugar?
Não. O modelo de reconhecimento de fala é baixado no seu navegador na primeira vez que você visita e tudo depois disso é executado no seu dispositivo. O áudio do seu microfone nunca sai da sua máquina. Não há servidor de transcrição para o qual ele possa ser enviado. Você pode confirmar desligando o wi-fi assim que o modelo for baixado e ditando mesmo assim.
Preciso instalar alguma coisa?
Não. É uma página da web. O único download é o próprio modelo de fala, que seu navegador busca e armazena em cache automaticamente e que você nunca vê como um arquivo em seu computador.
Por que há uma espera na primeira vez que abro a página?
A ferramenta baixa um modelo de reconhecimento de fala de cerca de 80 MB antes de poder transcrever qualquer coisa. Uma barra de progresso mostra o quão avançado está. Seu navegador o armazena em cache posteriormente, para que cada visita posterior comece imediatamente.
A digitação por voz funciona sem conexão com a Internet?
Sim, uma vez que o modelo esteja armazenado em cache. O reconhecimento nunca utilizou a rede, por isso continua funcionando offline. Você precisa de uma conexão para a primeira visita e para carregar a própria página. Limpar os dados do navegador ou usar uma janela privada significa que o modelo será baixado novamente.
Por que o texto não aparece enquanto ainda estou falando?
A ferramenta grava primeiro e transcreve quando você toca no microfone novamente, para que o texto chegue de uma só vez, em vez de palavra por palavra. Ditar em rajadas curtas oferece algo próximo à digitação ao vivo, já que cada nova gravação é adicionada ao final do que já está lá.
Posso usar isso para digitar no Google Docs, Word ou no meu e-mail?
Não diretamente. Esta página é digitada apenas em sua própria caixa de texto, então você copia o resultado manualmente. Ditar diretamente em qualquer aplicativo é o que o aplicativo de desktop Yaps faz: você segura uma tecla de atalho e o texto chega ao seu cursor onde quer que você esteja.
Adiciona pontuação e letras maiúsculas?
O modelo escreve o que ouve, incluindo pontuação básica, mas não há correção posterior. Palavras de preenchimento, palavras repetidas e frases abandonadas aparecem conforme você as diz. O aplicativo de desktop limpa isso enquanto você fala.
Quanto tempo posso falar de uma só vez?
Não há limite definido. O áudio longo é processado em janelas de 30 segundos com sobreposição para que as frases não sejam cortadas pela metade. O limite prático é a paciência: quanto mais longa a gravação, maior será a pausa após parar enquanto ela é transcrita.
Quais idiomas ele atende?
O modelo é multilíngue e detecta o idioma automaticamente, para que você possa começar a falar. É mais forte em inglês e nas outras línguas amplamente faladas, e comete mais erros em línguas com menos dados de formação.
Funciona em um telefone?
Ele roda em navegadores móveis, mas o download do modelo e o processamento no dispositivo são visivelmente mais lentos do que em um laptop. No Android, o teclado Yaps é uma experiência muito melhor porque o ditado está integrado no próprio teclado.
O que acontece com meu texto quando fecho a guia?
Ele desaparece. Nada é salvo em uma conta, porque não há conta e nenhum lugar para enviar seu texto. Copie o texto ou baixe-o como um arquivo .txt antes de sair da página, se quiser mantê-lo.
Mais ferramentas gratuitas
Agora faça isso everywhere.
Uma chave, qualquer aplicativo, limpa enquanto você fala.
Requer macOS 13.0+ (Apple Silicon recomendado)iOS em breve