Saltar al contenido

Libertad de voz a texto, directamente en tu browser.

Toca el micrófono, habla normalmente y observa cómo se convierte en texto. El modelo de voz se descarga una vez y luego se ejecuta en su propia máquina, por lo que no se carga ningún audio, no hay cuenta y no hay límite de tiempo.

Se ejecuta en tu máquina · Tu voz nunca sale de este dispositivo

Iniciando escritura por voz

Recién preparándonos...

0 words
Nada todavía: el micrófono está arriba.

Acerca de esta herramienta

Cómo funciona la escritura por voz en línea sin cargar tu voz

Cuando se carga la página, descarga un modelo de reconocimiento de voz llamado Whisper en su navegador. Es el tamaño base, cuantificado a int8, y ronda los 80 MB. Una barra de progreso muestra la descarga. El modelo viaja hacia usted en lugar de que su voz viaje a un servidor.

Después de eso, la herramienta es pulsar para hablar. Tocas el micrófono, tu navegador solicita permiso para el micrófono y un medidor de nivel muestra que te está escuchando. Toque nuevamente y la grabación irá directamente al modelo que se ejecuta en la misma pestaña. El audio se maneja en ventanas de 30 segundos con una superposición de 5 segundos, por lo que una conversación larga no se interrumpe a mitad de una frase.

Cuando su navegador admite WebGPU, el modelo se ejecuta en la tarjeta gráfica y es varias veces más rápido. Cuando no es así, recurre a WebAssembly en la CPU, que es más lento pero aún funciona. Su navegador almacena en caché los archivos del modelo después de la primera ejecución, por lo que las visitas posteriores comienzan inmediatamente. Un recuento de palabras y una cifra aproximada de palabras por minuto se encuentran encima del cuadro de texto.

Dictado por voz sin carga, sin registro y sin cuenta

La mayoría de los sitios gratuitos de escritura por voz adoptan una de dos formas. Algunos graban su audio y lo publican en sus servidores para su transcripción. Otros llaman al reconocimiento de voz integrado en Chrome o Edge, que envía el audio al servicio del proveedor del navegador. De cualquier manera, su voz sale de su máquina y confía en una política de privacidad que no escribió.

Esta página tiene una forma diferente. No hay carga, ni cuenta ni servidor de transcripción. El archivo del modelo es una descarga estática y la transcripción se ejecuta en la pestaña que se encuentra frente a usted. Puedes comprobarlo tú mismo. Carga la página, espera a que llegue el modelo, luego apaga tu wifi y sigue dictando. Sigue funcionando, porque el reconocimiento nunca fue usando la red.

Esa estructura también tiene efectos prácticos. Nada está medido, por lo que no hay límite de minutos, límite diario ni muro que le solicite registrarse a mitad de una grabación. También significa que no podemos leer, almacenar ni perder su transcripción. Si cierras la pestaña, el texto desaparecerá, así que copia o descarga todo lo que quieras conservar.

Cómo utilizar la herramienta de escritura por voz, paso a paso

Espere a que el modelo termine de descargarse. El botón del micrófono permanece inactivo hasta que esté listo, porque no hay nada que transcribir antes de esa fecha. En una conexión normal, esto tarda unos segundos y sólo ocurre en la primera visita.

Toca el micrófono. La primera vez, su navegador le pedirá permiso para utilizar el micrófono. Permítelo. Observe cómo se mueve el medidor de nivel mientras habla, que es la forma más rápida de confirmar que está seleccionado el dispositivo de entrada correcto. Si el medidor está plano, cambie su entrada en la configuración de sonido de su sistema y vuelva a cargar.

Habla a tu ritmo normal. No hay necesidad de reducir el ritmo ni de pronunciar demasiado, y gritar empeora los resultados en lugar de mejorarlos. Toca el micrófono nuevamente cuando termines un pensamiento. El texto aparece en el cuadro de abajo.

Puedes seguir adelante. Cada nueva grabación se agrega al final de lo que ya está ahí, para que puedas dictar en ráfagas cortas. El cuadro es un campo editable normal, así que corrige lo que quieras y luego cópialo o descárgalo como un archivo .txt.

¿Qué tan preciso es y qué idiomas y acentos maneja?

El modelo es multilingüe y detecta el idioma automáticamente, por lo que puedes empezar a hablar sin tener que elegir nada del menú. En la práctica, esto cubre la mayoría de los idiomas principales y es notablemente más fuerte en los que tienen más datos de capacitación, entre ellos el inglés.

Sea realista sobre el tamaño del modelo. Esta es la base de Whisper, elegida porque una descarga de 80 MB es algo que un visitante realmente esperará. Es bueno para el habla normal y corriente y soporta una variedad de acentos, pero no es el modelo más grande disponible y cometerá más errores que uno que sea diez veces más grande. Los nombres propios, los nombres de productos, la jerga técnica y los nombres de personas son los lugares donde se desliza con mayor frecuencia.

Una habitación tranquila y un micrófono decente ayudan más que cualquier otra cosa que puedas cambiar. Los micrófonos de las computadoras portátiles captan el ruido del teclado y el eco de la habitación, y ambos empeoran el texto. Si dicta mucho, unos auriculares baratos son la mayor mejora disponible para usted.

Para qué usa la gente el dictado por voz gratuito

El uso más común es un primer borrador. Hablar es más rápido que escribir para la mayoría de las personas, y un borrador hablado que luego editas tiende a ser mejor que una página en blanco. Los ensayos, las publicaciones de blogs, las cartas de presentación, los correos electrónicos largos, las anotaciones en diarios y las notas de reuniones funcionan bien de esta manera.

También es una herramienta de accesibilidad sencilla. Si escribir le resulta doloroso, si tiene una lesión o si un teclado simplemente le resulta lento, dictar en una pestaña del navegador no necesita instalación, derechos de administrador ni compra. Eso es importante en una computadora portátil de trabajo bloqueada o en una máquina de biblioteca compartida donde no se puede instalar software.

Los estudiantes lo usan para tomar notas y escribir citas largas rápidamente. A las personas que escriben en un segundo idioma a menudo les resulta más fácil decir una oración que escribirla. Y es útil como bloc de notas: captura la idea mientras la tienes y ordénala después.

Si lo que tienes es una grabación existente en lugar de una voz en vivo, ese es un trabajo diferente. Utilice la herramienta de audio a texto para eso.

Dictado por voz sin conexión, sin conexión a Internet

Una vez que el modelo está en la memoria caché de su navegador, esta página sigue funcionando sin conexión. En primer lugar, la transcripción nunca usó la red, por lo que un avión, un tren o el wifi de un hotel muerto no la detiene. Necesita que la página se cargue, así que ábrala antes de perder la señal.

Dos cosas te devuelven a la descarga. Al borrar el almacenamiento de su navegador se elimina el modelo almacenado en caché, y una ventana privada o de incógnito generalmente comienza con un caché vacío, por lo que recupera el archivo nuevamente. Los diferentes navegadores también mantienen cachés separados, por lo que cambiar de uno a otro significa una descarga más.

Esa primera descarga es el único momento en que esta herramienta necesita Internet. Todo lo demás, la grabación, el reconocimiento y el texto, ocurre en tu propio hardware. Vale la pena decirlo claramente porque es inusual. La mayoría de los sitios de dictado gratuitos dejan de funcionar en el momento en que te desconectas, porque el reconocimiento se produce en otro lugar.

Los límites de la escritura por voz en el navegador y lo que agrega la aplicación de escritorio

Esta herramienta escribe en un cuadro en una página web. Ése es el límite honesto. No puede poner texto en su editor, su cliente de correo electrónico, Slack o un documento, por lo que copia el resultado a mano cada vez. Si desea dictar algo más, este es un trabajo de dos pasos.

El texto también llega después de que te detienes, no palabra por palabra mientras hablas, porque la grabación se transcribe de una sola vez cuando vuelves a tocar el micrófono. Y no hay pase de limpieza. Todo lo que dijiste es lo que obtienes, incluidos los ums, los comienzos en falso y la frase que abandonaste a mitad de camino.

La aplicación de escritorio Yaps es la misma idea en el dispositivo sin esos límites. Mantienes presionada una tecla de acceso rápido, hablas en cualquier aplicación en la que ya estés y el texto llega al cursor. Limpia palabras de relleno y puntuación a medida que avanza, y funciona sin conexión una vez instalado. También hay un teclado de Android, que se adapta mucho mejor al dictado por teléfono que una pestaña del navegador.

Cómo utilizar la escritura por voz en tu navegador

  1. Espere a que se descargue el modelo.

    En su primera visita, la página obtiene un modelo de reconocimiento de voz de aproximadamente 80 MB y muestra una barra de progreso. El micrófono permanece inactivo hasta que esté listo. Su navegador lo almacena en caché, por lo que esto sólo sucede una vez.

  2. Toca el micrófono y permite el acceso al micrófono.

    Su navegador le pedirá permiso para utilizar el micrófono la primera vez. Permítalo, luego verifique que el medidor de nivel se mueva cuando habla para saber que está seleccionado el dispositivo de entrada correcto.

  3. Habla a tu ritmo normal

    Habla como lo harías con una persona. No es necesario reducir la velocidad, pronunciar demasiado o alzar la voz. Una habitación silenciosa y unos auriculares dan mejores resultados que el micrófono de un portátil en un espacio con mucho eco.

  4. Toque el micrófono nuevamente para detener

    La grabación se transcribe en su dispositivo y el texto aparece en el cuadro a continuación. Cada nueva grabación se agrega al final, por lo que puedes dictar en ráfagas cortas en lugar de una toma larga.

  5. Editar, luego copiar o descargar

    El cuadro de texto es completamente editable, así que corrija cualquier error en el modelo. Luego copie el texto a su portapapeles o descárguelo como un archivo .txt. No se guarda nada una vez que cierras la pestaña.

Preguntas

¿Esta herramienta de escritura por voz es realmente gratuita?

Sí, y no hay nada a lo que registrarse. La herramienta se ejecuta en su propia máquina, por lo que no tendremos que pasarle ninguna factura de transcripción. No hay límite de minutos, límite diario ni prueba que finalice.

¿Mi voz está subida a algún lado?

No. El modelo de reconocimiento de voz se descarga en su navegador la primera vez que lo visita, y todo lo posterior se ejecuta en su dispositivo. El audio de su micrófono nunca sale de su máquina. No hay ningún servidor de transcripción al que enviarlo. Puedes confirmarlo apagando tu wifi una vez que el modelo se haya descargado y dictando de todos modos.

¿Necesito instalar algo?

No. Es una página web. La única descarga es el modelo de voz en sí, que su navegador busca y almacena en caché automáticamente, y que nunca verá como un archivo en su computadora.

¿Por qué hay una espera la primera vez que abro la página?

La herramienta descarga un modelo de reconocimiento de voz de aproximadamente 80 MB antes de poder transcribir algo. Una barra de progreso muestra qué tan avanzado está. Su navegador lo almacena en caché después, por lo que cada visita posterior comienza de inmediato.

¿Funciona el dictado por voz sin conexión a Internet?

Sí, una vez que el modelo esté almacenado en caché. El reconocimiento nunca utilizó la red, por lo que sigue funcionando sin conexión. Necesita una conexión para la primera visita y para cargar la página. Borrar los datos de su navegador o usar una ventana privada significa que el modelo se descarga nuevamente.

¿Por qué no aparece el texto mientras sigo hablando?

La herramienta graba primero y transcribe cuando vuelves a tocar el micrófono, por lo que el texto llega de una vez en lugar de palabra por palabra. Dictar en ráfagas cortas le brinda algo parecido a escribir en vivo, ya que cada nueva grabación se agrega al final de lo que ya está allí.

¿Puedo usar esto para escribir en Google Docs, Word o mi correo electrónico?

No directamente. Esta página escribe únicamente en su propio cuadro de texto, por lo que copia el resultado a mano. Dictar directamente en cualquier aplicación es lo que hace la aplicación de escritorio Yaps: mantienes presionada una tecla de acceso rápido y el texto llega al cursor dondequiera que estés.

¿Agrega puntuación y letras mayúsculas?

El modelo escribe lo que escucha, incluida la puntuación básica, pero no hay ningún pase de corrección posterior. Las palabras de relleno, las palabras repetidas y las oraciones abandonadas aparecen a medida que las dices. La aplicación de escritorio lo limpia mientras hablas.

¿Cuánto tiempo puedo hablar de una vez?

No hay un límite establecido. El audio largo se procesa en ventanas de 30 segundos superpuestas para que las oraciones no se corten a la mitad. El límite práctico es la paciencia: cuanto más larga sea la grabación, más larga será la pausa después de detenerla mientras se transcribe.

¿Qué idiomas maneja?

El modelo es multilingüe y detecta el idioma automáticamente, por lo que puedes empezar a hablar. Es más fuerte en inglés y en otros idiomas ampliamente hablados, y comete más errores en idiomas con menos datos de entrenamiento detrás.

¿Funciona en un teléfono?

Se ejecuta en navegadores móviles, pero la descarga del modelo y el procesamiento en el dispositivo son notablemente más lentos que en una computadora portátil. En Android, el teclado Yaps es una experiencia mucho mejor porque el dictado está integrado en el propio teclado.

¿Qué sucede con mi texto cuando cierro la pestaña?

Desaparece. No se guarda nada en una cuenta, porque no hay ninguna cuenta ni ningún lugar al que enviar su mensaje de texto. Copie el texto o descárguelo como un archivo .txt antes de salir de la página si desea conservarlo.

empieza a ladrarMac · Windows · Linux · Android

ahora hazlo everywhere.

Una tecla, cualquier aplicación, limpiada mientras hablas.

Descargar para Mac

Requiere macOS 13.0+ (se recomienda Apple Silicon)iOS próximamente