Voz a texto

Dicta con el micrófono y mira cómo se escribe el texto mientras hablas, o transcribe una grabación, una nota de voz o un video. Los archivos se procesan en tu dispositivo y no se suben a ningún servidor.

Los archivos se transcriben en tu dispositivo. El dictado en vivo lo hace tu navegador, que puede usar el servicio de Google o Microsoft.

Modo

Listo para dictar. Pulsa el botón y empieza a hablar.

¿Qué puedo decir?
«punto»
.
«coma»
,
«punto y coma»
;
«dos puntos»
:
«puntos suspensivos»
…
«signo de interrogación»
? (agrega el ¿ solo)
«signo de exclamación»
! (agrega el ¡ solo)
«abrir paréntesis / cerrar paréntesis»
( )
«abrir comillas / cerrar comillas»
" "
«nueva línea»
salto de línea
«punto y aparte»
punto y párrafo nuevo
«nuevo párrafo»
párrafo nuevo
Paso a paso

Cómo se usa

  1. Elige «Dictado en vivo» para hablar al micrófono o «Archivo de audio» para transcribir una grabación o un video.
  2. En vivo, pulsa «Empezar a dictar», permite el micrófono y habla. Di «coma», «punto» o «nueva línea» para puntuar.
  3. Con un archivo, arrástralo, elige la calidad y el idioma, y pulsa «Transcribir». La primera vez se descarga el modelo.
  4. Corrige el texto en el cuadro y cópialo o descárgalo en .txt. Si transcribiste un archivo, también puedes bajar subtítulos en .srt o .vtt.
FAQ

Preguntas frecuentes

¿Mi voz o mi audio se envían a algún servidor?

Depende del modo. En el dictado en vivo el reconocimiento lo hace tu navegador: en Chrome y Edge el audio viaja al servicio de Google o de Microsoft, y en Safari lo procesa Apple. Esta página no recibe ni guarda tu voz. Los archivos se transcriben en tu dispositivo con un modelo que se descarga una vez: nunca se sube el audio.

¿Por qué el dictado en vivo no funciona en Firefox?

Firefox todavía no incluye el reconocimiento de voz que usan las páginas web. Abre esta página en Chrome, Edge o Safari para dictar. En Firefox sí puedes usar «Archivo de audio»: graba tu voz con la grabadora de voz y transcribe el archivo.

¿Cómo agrego puntos, comas y signos de pregunta al dictar?

Dilos en voz alta: «coma», «punto», «punto y coma», «dos puntos», «signo de interrogación», «signo de exclamación», «nueva línea», «nuevo párrafo», «abrir paréntesis» y «cerrar paréntesis». El ¿ y el ¡ se agregan solos al principio de la oración. Puedes desactivar los comandos si prefieres que las palabras salgan tal cual.

¿Qué archivos puedo transcribir y cuánto tarda?

MP3, WAV, M4A, OGG, WEBM, MP4 y otros formatos de audio o video que tu navegador pueda leer, de hasta 60 minutos y 300 MB. El tiempo depende de tu dispositivo: el modelo Rápido suele tardar menos que la duración del audio en una computadora reciente, y el Preciso más. Mientras trabaja verás el avance y el tiempo que falta, y puedes cancelar.

¿Por qué se descarga un modelo y cuánto pesa?

Para transcribir sin subir tu audio hace falta un modelo de reconocimiento (Whisper) que corre en tu navegador. La primera vez se descargan unos 60 MB con el modelo Rápido o unos 95 MB con el Preciso, incluido el motor. Después quedan guardados en tu navegador y no se vuelven a bajar. El Preciso entiende mejor el español, los nombres propios y las voces bajas.

El navegador no me pide permiso para el micrófono. ¿Qué hago?

Si lo bloqueaste antes, pulsa el candado o el ícono de ajustes junto a la dirección de la página, permite el micrófono y vuelve a intentar. En el celular, revisa también los permisos del navegador en los ajustes del sistema. Si el dictado se corta solo tras un silencio, la herramienta lo reactiva y el texto ya dictado no se pierde.

Dos formas de pasar la voz a texto

Dictado en vivo: hablas y el texto aparece al instante. Funciona mejor con un micrófono cercano, poco ruido de fondo y frases completas. No hace falta hacer pausas entre palabras: el reconocimiento entiende mejor las frases enteras que las palabras sueltas.

Archivo de audio: eliges una grabación, una nota de voz o un video y la herramienta la transcribe con el modelo Whisper, sin enviarla a ningún servidor. Sirve para entrevistas, clases, reuniones y mensajes de WhatsApp. Puedes escuchar cada fragmento tocando su hora, corregir el texto y bajar subtítulos .srt o .vtt.

Comandos de puntuación en el dictado

  • Signos: «coma», «punto», «punto y coma», «dos puntos», «puntos suspensivos».
  • Preguntas y exclamaciones: «signo de interrogación» y «signo de exclamación». El signo de apertura se agrega solo.
  • Estructura: «nueva línea», «nuevo párrafo» y «punto y aparte».
  • Paréntesis y comillas: «abrir paréntesis», «cerrar paréntesis», «abrir comillas», «cerrar comillas».

Si en tu texto aparece la palabra «punto» o «coma» con su significado normal, desactiva los comandos de puntuación.

Privacidad y créditos

Esta página no recibe tu voz ni tu texto. El dictado en vivo lo hace el reconocimiento de tu navegador, que suele enviar el audio a los servidores de su fabricante. Para transcribir archivos usamos los modelos Whisper de OpenAI (licencia MIT) con Transformers.js (Apache-2.0) y ONNX Runtime Web (MIT); se descargan desde Hugging Face y jsDelivr la primera vez y quedan en tu navegador.

Actualizada el 30 de septiembre de 2026