Transcribir audio
a texto
Transcribe audio a texto gratis online. MP3, WAV, M4A y MP4 se procesan en tu navegador, sin subir archivos.
Arrastra un archivo de audio aquí
o haz clic para buscarlo — MP3, WAV, M4A, OGG, WEBM, MP4 · nada sale de tu dispositivo
Transcribir audio a texto gratis online desde el navegador
Esta herramienta gratuita para transcribir audio a texto convierte grabaciones, entrevistas, reuniones y notas de voz en texto editable. Sube un MP3, WAV, M4A, OGG, WEBM o MP4, elige el idioma hablado y convierte el audio a texto con Whisper Tiny en tu navegador. A diferencia de muchos transcriptores online, tu archivo no se sube a un servidor.
Añade tu audio
Arrastra un archivo MP3, WAV, M4A, OGG, WEBM o MP4 a la zona de carga, o haz clic para buscarlo. El audio se carga directamente en la página: nunca se envía a ningún servidor.
Elige un idioma y transcribe
Elige el idioma hablado o deja la detección automática, y pulsa Transcribir. El modelo Whisper Tiny se descarga una sola vez (unos 40 MB) y luego convierte tu voz en texto en tu propia CPU.
Copia o descarga la transcripción
Lee la transcripción, cópiala al portapapeles o descárgala como archivo .txt, o como subtítulos .srt / .vtt con marcas de tiempo para subtitular vídeos.
Convertir audio a texto gratis
Apunta la herramienta a cualquier grabación con voz y recupera texto editable. Sin teclear a mano, sin desplazarte por la línea de tiempo y sin un servicio de transcripción caro.
Transcribir audio a texto con Whisper AI
El reconocimiento se ejecuta con el modelo Whisper Tiny de OpenAI, una auténtica red neuronal de voz a texto, que corre localmente mediante WebAssembly en lugar de en un servidor.
MP3, WAV, M4A y más
Las notas de voz suelen ser M4A, los podcasts y la música suelen ser MP3, y las grabaciones suelen ser WAV. Todos funcionan, junto con OGG, WEBM y la pista de audio de los vídeos MP4.
Subtítulos con marcas de tiempo
Además de texto plano, exporta archivos de subtítulos SRT y VTT con códigos de tiempo, listos para añadir a un vídeo como subtítulos, todo generado en tu navegador.
Gratis e ilimitado
Un convertidor de audio a texto realmente gratuito: sin cuenta, sin créditos, sin marca de agua y sin límite por minutos. Transcribe tantos archivos como quieras.
Funciona sin conexión tras el primer uso
Una vez que tu navegador guarda el modelo en caché, la transcripción no necesita red en absoluto. La página sigue convirtiendo audio en texto en un avión o detrás de un cortafuegos.
Entrevistas y reuniones
Convierte una entrevista, reunión o clase grabada en texto que puedes buscar, citar, resumir o pegar en tus notas, sin enviar conversaciones sensibles a un servicio en la nube.
Notas de voz y dictado
Convierte una nota de voz rápida, una idea dictada o una grabación del teléfono en texto que puedes editar, para que nunca tengas que volver a teclear lo que ya dijiste en voz alta.
Subtítulos y leyendas
Genera subtítulos SRT o VTT a partir de la pista de audio de un vídeo para subtitular podcasts, tutoriales o clips de redes sociales y hacerlos accesibles.
De MP3 a texto
El formato de audio más habitual para podcasts, música y descargas. Convierte un MP3 en texto sin necesidad de convertir antes el archivo.
De WAV a texto
El formato sin comprimir que producen la mayoría de grabadoras y DAW. WAV no tiene pérdidas, así que suele dar la transcripción más limpia y precisa.
De M4A a texto
El formato en el que guardan las Notas de Voz del iPhone y la mayoría de grabadoras de móvil. Transcribe una nota de voz M4A directamente desde tu dispositivo.
OGG, WEBM y MP4
Las grabaciones de navegador y de apps suelen ser OGG o WEBM, y los vídeos MP4 llevan una pista de audio. Todos se decodifican y transcriben sin necesidad de un paso de conversión aparte.
Un modelo diminuto, y es a propósito
La transcripción se ejecuta con Whisper Tiny, el modelo más pequeño de la familia Whisper de OpenAI: unos 40 MB de pesos cuantizados. Ese tamaño es justo lo que hace viable la transcripción en el navegador: un modelo Whisper grande pesaría varios gigabytes y jamás podría enviarse al navegador de un visitante. El modelo se ejecuta mediante ONNX Runtime Web sobre WebAssembly, así que la misma red neuronal que normalmente correría en un servidor se ejecuta en tu propia CPU. Whisper Tiny sacrifica algo de precisión a cambio de velocidad y tamaño; la voz clara se transcribe bien, mientras que los acentos marcados, el ruido de fondo o las voces superpuestas son más difíciles para cualquier modelo diminuto.
Multilingüe por diseño
Whisper Tiny es un modelo multilingüe (no el tiny.en, que solo reconoce inglés). Reconoce voz en decenas de idiomas, incluidos inglés, chino, japonés, coreano, español, francés, alemán, italiano, portugués, ruso, árabe, hindi y muchos más. Elige el idioma hablado en el selector para obtener los mejores resultados, o deja que Whisper lo detecte automáticamente.
Sin subida, sin servidor
No hay ningún punto de subida ni ninguna llamada a una API que transporte tu audio. La página decodifica el archivo y se lo pasa a un modelo que se ejecuta en la misma pestaña del navegador.
No se guarda nada
Como el audio nunca llega a un servidor, no hay nada que conservar, registrar ni borrar. Cierra la pestaña y desaparece cualquier rastro de la grabación y de su transcripción.
Seguro para grabaciones confidenciales
Entrevistas, sesiones de terapia, llamadas legales y reuniones privadas se pueden transcribir sin que crucen jamás una red, algo que la mayoría de herramientas de transcripción online no puede afirmar con honestidad.
Lo único que se descarga es el modelo
Lo único que viaja por la red es el propio modelo, que se descarga a tu navegador. Los datos van hacia ti, nunca salen de ti.
La mayoría de herramientas de audio a texto suben tu archivo
El típico servicio de transcripción online envía tu grabación a un servidor, ejecuta allí el reconocimiento de voz y te devuelve el texto. Eso significa que tu audio acaba en el disco de otra persona, sujeto a su política de retención. Aquí, la grabación se queda en tu dispositivo.
Sin registro y sin límites por minuto
Los servicios de transcripción en la nube limitan el uso gratuito con topes de minutos, cuotas mensuales o un muro de registro, porque cada minuto les cuesta tiempo de cómputo. La transcripción en el navegador gasta tu CPU, así que no hay nada que medir ni racionar.
Honestos sobre la precisión
Un modelo diminuto sacrifica algo de precisión a cambio de poder ejecutarse localmente. Con voz clara es muy funcional; con audio ruidoso, acentos marcados o hablantes superpuestos, cuenta con corregir alguna palabra. Para una precisión de nivel profesional puede que sigas necesitando un modelo más grande.
01¿Cómo convierto audio a texto?+
Arrastra tu archivo de audio a la caja de la parte superior de esta página, elige el idioma hablado (o deja la detección automática) y haz clic en Transcribir. El modelo de reconocimiento de voz lee el audio y genera una transcripción que puedes copiar o descargar como .txt, .srt o .vtt. No hace falta cuenta ni instalar nada.
02¿Este convertidor de audio a texto es gratis?+
Sí, totalmente gratis e ilimitado. No hay cuenta, ni sistema de créditos, ni marca de agua, ni límite en la cantidad de archivos o minutos que transcribas. La transcripción se ejecuta en tu propio ordenador, así que no hay ningún coste de servidor que repercutirte.
03¿Subís mi audio a un servidor?+
No. Esa es la principal diferencia con la mayoría de convertidores de audio a texto online. Tu archivo lo decodifica directamente la página y lo procesa un modelo que se ejecuta dentro de la pestaña de tu navegador. El audio nunca viaja por la red, así que no hay nada que podamos almacenar ni escuchar.
04¿Qué formatos de audio puedo transcribir?+
MP3, WAV, M4A, OGG, WEBM y MP4, además de AAC y FLAC. Eso cubre notas de voz, podcasts, salidas de grabadora, grabaciones del navegador y la pista de audio de los vídeos. Se aceptan archivos de hasta 200 MB.
05¿Qué idiomas admite?+
Whisper Tiny es multilingüe y reconoce voz en decenas de idiomas, incluidos inglés, chino, japonés, coreano, español, francés, alemán, italiano, portugués, neerlandés, ruso, polaco, ucraniano, indonesio, vietnamita, tailandés, malayo, hindi, árabe, turco, hebreo, griego, checo, sueco, danés, finés y noruego. Elige uno en el selector o deja que se detecte automáticamente.
06¿Qué modelo de reconocimiento de voz utiliza?+
Whisper Tiny, el modelo multilingüe más pequeño de la familia Whisper de OpenAI, con unos 40 MB de pesos cuantizados. Se ejecuta mediante ONNX Runtime Web sobre WebAssembly, íntegramente dentro de tu navegador. Usamos el checkpoint multilingüe, no el tiny.en, que solo reconoce inglés.
07¿Puedo obtener subtítulos con marcas de tiempo?+
Sí. Además de texto plano, puedes descargar la transcripción como archivo de subtítulos .srt o .vtt con códigos de tiempo, listo para añadir a un vídeo como subtítulos. Las marcas de tiempo las genera el modelo mientras transcribe.
08¿Por qué la primera transcripción es más lenta que las demás?+
La primera vez se descarga el modelo Whisper (unos 40 MB) y se compila el entorno de ejecución de WebAssembly. A partir de ahí el modelo queda en la caché de tu navegador, así que todos los archivos siguientes se transcriben al instante, sin ninguna descarga.
09¿Qué precisión tiene?+
Whisper Tiny es el modelo más pequeño, así que prioriza la velocidad y el tamaño sobre la máxima precisión. Con voz clara de un solo hablante es muy funcional; con audio ruidoso, acentos marcados o voces superpuestas, cuenta con corregir alguna palabra. Elegir el idioma hablado exacto en lugar de la detección automática suele mejorar el resultado.
10¿Funciona sin conexión?+
Después del primer uso, sí. Una vez que tu navegador ha guardado el modelo en caché no hay más actividad de red, así que la página sigue convirtiendo audio en texto sin ninguna conexión.
Empieza a transcribir audio a texto
Gratis, ilimitado y privado por diseño. Tu audio se transcribe en tu navegador y nunca se sube.
Transcribir audio a textoComo el audio se procesa íntegramente en tu navegador y nunca se transmite ni se almacena, usar esta herramienta no genera ninguna transferencia de datos hacia nosotros. Eso la hace muy adecuada para grabaciones sujetas al GDPR, a la HIPAA o a normas internas de confidencialidad, aunque sigues siendo responsable de tratar la transcripción resultante de forma adecuada.