Cómo transcribir un audio a texto con IA (gratis y paso a paso)
¿Necesitas pasar a texto una entrevista, una clase grabada o una nota de voz y no quieres pagar una suscripción? Hoy se puede transcribir un audio a texto con IA gratis y en pocos minutos. Esta guía explica qué herramienta usar según tu caso, cuánto tarda en la práctica y qué tener en cuenta con la privacidad, porque no todas las opciones tratan tu archivo igual.
Información revisada en septiembre de 2026. Las condiciones de los planes gratuitos cambian a menudo; si algo no coincide, escríbenos y lo corregimos.
¿Cuál es la forma más rápida de transcribir un audio gratis?
La vía más rápida es una herramienta web que ejecute el modelo Whisper —el sistema de reconocimiento de voz de código abierto de OpenAI, publicado bajo licencia MIT (repositorio oficial)— sin pedirte registro. Subes o eliges el archivo, marcas el idioma y en unos minutos descargas el texto, sin instalar nada.
Si el audio contiene información sensible (una reunión de trabajo, datos de clientes, temas de salud), la opción recomendable es una herramienta que procese el audio en tu propio dispositivo. Algunas webs actuales cargan Whisper una sola vez en el navegador y lo ejecutan en local, de forma que el audio nunca sale de tu ordenador (ejemplo de herramienta que lo hace así).
¿Cuánto tarda en transcribir un audio de una hora?
En una herramienta web, procesar una hora de audio suele llevar entre 3 y 10 minutos, según la carga del servidor y la longitud del archivo. Si el modelo corre en tu equipo, el tiempo depende de tu hardware: puede ir de casi tiempo real a tardar más que la propia grabación.
A ese tiempo hay que sumarle el repaso. Para un uso informal vale con una lectura rápida; para un acta o una cita textual, cuenta con revisar entre 2 y 4 minutos por cada minuto de audio, corrigiendo puntuación, nombres y términos técnicos.
¿Se puede transcribir una nota de voz de WhatsApp?
Sí, pero primero tienes que sacar la nota de voz de WhatsApp como archivo. En iPhone: mantén pulsada la nota, toca Reenviar y elige Guardar en Archivos. En Android: mantén pulsada la nota, pulsa Compartir y envíala a una app como Gmail o Drive; llega como archivo de audio que luego puedes descargar (guía de Xataka con el detalle por sistema).
Con el archivo ya guardado (normalmente .opus o .m4a), lo subes a la herramienta de transcripción como cualquier otro audio. Para notas sueltas y cortas, la transcripción que incluye el propio WhatsApp o el sistema del móvil puede ser suficiente; para audios largos o si necesitas exportar el texto, una herramienta dedicada da mejor resultado.
¿La transcripción distingue quién habla?
Algunas herramientas incluyen “diarización”, que separa el texto por interlocutor (“Hablante 1”, “Hablante 2”). No es infalible: se confunde cuando dos personas hablan a la vez, cuando alguien interviene muy poco o cuando la calidad del audio es baja.
Para una entrevista a dos voces suele funcionar bien. Para una reunión de cinco personas, espera tener que reasignar bastantes intervenciones a mano.
¿Es privado? ¿Dónde acaba mi audio?
Depende de la herramienta. Si usa un servidor, tu archivo se sube y se procesa allí; muchas prometen borrarlo en unas horas, pero eso es una promesa, no una garantía técnica, así que no subas audios confidenciales a un servicio gratuito sin leer su política de privacidad.
Si la herramienta ejecuta el modelo en tu navegador o en tu ordenador, el audio no se envía a ninguna parte: es la opción segura para material sensible. El modelo de OpenAI está pensado para poder ejecutarse en local, sin conexión, una vez descargado (documentación de Whisper).
¿Es fiable la transcripción en español?
El español es uno de los idiomas con más datos de entrenamiento en los modelos actuales, así que la calidad de base es alta con audio limpio. La precisión varía mucho según el idioma y el tipo de grabación: OpenAI advierte de que el rendimiento “varía ampliamente según el idioma” y empeora con acentos poco representados y audio ruidoso (ficha del modelo Whisper large-v3).
En la práctica, esto significa que acertará casi todo el texto corrido, pero fallará más en nombres propios, siglas, cifras y palabras técnicas. Esas son las partes que tienes que revisar sí o sí.
Cómo exportar la transcripción y darle formato
- En la herramienta, busca la opción de exportar y elige el formato: TXT (texto plano), DOCX (Word) o SRT/VTT (con marcas de tiempo, pensado para subtítulos).
- Si quieres los tiempos dentro del texto (útil para localizar un momento en la grabación), exporta en SRT y ábrelo con cualquier editor: verás cada frase con su minuto y segundo.
- Para un acta limpia, exporta en DOCX, elimina las marcas de tiempo que no necesites y unifica el formato de los nombres de los hablantes.
- Pega el resultado en tu procesador de texto y haz una última lectura corrigiendo puntuación y nombres.
Qué opción elegir según tu caso
| Tu situación | Opción recomendada | Por qué |
|---|---|---|
| Audio normal, sin datos sensibles, uso puntual | Herramienta web con Whisper, sin registro | Rápida y sin instalar nada |
| Reunión de trabajo o información confidencial | Herramienta que procesa en tu navegador o modelo en local | El audio no sale de tu equipo |
| Nota de voz corta del móvil | Transcripción del propio WhatsApp o del sistema | Inmediata, sin pasos extra |
| Entrevista larga que vas a citar | Herramienta con diarización + repaso a mano | Necesitas saber quién dice qué |
| Vas a transcribir a menudo | Modelo Whisper instalado en el ordenador | Sin límites y sin depender de una web |
Los límites concretos de cada herramienta gratuita (minutos al mes, tamaño máximo de archivo, si exporta a Word) cambian con frecuencia. Comprueba la web de la herramienta antes de contar con ella para algo importante.
En resumen
Para un audio corriente y sin datos sensibles, una herramienta web basada en Whisper es gratis y te resuelve la transcripción en minutos. Para reuniones de trabajo o información confidencial, usa una opción que procese el audio en tu propio equipo. Y en todos los casos, reserva un rato para repasar el texto: la IA acierta la mayor parte, pero los nombres, las cifras y la puntuación son cosa tuya.
Preguntas frecuentes
¿Es legal transcribir una reunión o una llamada?
Transcribir un audio que tú has grabado con el conocimiento de los participantes no plantea problema. Grabar una conversación en la que participas también suele ser lícito, pero difundir esa grabación o usarla contra alguien tiene límites. Ante la duda, avisa de que estás grabando.
¿La transcripción automática funciona bien en español?
Sí. El español es uno de los idiomas mejor cubiertos por los modelos actuales y, con un audio claro, el resultado es muy usable. Con ruido de fondo, acentos marcados o varias personas hablando a la vez, el número de errores sube y conviene repasar el texto.
¿Puedo transcribir un audio sin subirlo a internet?
Sí. Hay herramientas que ejecutan el modelo dentro de tu propio navegador o de tu ordenador, de modo que el archivo nunca se envía a ningún servidor. Es la opción más privada, aunque la primera vez descarga el modelo y puede ir más lenta en equipos modestos.
Una guía nueva cada semana
Probamos una herramienta de IA y te contamos si merece la pena. Sin spam.
Suscribirme gratis¿Ves algo desactualizado o un error? Escríbenos ahola@probadoconia.es y lo corregimos.