Whisper
Modelo de reconocimiento de voz de OpenAI, de pesos abiertos, capaz de transcribir y traducir audio en muchos idiomas con buena precisión, incluso con ruido de fondo.
Modelo de reconocimiento de voz de OpenAI, de pesos abiertos, capaz de transcribir y traducir audio en muchos idiomas con buena precisión, incluso con ruido de fondo.
Actualizado: 12 de septiembre de 2026.
Whisper popularizó la transcripción automática de calidad: convierte audio en texto en decenas de idiomas y puede traducir al inglés sobre la marcha.
Datos clave
2022, 680k h, pesos abiertos+código, fragmentos 30s, transcribe y traduce al inglés.
- Lanzamiento: 2022, con pesos abiertos y código público (OpenAI + GitHub).
- Entrenamiento: 680 000 horas de audio supervisado, multilingüe y multitarea.
- Cómo procesa: trabaja por fragmentos de 30 segundos con una ventana deslizante.
- Qué hace: transcribe en el idioma original y traduce voz al inglés.
Flujo práctico: de una reunión a subtítulos
- Graba con criterio: avisa a los participantes y guarda el audio en un formato común (mp3, wav, m4a).
- Transcribe: pasa el archivo por Whisper en tu idioma o pide traducción al inglés.
- Corrige nombres y cifras: verifica personas, importes, fechas y términos técnicos contra tus notas; el modelo puede confundirlos.
- Publica con cuidado: exporta a subtítulos (srt/vtt) o acta, y evita subir audio sensible a servicios que no controles.
Whisper se equivoca sobre todo donde importa: nombres propios, números y jerga. Úsalo para el borrador, no como acta final sin revisión. Regla corta: verifica nombres/cifras; cuidado con audio sensible.
Por qué destaca
Al ser de pesos abiertos, se integra en multitud de productos de subtitulado, notas de voz y accesibilidad sin depender de un servicio externo.
Usos
Subtítulos, transcripción de reuniones y entrevistas, y la parte de voz a texto de muchos asistentes virtuales.