Sora
Modelo de OpenAI para generar vídeo a partir de texto. Produce clips coherentes con movimiento y física plausibles a partir de una descripción escrita.
Modelo de OpenAI para generar vídeo a partir de texto. Produce clips coherentes con movimiento y física plausibles a partir de una descripción escrita.
Actualizado: 12 de septiembre de 2026.
Sora extiende la idea del texto a imagen al vídeo: describes una escena y el modelo genera un clip con movimiento, cámara y coherencia temporal.
Estado en 2026
La generación actual es Sora 2: genera clips con audio y diálogo sincronizados, un salto frente al Sora original, que era mudo. Se usa desde la app de Sora y desde los planes de pago de ChatGPT, además de la API de OpenAI para integraciones. Los clips son cortos y están pensados para encadenarse en una edición, no para producir piezas largas de una sola pasada.
Los precios, duraciones y límites cambian con frecuencia: antes de planificar un proyecto, verifica la disponibilidad y las condiciones vigentes en la documentación oficial de OpenAI y compáralo con la comparativa Sora 2 frente a Veo 3.
Por qué es difícil
El vídeo exige mantener consistencia entre fotogramas (objetos que no cambian, física creíble), un reto mucho mayor que una imagen estática.
Implicaciones
Abre posibilidades creativas enormes, pero también riesgos de deepfakes, lo que refuerza la necesidad de marcas de agua de IA y procedencia verificable.