Saltar al contenido

Texto a vídeo

Generación de clips de vídeo a partir de una descripción escrita. El modelo produce secuencias con movimiento y coherencia temporal a partir de un prompt.

Generación de clips de vídeo a partir de una descripción escrita. El modelo produce secuencias con movimiento y coherencia temporal a partir de un prompt.

Actualizado: 3 de junio de 2026.

El texto a vídeo extiende el texto a imagen al movimiento: describes una escena y el modelo genera un clip coherente. Es mucho más difícil, porque exige mantener consistencia entre fotogramas.

Estado del arte

Modelos como Sora y Veo producen clips cada vez más realistas, con audio nativo sincronizado, abriendo posibilidades para creadores y marketing.

Riesgos

Facilita deepfakes y desinformación, lo que refuerza la necesidad de marcas de agua de IA y verificación de procedencia.

Términos relacionados

02 / LLEVAR A LA PRÁCTICA

Después de leer

Convierte una idea útil en una habilidad repetible.

Elige una ruta breve, aplícala a una tarea real y termina con algo que puedas revisar, usar o compartir.