Veo
Modelo de Google DeepMind para generar vídeo a partir de texto, con audio nativo: produce clips con diálogo, efectos y ambiente sincronizados, además de controles de cámara y buena adherencia al prompt.
Modelo de Google DeepMind para generar vídeo a partir de texto, con audio nativo: produce clips con diálogo, efectos y ambiente sincronizados en una sola pasada.
Actualizado: 12 de septiembre de 2026.
Veo es texto-a-video con audio nativo: adherencia, consistencia, controles de cámara, extensión. Es el modelo de Google DeepMind para generar vídeo a partir de texto: no entrega un clip mudo al que después le agregas audio, sino una pieza con voz, efectos y ambiente generados junto con la imagen. Destaca en tres cosas: adherencia al prompt (respeta lo que describes), consistencia (los objetos no cambian entre fotogramas) y realismo físico (agua, telas, movimiento creíble). Ofrece controles de cámara, generación en alta resolución y la opción de extender un clip para encadenarlo en una edición.
Ejemplo neutro de prompt
Plano medio de una panadera amasando en una cocina rústica al amanecer,
luz cálida entrando por la ventana, la cámara se acerca despacio.
Ambiente: pájaros afuera, sonido suave de la masa contra la mesa.
Sin diálogo. Duración: clip corto para encadenar en una edición.
Un prompt así funciona porque separa cuatro decisiones: plano y acción, luz, movimiento de cámara y audio. Si el resultado no te convence, cambia una sola variable por intento.
Riesgos: deepfakes y procedencia
Un modelo que genera personas hablando con realismo facilita deepfakes y desinformación. Antes de publicar un vídeo generado: etiqueta que es contenido sintético, no suplantes a personas reales y conserva la información de procedencia cuando la herramienta la ofrezca. La calidad técnica no elimina la responsabilidad editorial.
Más contexto en Google DeepMind: Veo y en la comparativa Sora 2 frente a Veo 3.