El audio nativo lo cambia todo
Antes, un vídeo con IA era mudo y había que doblarlo después, con un lip-sync casi siempre forzado. Hoy Seedance, Wan, Veo o Kling generan el diálogo, los efectos y el ambiente sincronizados con la imagen. Kling 3.0 ya admite diálogo en español, y el resto de grandes modelos también lo pronuncian con soltura.
Cómo escribir un diálogo en el prompt
- Lo visual en inglés, lo hablado en español. Es la combinación más predecible: la escena descrita en inglés y la frase del personaje en español, entre comillas.
- Una frase por plano. Diálogos cortos y claros. Los monólogos largos se desincronizan.
- Di quién habla y cómo. «she asks in Spanish», «he answers in a low voice»: el tono importa tanto como el texto.
- Describe el sonido ambiente. Lluvia, música, murmullo: el audio nativo lo genera todo junto.

Plano y contraplano con IA
El lenguaje clásico de una conversación es alternar el plano de un personaje y el del otro, a menudo por encima del hombro. Con los modelos multiplano puedes pedirlo en una sola generación, plano a plano y con sus tiempos, y obtener una escena montada de 20 segundos con dos personajes hablando en español.
Lo que encontrarás en el libro
En el libro tienes el capítulo de prompts de vídeo con la estructura completa para describir audio y diálogo, y el capítulo de audio con las alternativas cuando el audio nativo no basta: voces de ElevenLabs, música y lip-sync por separado.
PROMPT DE EJEMPLO
Over-the-shoulder shot from behind an old grey-haired bartender: a woman detective in a red raincoat sits at the bar of a smoky 1950s jazz bar, places a wet photograph on the counter and asks in Spanish: "¿Quién te dio esta foto?" Soft live jazz piano, rain outside.
La escena en inglés y la frase hablada en español, entre comillas.
