
Cómo dirigir actuación natural en video AI usando beat sheets
Planifica escenas de diálogos de IA con beats de actuación, estados de personaje, progresión de cámara, prompts, checks de revisión y ejemplos API.
La actuación convincente en video AI comienza con un beat sheet, no con una lista más larga de emociones. Un beat sheet convierte una escena en cambios pequeños que el modelo puede mostrar: un personaje escucha una línea, hace una pausa, mira hacia otro lado, toma una decisión, luego habla. También define el estado visible al final de cada beat, para que el siguiente momento tenga un lugar concreto donde comenzar.
Este tutorial para principiantes construye una escena corta de diálogos de idea a revisión. Puedes usar el método con cualquier modelo de video que acepte prompts detallados. El ejemplo de API usa Seedance 2.5 en reAPI porque admite audio generado y clips de hasta 30 segundos en una sola solicitud.[1]
TL;DR
- Escribe una oración describiendo qué cambia emocionalmente durante la escena.
- Dale a cada personaje un estado inicial estable, un objetivo privado y un punto de presión.
- Divide la escena en beats de aproximadamente una acción o reacción cada uno.
- Termina cada beat con un estado observable: mirada, postura, distancia, prop o expresión.
- Coloca diálogos, actuación, blocking, cámara y sonido en bloques de prompts separados.
- Revisa asignación de actores, pausas, mirada, manos, dirección de pantalla y el estado final antes de aceptar el clip.

Qué es un beat de actuación
Un beat de actuación es el cambio más pequeño y significativo en una escena. No es simplemente un rango de tiempo. Algo tiene que suceder que cambie lo que un personaje sabe, quiere o hace.
Considera esta línea:
Maya: "You already packed?""Maya se ve triste" es una dirección débil porque describe un estado de ánimo general. Un beat es más útil:
Maya notices the suitcase before she speaks. Her shoulders stop moving. She
looks at the suitcase, then at Leo, and asks quietly, "You already packed?"
She ends the beat holding eye contact, waiting for him to answer.La segunda versión le da al modelo un disparador, una secuencia, una lectura de línea y un estado final. Esas son instrucciones visibles en lugar de una etiqueta abstracta.
Paso 1: Reduce la escena a un cambio emocional
Antes de escribir diálogos, completa esta oración:
The scene begins with __________ and ends with __________ because __________.Por ejemplo:
The scene begins with Maya expecting a normal goodbye and ends with her
realizing Leo planned to leave without telling her because she sees his packed
suitcase before he can hide it.Este es el esqueleto de la escena. Si un movimiento de cámara propuesto, gesto o línea adicional no ayuda al espectador a entender ese cambio, elimínalo. Los principiantes a menudo solicitan a una generación que lleve varios giros emocionales, una revelación de ubicación, colocación de productos y coreografía de cámara complicada. El modelo entonces reparte su atención entre demasiados trabajos.
Comienza con un giro. Añade complejidad solo después de que la versión simple funcione.
Paso 2: Escribe una tarjeta compacta de estado de personaje
Un modelo no necesita una página de biografía. Necesita los detalles que afecten esta escena.
{
"maya": {
"starting_state": "relaxed, expecting a routine goodbye",
"goal": "get an honest explanation",
"pressure_point": "being excluded from important decisions",
"default_behavior": "stays quiet before confronting someone",
"fixed_visuals": "dark bob, green coat, silver watch"
},
"leo": {
"starting_state": "guarded and eager to leave",
"goal": "end the conversation without admitting guilt",
"pressure_point": "direct eye contact",
"default_behavior": "handles nearby objects when uncomfortable",
"fixed_visuals": "short brown hair, charcoal jacket, black suitcase"
}
}El campo default_behavior es especialmente útil. "Nervioso" puede convertirse en parpadeo aleatorio y movimiento facial exagerado. "Gira la manija del maletín cuando se siente incómodo" le da al personaje una salida física.
Si la similitud importa, prepara imágenes de referencia claras antes de la generación. Este tutorial se enfoca en la planificación de actuación; el flujo de trabajo de consistencia de personaje cubre la preparación de referencias con más detalle.
Paso 3: Convierte el diálogo en beats cronometrados
Usa cuatro a seis beats para una escena corta. Los segundos exactos son guías, no decisiones de edición precisas en fotogramas. Lo que importa es el orden y un estado final claro.
| Tiempo | Disparador | Actuación visible | Diálogo | Estado final |
|---|---|---|---|---|
| 0–4s | Maya sees suitcase | Walk stops; eyes move to suitcase | None | Maya still, suitcase between them |
| 4–8s | Leo notices her | Hand tightens on handle; avoids eye contact | Maya: "You already packed?" | Leo looks toward door |
| 8–13s | Silence becomes uncomfortable | Maya steps closer; Leo exhales | Leo: "It was easier this way." | Both hold position |
| 13–19s | Maya understands | Brief look down, then steady eye contact | Maya: "For who?" | Maya calm; Leo cornered |
| 19–24s | Leo cannot answer | Hand leaves suitcase; posture softens | None | Silence, no reconciliation |
Observa que no cada beat contiene discurso. El silencio le da al modelo tiempo para mostrar una reacción. También mantiene la asignación de actores más clara que los diálogos superpuestos continuos.
Paso 4: Planifica el blocking antes del movimiento de cámara
El blocking describe dónde están las personas y los objetos. La dirección de cámara describe cómo la audiencia ve ese blocking. Fija el primero antes de añadir el segundo.
Para la escena de ejemplo:
- Maya comienza a la izquierda del fotograma, dos metros del maletín.
- Leo comienza a la derecha del fotograma con su mano derecha en la manija.
- El maletín permanece entre ellos.
- Ninguno cruza la línea central.
- Maya da un paso hacia adelante durante el tercer beat.
- Leo no se aleja antes del beat final.
Estas restricciones protegen la dirección de pantalla y hacen que los cortes posteriores sean más fáciles. Luego añade una progresión de cámara simple:
0-8s: locked medium two-shot.
8-19s: very slow push toward a tighter two-shot.
19-24s: hold. No additional camera movement.No hagas que la cámara actúe cada emoción. Una órbita súbita, movimiento de grúa y zoom pueden competir con los actores. Para una prueba de diálogos, un movimiento contenido es suficiente.
Paso 5: Ensambla el prompt en seis bloques
Los bloques de prompts separados hacen que los errores sean más fáciles de diagnosticar. Si la cámara está equivocada, puedes editar el bloque de cámara sin reescribir la identidad del personaje o el diálogo.
REFERENCES
Image 1 is Maya's identity and wardrobe reference. Image 2 is Leo's identity
and wardrobe reference. Image 3 defines the station entrance, lighting, and
initial blocking.
CHARACTERS
Maya stays quiet before confronting someone. Leo handles the suitcase when he
is uncomfortable. Preserve their age, facial features, hair, clothing, and
body proportions throughout.
SCENE AND BLOCKING
Evening outside a train station. Maya remains frame left. Leo remains frame
right. A black suitcase stays between them. They do not cross positions.
PERFORMANCE TIMELINE
0-4s: Maya enters, notices the suitcase, stops walking, and looks from the
suitcase to Leo. End with Maya still and Leo unaware.
4-8s: Leo notices her and tightens his hand on the handle without looking at
her. Maya asks quietly, "You already packed?" End with Leo looking at the door.
8-13s: Maya takes one step closer. Leo exhales and says, "It was easier this
way." End with both holding position.
13-19s: Maya briefly looks down, regains eye contact, and asks, "For who?"
End with Maya calm and Leo unable to answer.
19-24s: Leo releases the handle and softens slightly. Neither speaks. End in
unresolved silence.
CAMERA
0-8s locked medium two-shot. 8-19s very slow push to a tighter two-shot.
19-24s hold. Keep both faces visible and preserve the left-right axis.
SOUND AND CONSTRAINTS
Natural American English. Keep the exact lines and speaker assignment. Quiet
station ambience. No narration, subtitles, extra dialogue, background music,
or exaggerated crying.ByteDance documenta que Seedance puede referenciar composición, movimiento, lenguaje de cámara y sonido desde entradas multimodales. También señala que el modelo aún tiene espacio para mejorar en consistencia de múltiples sujetos y precisión de texto, por lo cual el rol de referencia y el paso de revisión importan.[2]
Paso 6: Genera un ensayo antes de la escena final
Usa un ensayo corto y de bajo riesgo para probar el orden de actores, blocking y tiempo emocional. No juzgues la textura del guardarropa o el color final aún.
En reAPI, una solicitud mínima de Seedance 2.5 se ve así:
curl https://reapi.ai/api/v1/videos/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "doubao-seedance-2.5-face",
"prompt": "PASTE_THE_SIX_BLOCK_PROMPT_HERE",
"image_urls": [
"https://example.com/maya.jpg",
"https://example.com/leo.jpg",
"https://example.com/station.jpg"
],
"resolution": "720p",
"size": "16:9",
"duration": 24,
"generate_audio": true
}'La solicitud es asincrónica. Realiza una encuesta en el ID de tarea retornado hasta que el estado sea completed o failed. Los límites de campo actuales y las reglas de facturación pertenecen a la documentación de API de Seedance 2.5, no a suposiciones de cliente codificadas.
Paso 7: Revisa el desempeño en el orden correcto
Mira el resultado tres veces con un propósito diferente cada vez.
Pasada uno: solo sonido
Escucha sin mirar. Verifica líneas exactas, asignación de actores, orden de línea, narración no deseada, ritmo y si existen pausas donde el beat sheet las solicita.
Pasada dos: imagen sin sonido
Silencia el clip. Verifica mirada, posición corporal, comportamiento de manos, continuidad facial, dirección de pantalla y si cada beat termina en el estado planeado.
Pasada tres: escena completa
Ahora juzga si diálogo, reacción, cámara y sonido apoyan el mismo giro. Si una capa falla, repara esa capa primero. No reescribas toda la escena porque una pausa es demasiado corta.
Usa una hoja de aceptación simple:
{
"speaker_order": "pass",
"exact_dialogue": "pass",
"left_right_axis": "pass",
"beat_3_end_state": "repair",
"identity": "pass",
"camera": "pass",
"repair_note": "Leo looks at Maya too early; hold gaze on the door through 13s"
}Este es el mismo principio que un bucle de crítica de video AI: acepta o repara contra evidencia explícita en lugar de preguntar si el clip "se siente bien".
Errores comunes de principiantes
| Error | Por qué falla | Movimiento mejor |
|---|---|---|
| Escribir "triste, cinemático, emocional" | Las palabras de estado de ánimo no definen comportamiento | Añade disparador, reacción física y estado final |
| Dar a ambos personajes movimiento constante | La escena se vuelve ocupada y poco clara | Deja que uno actúe mientras el otro recibe |
| Llenar cada segundo con diálogos | Las reacciones no tienen tiempo para registrarse | Reserva beats para el silencio |
| Cambiar estilo de cámara cada beat | La cámara compite con el desempeño | Usa una progresión y una retención |
| Regenerar todo después de un defecto | Se pierden las partes buenas | Repara el bloque fallido más pequeño |
| Solicitar texto de marca exacto dentro de la escena | El texto generado puede ser poco confiable | Añade copias críticas en posproducción |
FAQ
¿Cuántos beats de actuación debería usar un principiante?
Comienza con cuatro a seis. Cada beat debe contener un disparador o reacción principal. Si una fila necesita varias oraciones para explicar qué cambia, divídela.
¿Garantizan los timecodes un tiempo exacto?
No. Trátalos como guía de ritmo. Verifica el resultado renderizado y recorta en un editor cuando importa el tiempo exacto de entrega.
¿Debería cada emoción ser visible en la cara?
No. La postura, mirada, distancia, movimiento de mano y silencio a menudo comunican más claramente que una expresión exagerada.
¿Puedo usar este flujo de trabajo sin imágenes de referencia de personaje?
Sí, pero la identidad visual será menos restringida. Las referencias se vuelven más importantes cuando una persona específica o un personaje ficticio recurrente debe permanecer reconocible.
¿Qué debería arreglar primero cuando una escena de diálogos falla?
Arregla el orden de actores y blocking antes de la emoción sutil. Una reacción beautifully renderizada no puede salvar una escena en la que el personaje equivocado habla o cruza al lado equivocado.
Conclusión
Un beat sheet de actuación en video AI convierte una idea emocional en trabajo observable: disparadores, reacciones, diálogos, blocking, estados finales y criterios de revisión. Construye un giro simple, dale espacio al silencio y mantén la cámara contenida. Una vez que esa versión funciona, puedes añadir actuaciones más complejas sin perder control de la escena.
Referencias
- ByteDance Seed. One-take Creation, Flexible Referencing: Introducing Seedance 2.5. July 31, 2026. seed.bytedance.com
- ByteDance Seed. Seedance 2.0 Official Launch. February 12, 2026. seed.bytedance.com
- reAPI. Seedance 2.5 API — Parameters, Modes & Billing. Retrieved August 27, 2026. reapi.ai
Autor

Categorías
Más publicaciones

Upscalers de código abierto para vídeo: video2x y Real-ESRGAN
Guía de upscalers de vídeo de código abierto: video2x frente a Real-ESRGAN, motores Vulkan, modelos de anime, bajo VRAM, y licencias comerciales.


Vídeos musicales con IA: de canción y fotos a vídeo completo
Convierte MP3 de 10 segundos a 5 minutos e imágenes 1-7 en vídeos musicales mediante una solicitud API, con subtítulos y tablas de precios precisos.


Hailuo AI vs Seedance, Kling, Veo: comparación de precios
¿Cómo compara Hailuo AI con Seedance 2.5, Kling 3.0 y Veo 3.1? Precio por segundo, duración, audio, referencias y capacidades del MiniMax H3 frente a otras IA.
