Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Cómo dirigir actuación natural en video AI usando beat sheets
2026/08/27

Cómo dirigir actuación natural en video AI usando beat sheets

Planifica escenas de diálogos de IA con beats de actuación, estados de personaje, progresión de cámara, prompts, checks de revisión y ejemplos API.

La actuación convincente en video AI comienza con un beat sheet, no con una lista más larga de emociones. Un beat sheet convierte una escena en cambios pequeños que el modelo puede mostrar: un personaje escucha una línea, hace una pausa, mira hacia otro lado, toma una decisión, luego habla. También define el estado visible al final de cada beat, para que el siguiente momento tenga un lugar concreto donde comenzar.

Este tutorial para principiantes construye una escena corta de diálogos de idea a revisión. Puedes usar el método con cualquier modelo de video que acepte prompts detallados. El ejemplo de API usa Seedance 2.5 en reAPI porque admite audio generado y clips de hasta 30 segundos en una sola solicitud.[1]

TL;DR

  • Escribe una oración describiendo qué cambia emocionalmente durante la escena.
  • Dale a cada personaje un estado inicial estable, un objetivo privado y un punto de presión.
  • Divide la escena en beats de aproximadamente una acción o reacción cada uno.
  • Termina cada beat con un estado observable: mirada, postura, distancia, prop o expresión.
  • Coloca diálogos, actuación, blocking, cámara y sonido en bloques de prompts separados.
  • Revisa asignación de actores, pausas, mirada, manos, dirección de pantalla y el estado final antes de aceptar el clip.

Flujo de trabajo de actuación en video AI desde estado de personaje a través de beats cronometrados, generación y revisión de actuación

Qué es un beat de actuación

Un beat de actuación es el cambio más pequeño y significativo en una escena. No es simplemente un rango de tiempo. Algo tiene que suceder que cambie lo que un personaje sabe, quiere o hace.

Considera esta línea:

Maya: "You already packed?"

"Maya se ve triste" es una dirección débil porque describe un estado de ánimo general. Un beat es más útil:

Maya notices the suitcase before she speaks. Her shoulders stop moving. She
looks at the suitcase, then at Leo, and asks quietly, "You already packed?"
She ends the beat holding eye contact, waiting for him to answer.

La segunda versión le da al modelo un disparador, una secuencia, una lectura de línea y un estado final. Esas son instrucciones visibles en lugar de una etiqueta abstracta.

Paso 1: Reduce la escena a un cambio emocional

Antes de escribir diálogos, completa esta oración:

The scene begins with __________ and ends with __________ because __________.

Por ejemplo:

The scene begins with Maya expecting a normal goodbye and ends with her
realizing Leo planned to leave without telling her because she sees his packed
suitcase before he can hide it.

Este es el esqueleto de la escena. Si un movimiento de cámara propuesto, gesto o línea adicional no ayuda al espectador a entender ese cambio, elimínalo. Los principiantes a menudo solicitan a una generación que lleve varios giros emocionales, una revelación de ubicación, colocación de productos y coreografía de cámara complicada. El modelo entonces reparte su atención entre demasiados trabajos.

Comienza con un giro. Añade complejidad solo después de que la versión simple funcione.

Paso 2: Escribe una tarjeta compacta de estado de personaje

Un modelo no necesita una página de biografía. Necesita los detalles que afecten esta escena.

{
  "maya": {
    "starting_state": "relaxed, expecting a routine goodbye",
    "goal": "get an honest explanation",
    "pressure_point": "being excluded from important decisions",
    "default_behavior": "stays quiet before confronting someone",
    "fixed_visuals": "dark bob, green coat, silver watch"
  },
  "leo": {
    "starting_state": "guarded and eager to leave",
    "goal": "end the conversation without admitting guilt",
    "pressure_point": "direct eye contact",
    "default_behavior": "handles nearby objects when uncomfortable",
    "fixed_visuals": "short brown hair, charcoal jacket, black suitcase"
  }
}

El campo default_behavior es especialmente útil. "Nervioso" puede convertirse en parpadeo aleatorio y movimiento facial exagerado. "Gira la manija del maletín cuando se siente incómodo" le da al personaje una salida física.

Si la similitud importa, prepara imágenes de referencia claras antes de la generación. Este tutorial se enfoca en la planificación de actuación; el flujo de trabajo de consistencia de personaje cubre la preparación de referencias con más detalle.

Paso 3: Convierte el diálogo en beats cronometrados

Usa cuatro a seis beats para una escena corta. Los segundos exactos son guías, no decisiones de edición precisas en fotogramas. Lo que importa es el orden y un estado final claro.

TiempoDisparadorActuación visibleDiálogoEstado final
0–4sMaya sees suitcaseWalk stops; eyes move to suitcaseNoneMaya still, suitcase between them
4–8sLeo notices herHand tightens on handle; avoids eye contactMaya: "You already packed?"Leo looks toward door
8–13sSilence becomes uncomfortableMaya steps closer; Leo exhalesLeo: "It was easier this way."Both hold position
13–19sMaya understandsBrief look down, then steady eye contactMaya: "For who?"Maya calm; Leo cornered
19–24sLeo cannot answerHand leaves suitcase; posture softensNoneSilence, no reconciliation

Observa que no cada beat contiene discurso. El silencio le da al modelo tiempo para mostrar una reacción. También mantiene la asignación de actores más clara que los diálogos superpuestos continuos.

Paso 4: Planifica el blocking antes del movimiento de cámara

El blocking describe dónde están las personas y los objetos. La dirección de cámara describe cómo la audiencia ve ese blocking. Fija el primero antes de añadir el segundo.

Para la escena de ejemplo:

  • Maya comienza a la izquierda del fotograma, dos metros del maletín.
  • Leo comienza a la derecha del fotograma con su mano derecha en la manija.
  • El maletín permanece entre ellos.
  • Ninguno cruza la línea central.
  • Maya da un paso hacia adelante durante el tercer beat.
  • Leo no se aleja antes del beat final.

Estas restricciones protegen la dirección de pantalla y hacen que los cortes posteriores sean más fáciles. Luego añade una progresión de cámara simple:

0-8s: locked medium two-shot.
8-19s: very slow push toward a tighter two-shot.
19-24s: hold. No additional camera movement.

No hagas que la cámara actúe cada emoción. Una órbita súbita, movimiento de grúa y zoom pueden competir con los actores. Para una prueba de diálogos, un movimiento contenido es suficiente.

Paso 5: Ensambla el prompt en seis bloques

Los bloques de prompts separados hacen que los errores sean más fáciles de diagnosticar. Si la cámara está equivocada, puedes editar el bloque de cámara sin reescribir la identidad del personaje o el diálogo.

REFERENCES
Image 1 is Maya's identity and wardrobe reference. Image 2 is Leo's identity
and wardrobe reference. Image 3 defines the station entrance, lighting, and
initial blocking.

CHARACTERS
Maya stays quiet before confronting someone. Leo handles the suitcase when he
is uncomfortable. Preserve their age, facial features, hair, clothing, and
body proportions throughout.

SCENE AND BLOCKING
Evening outside a train station. Maya remains frame left. Leo remains frame
right. A black suitcase stays between them. They do not cross positions.

PERFORMANCE TIMELINE
0-4s: Maya enters, notices the suitcase, stops walking, and looks from the
suitcase to Leo. End with Maya still and Leo unaware.
4-8s: Leo notices her and tightens his hand on the handle without looking at
her. Maya asks quietly, "You already packed?" End with Leo looking at the door.
8-13s: Maya takes one step closer. Leo exhales and says, "It was easier this
way." End with both holding position.
13-19s: Maya briefly looks down, regains eye contact, and asks, "For who?"
End with Maya calm and Leo unable to answer.
19-24s: Leo releases the handle and softens slightly. Neither speaks. End in
unresolved silence.

CAMERA
0-8s locked medium two-shot. 8-19s very slow push to a tighter two-shot.
19-24s hold. Keep both faces visible and preserve the left-right axis.

SOUND AND CONSTRAINTS
Natural American English. Keep the exact lines and speaker assignment. Quiet
station ambience. No narration, subtitles, extra dialogue, background music,
or exaggerated crying.

ByteDance documenta que Seedance puede referenciar composición, movimiento, lenguaje de cámara y sonido desde entradas multimodales. También señala que el modelo aún tiene espacio para mejorar en consistencia de múltiples sujetos y precisión de texto, por lo cual el rol de referencia y el paso de revisión importan.[2]

Paso 6: Genera un ensayo antes de la escena final

Usa un ensayo corto y de bajo riesgo para probar el orden de actores, blocking y tiempo emocional. No juzgues la textura del guardarropa o el color final aún.

En reAPI, una solicitud mínima de Seedance 2.5 se ve así:

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedance-2.5-face",
    "prompt": "PASTE_THE_SIX_BLOCK_PROMPT_HERE",
    "image_urls": [
      "https://example.com/maya.jpg",
      "https://example.com/leo.jpg",
      "https://example.com/station.jpg"
    ],
    "resolution": "720p",
    "size": "16:9",
    "duration": 24,
    "generate_audio": true
  }'

La solicitud es asincrónica. Realiza una encuesta en el ID de tarea retornado hasta que el estado sea completed o failed. Los límites de campo actuales y las reglas de facturación pertenecen a la documentación de API de Seedance 2.5, no a suposiciones de cliente codificadas.

Paso 7: Revisa el desempeño en el orden correcto

Mira el resultado tres veces con un propósito diferente cada vez.

Pasada uno: solo sonido

Escucha sin mirar. Verifica líneas exactas, asignación de actores, orden de línea, narración no deseada, ritmo y si existen pausas donde el beat sheet las solicita.

Pasada dos: imagen sin sonido

Silencia el clip. Verifica mirada, posición corporal, comportamiento de manos, continuidad facial, dirección de pantalla y si cada beat termina en el estado planeado.

Pasada tres: escena completa

Ahora juzga si diálogo, reacción, cámara y sonido apoyan el mismo giro. Si una capa falla, repara esa capa primero. No reescribas toda la escena porque una pausa es demasiado corta.

Usa una hoja de aceptación simple:

{
  "speaker_order": "pass",
  "exact_dialogue": "pass",
  "left_right_axis": "pass",
  "beat_3_end_state": "repair",
  "identity": "pass",
  "camera": "pass",
  "repair_note": "Leo looks at Maya too early; hold gaze on the door through 13s"
}

Este es el mismo principio que un bucle de crítica de video AI: acepta o repara contra evidencia explícita en lugar de preguntar si el clip "se siente bien".

Errores comunes de principiantes

ErrorPor qué fallaMovimiento mejor
Escribir "triste, cinemático, emocional"Las palabras de estado de ánimo no definen comportamientoAñade disparador, reacción física y estado final
Dar a ambos personajes movimiento constanteLa escena se vuelve ocupada y poco claraDeja que uno actúe mientras el otro recibe
Llenar cada segundo con diálogosLas reacciones no tienen tiempo para registrarseReserva beats para el silencio
Cambiar estilo de cámara cada beatLa cámara compite con el desempeñoUsa una progresión y una retención
Regenerar todo después de un defectoSe pierden las partes buenasRepara el bloque fallido más pequeño
Solicitar texto de marca exacto dentro de la escenaEl texto generado puede ser poco confiableAñade copias críticas en posproducción

FAQ

¿Cuántos beats de actuación debería usar un principiante?

Comienza con cuatro a seis. Cada beat debe contener un disparador o reacción principal. Si una fila necesita varias oraciones para explicar qué cambia, divídela.

¿Garantizan los timecodes un tiempo exacto?

No. Trátalos como guía de ritmo. Verifica el resultado renderizado y recorta en un editor cuando importa el tiempo exacto de entrega.

¿Debería cada emoción ser visible en la cara?

No. La postura, mirada, distancia, movimiento de mano y silencio a menudo comunican más claramente que una expresión exagerada.

¿Puedo usar este flujo de trabajo sin imágenes de referencia de personaje?

Sí, pero la identidad visual será menos restringida. Las referencias se vuelven más importantes cuando una persona específica o un personaje ficticio recurrente debe permanecer reconocible.

¿Qué debería arreglar primero cuando una escena de diálogos falla?

Arregla el orden de actores y blocking antes de la emoción sutil. Una reacción beautifully renderizada no puede salvar una escena en la que el personaje equivocado habla o cruza al lado equivocado.

Conclusión

Un beat sheet de actuación en video AI convierte una idea emocional en trabajo observable: disparadores, reacciones, diálogos, blocking, estados finales y criterios de revisión. Construye un giro simple, dale espacio al silencio y mantén la cámara contenida. Una vez que esa versión funciona, puedes añadir actuaciones más complejas sin perder control de la escena.

Referencias

  1. ByteDance Seed. One-take Creation, Flexible Referencing: Introducing Seedance 2.5. July 31, 2026. seed.bytedance.com
  2. ByteDance Seed. Seedance 2.0 Official Launch. February 12, 2026. seed.bytedance.com
  3. reAPI. Seedance 2.5 API — Parameters, Modes & Billing. Retrieved August 27, 2026. reapi.ai