Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Control de cámara Seedance 2.5: números, no adjetivos
2026/07/27

Control de cámara Seedance 2.5: números, no adjetivos

El control de cámara falla con adjetivos. Usa números, velocidades explícitas, equipos nombrados y golpes temporales, no descripciones de humor o emoción.

Genera un plano de treinta segundos con «panorámica cinematográfica suave» en el prompt y el lente virtual se lanza a través de la sala como un dron sin control. El sujeto queda atrás en un desenfoque. Esta es la frustración más común con el control de cámara de Seedance 2.5, y no es un bug.

Los adjetivos no son velocidades. El modelo asigna palabras descriptivas a vectores de movimiento predeterminados, y palabras como suave, épico y dramático se asignan a velocidades rápidas. Arreglarlo significa escribir el prompt como un supervisor de guión, no como un tablero de humor.

TL;DR

  • Reemplaza adjetivos con números. «Dolly lateral lento a 2 segundos por metro» le gana a «panorámica rápida a través de la sala».
  • Nombra el equipo. Dolly, grúa, trípode fijo, plano de seguimiento. El vocabulario mecánico limita el modelo de movimiento de una forma que los adjetivos no hacen.
  • Divide el plano en golpes marcados con marca de tiempo para que el motor sepa cuándo comienza, se detiene y termina un movimiento.
  • Ancla el espacio con material de referencia en lugar de describirlo, que es lo que detiene la deriva de coordenadas en un plano largo.
  • Las generaciones más largas derivan más. La ventana de 30 segundos hace que las restricciones explícitas sean más necesarias, no menos.

Por qué la velocidad predeterminada es demasiado rápida

El modelo funciona en un espacio latente comprimido, y las señales de texto se asignan a vectores de velocidad antes de que se renderice nada. Los descriptores genéricos no tienen peso físico, por lo que la asignación se resuelve hacia trayectorias de barrido y alta aceleración.

De esto se desprenden tres modos de fallo, y se componen a lo largo de un plano largo.

Brecha semántica. «Suave» y «dramático» no son métricas de velocidad. Los pesos neuronales los leen como permiso para máxima aceleración en lugar de instrucciones de movimiento deliberado.

Deriva latente. Sin restricciones difíciles, las coordenadas espaciales deambulan a lo largo de una línea de tiempo extendida. Una pared que estaba a la izquierda en el segundo tres está en algún otro lugar en el segundo veinte.

Ruptura del ritmo. Las traducciones de velocidad rápida predeterminada destruyen la orientación del espectador en los primeros segundos, que es la parte del clip que decide si alguien sigue viendo.

Reemplaza adjetivos con números

Esta es toda la técnica, y la tabla a continuación es la versión funcional de ella.

Modo de falloEvitaUsa en su lugar
Panorámica ultra rápida«Panorámica de cámara cinematográfica suave y épica a través de la sala»«Plano de seguimiento lateral a 0,5 m/s, longitud focal fija, progresión lineal de 4 segundos»
Zoom descontrolado«Zoom cinematográfico dramático en el sujeto»«Impulso focal gradual de gran angular (24 mm) a medio (50 mm) en una ventana de 10 segundos»
Deriva de coordenadas«Plano de dron rápido volando sobre el paisaje»«Planeo aéreo de baja altitud estable, altitud bloqueada a 3 metros, rumbo vectorial 090»

Tres reglas se generalizan a partir de esas filas.

Define velocidad numérica. Sustituye ritmo métrico o basado en el tiempo por cada palabra descriptiva. Metros por segundo o segundos por metro funcionan ambos. Lo que importa es que aparezca un número.

Bloquea el equipo mecánico. Di explícitamente dolly, grúa, trípode fijo o plano de seguimiento. Nombrar equipos reales fuerza el modelo de movimiento hacia trayectorias plausibles físicamente, porque esas palabras llevan restricciones espaciales que «cinematográfico» no tiene.

Añade disparadores de tiempo. Divide un plano largo en etapas para que el motor sepa cuándo moverse y cuándo detenerse.

Golpes marcados con marca de tiempo

Una toma de Seedance de treinta segundos dividida en cuatro golpes marcados con marca de tiempo, cada uno con una velocidad explícita, en contraste con el cambio de prompt adjective-versus-number

La ventana de 30 segundos es donde la estructura del prompt deja de ser opcional. Un solo párrafo que describe un plano completo no le da al modelo ninguna razón para quedarse quieto en ningún momento, así que se mueve continuamente.

Estructura en cambio como golpes:

0-6s: [Trípode fijo] Plano medio, sujeto centrado, sin movimiento de cámara.
      Movimiento ambiental solo — vapor subiendo, tela cambiando.
6-14s: [Dolly lento en] Impulso de medio a primer plano a 0,3 m/s, velocidad constante,
      sin suavizado. Longitud focal fija a 50 mm.
14-22s: [Sostenida] Cámara estática en primer plano. El sujeto se gira hacia el lente.
22-30s: [Seguimiento lateral izquierdo] 0,4 m/s, el sujeto permanece centrado en el encuadre,
      la paralaje del fondo revela la ventana.

Dos cosas que esa estructura te compra. Cada golpe tiene una velocidad explícita, así que ningún segmento hereda un valor predeterminado. Y las sostenidas se declaran en lugar de implicarse, que es lo que previene que el modelo llene el silencio con movimiento.

Ancla el espacio en lugar de describirlo

El material de referencia es la superficie de control más fuerte disponible, y está infrautilizado porque parece trabajo extra.

Describir una sala en texto le da al modelo una distribución de probabilidad sobre salas. Proporcionar una referencia le da geometría. Para trabajo de cámara específicamente, esa diferencia decide si la pared se mantiene en su lugar a lo largo de un movimiento de veinte segundos.

La jerarquía práctica, la más fuerte primero: un video de referencia cuyo movimiento de cámara quieres que se repita, luego fotogramas fijos que establezcan el espacio desde los ángulos por los que pasará el plano, luego texto que describe lo que ninguno de esos cubre. El texto es el retorno, no la base.

Esto también interactúa con la facturación en la generación de 2.0, donde proporcionar un video cargado mueve la solicitud a una tarifa más barata. Vale la pena saber cuando un pipeline es impulsado por video de todas formas.

Resolución de problemas

Desenfoque de movimiento en cada movimiento. La velocidad es demasiado alta para que la velocidad de fotogramas se resuelva. Reduce la velocidad numérica en lugar de añadir «menos desenfoque» al prompt, que el modelo lee como una nota de estilo en lugar de una restricción de física.

La cámara se desvía del sujeto a lo largo de un plano largo. Añade una restricción de encuadre a cada golpe: «el sujeto permanece centrado», «el sujeto ocupa el tercio izquierdo». El encuadre es una propiedad por golpe, y establecerlo una vez en la parte superior no sobrevive al segundo veinticinco.

El movimiento comienza antes de lo que debería. Un golpe sin una parada explícita se interpreta como una invitación a moverse. Declara los segmentos estáticos.

Cada generación se ve diferente a pesar de prompts idénticos. El espacio se está reinventando en cada ejecución. Ese es un problema de material de referencia, no un problema de prompt.

Llamándolo

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "seedance-2-5",
    "prompt": "0-6s: [Trípode fijo] plano medio, sin movimiento de cámara. 6-14s: [Dolly lento en] impulso a primer plano a 0,3 m/s, longitud focal fija 50 mm. 14-22s: [Sostenida] estática, el sujeto se gira al lente. 22-30s: [Seguimiento lateral izquierdo] 0,4 m/s, sujeto centrado.",
    "resolution": "1080p",
    "duration": 30
  }'

Añadir material de referencia ancla la geometría:

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "seedance-2-5",
    "prompt": "Coincide con el movimiento de cámara en la referencia. El sujeto permanece centrado en todo momento.",
    "video_urls": ["https://example.com/camera-reference.mp4"],
    "image_urls": ["https://example.com/set-wide.jpg", "https://example.com/set-close.jpg"],
    "resolution": "1080p",
    "duration": 30
  }'

Las entradas de medios son solo URLs públicas http(s), sin base64 aceptado. Las tarifas actuales y la superficie de solicitud completa están en reapi.ai/models/seedance-2-5.

FAQ

¿Por qué Seedance mueve la cámara tan rápido por defecto?

Porque las palabras descriptivas se asignan a vectores de velocidad predeterminados, y los descriptores genéricos se resuelven hacia alta aceleración. Los adjetivos no son métricas de velocidad.

¿Cómo especifico la velocidad de cámara con precisión?

Usa un número y una unidad. «0,5 m/s» o «2 segundos por metro» ambos limitan el modelo; «lento» no.

¿Cuál es el formato de prompt con marca de tiempo?

Divide el plano en rangos de tiempo, cada uno con un tipo de equipo entre corchetes, una velocidad explícita y una restricción de encuadre. Declara las sostenidas así como los movimientos.

¿Cómo evito que la cámara se aleje de mi sujeto?

Pon una restricción de encuadre en cada golpe en lugar de una sola en la parte superior. El encuadre no persiste a lo largo de un plano largo por sí solo.

¿Ayuda el material de referencia con el control de cámara?

Sí, más de lo que hace la redacción del prompt. Un video de referencia cuyo movimiento quieres que se repita es el ancla más fuerte, seguido por fotogramas fijos que establezcan el espacio.

¿Por qué prompts idénticos dan trayectorias de cámara diferentes?

Porque el espacio se está rederivando en cada ejecución. Proporciona geometría de referencia en lugar de describir la sala en texto.

¿Qué causa el desenfoque de movimiento en planos generados?

Velocidad demasiado alta para que la velocidad de fotogramas se resuelva. Reduce la velocidad numérica en lugar de pedir menos desenfoque.

Dirigir en lugar de describir

El cambio mental que arregla el control de cámara de Seedance 2.5 es pequeño y específico. Deja de escribir cómo debería sentirse el plano y empieza a escribir qué hace el equipo: qué pieza de equipamiento, moviéndose qué tan rápido, durante cuánto tiempo, deteniéndose cuándo, encuadrado cómo.

Cada adjetivo en un prompt de cámara es una decisión entregada a un modelo que la resolverá hacia movimiento. Cada número es una decisión que mantuviste. Las generaciones más largas hacen ese intercambio más marcado, porque treinta segundos de interpretación sin restricciones derivan más que cinco. Escribe los golpes, nombra el equipo, dale geometría para aferrarse a ella, y la salida deja de ser una lotería.

Referencias

  1. Volcano Engine. Seedance and the Doubao video model family. Retrieved July 2026 from volcengine.com

Further reading