
Coherencia de personajes en Seedance 2.0: guía oficial
El método oficial para mantener al mismo personaje: sintaxis de referencias, 12 entradas, voz, sincronización labial y prompts con varios planos.
La coherencia de personajes es la razón por la que Seedance 2.0 tiene su forma actual: el modelo admite hasta 9 imágenes, 3 clips de vídeo y 3 pistas de audio como referencias en una sola generación[1], y la propia guía de prompts de ByteDance documenta una sintaxis para fijar un sujeto a imágenes de referencia concretas[2]. Gran parte de la frustración que aparece en los foros de la comunidad («el mismo personaje salió diferente», «ignoró mi segunda referencia») se debe a reglas que sí están documentadas, pero que casi nadie lee.
Esta guía reúne esas reglas a partir de la documentación oficial de prompts de ByteDance, la referencia de la API y los tutoriales de Dreamina. También deja claros los límites reales: qué no cuenta con un mecanismo oficial (bloqueo de personajes entre solicitudes, seeds) y qué corresponde a cada plataforma (la cuestión de la sincronización labial).
Resumen rápido
- El presupuesto de entrada de Seedance 2.0 es de 9 imágenes + 3 vídeos + 3 clips de audio. Los vídeos y el audio están limitados, cada uno, a un total de 15 segundos; el audio no puede enviarse sin otro contenido[1].
- Existe una sintaxis oficial de vinculación. Define el sujeto a partir de una imagen numerada («subject@image 1») y coloca primero las referencias más importantes, porque el orden influye en su peso[2].
- ByteDance recomienda 4–5 referencias, no el máximo. Aconseja usar un retrato y una imagen de cuerpo entero por personaje, y evitar conjuntos del mismo rostro desde varios ángulos[2].
- No hay parámetro seed ni ID de personaje persistente. La coherencia entre vídeos se consigue reutilizando exactamente el mismo conjunto de referencias y continuando con
return_last_frame[1][3]. - La guía sobre voz es real, pero la formulación sobre lipsync depende de la plataforma. La documentación de la API explica que las referencias de audio orientan la interpretación[1]; la promesa explícita de «lip-sync» aparece en la documentación de Dreamina, no en la de la API[4].
- Los planos múltiples tienen un patrón oficial. Numera los planos («Shot 1… Shot 2… Shot 3…») y no confíes en duraciones exactas para cada uno, tal como advierte la propia ByteDance[2].
El presupuesto de 12 referencias de Seedance 2.0, con precisión
Seedance 2.0 recibe referencias mediante un array de contenido en el que cada elemento declara un rol. Los límites documentados son: hasta 9 imágenes de referencia (JPEG, PNG, WebP, entre otros formatos; relación de aspecto entre 0,4 y 2,5; entre 300 y 6.000 píxeles por lado; menos de 30MB cada una), hasta 3 vídeos de referencia que sumen como máximo 15 segundos y hasta 3 referencias de audio que también sumen 15 segundos[1]. El audio modifica, pero no constituye el sujeto: la API rechaza las solicitudes que envían audio sin ningún otro contenido[1].
Hay una regla estructural que sorprende a casi todo el mundo: el modo de primer fotograma y el modo de referencia multimodal son formatos de solicitud mutuamente excluyentes[1]. O bien proporcionas al modelo un fotograma inicial exacto para animarlo, o bien un conjunto de referencias a partir del cual componer. Mezclar ambos conceptos en una solicitud es la vía más rápida para concluir que «ignoró mi imagen».
La regla que provoca los rechazos más confusos es esta: no se pueden subir directamente rostros de personas reales como referencias. Esa restricción y las vías autorizadas basadas en el consentimiento merecen un artículo propio; las explicamos en nuestra guía del error «not eligible».
La sintaxis oficial para fijar un personaje
La guía de prompts de ByteDance es excepcionalmente concreta sobre la vinculación. El patrón canónico define cada sujeto desde una imagen numerada, con una abreviatura que la documentación muestra como «subject@image 1»[2]. El artículo de lanzamiento emplea la misma referencia con @ en sus prompts de ejemplo[5], y el tutorial de Dreamina la reproduce como @AssetName en su editor[6]. La sintaxis elimina ambigüedades: cuando intervienen varias referencias, el prompt indica expresamente qué imagen aporta el rostro, cuál aporta el vestuario y cuál aporta la ubicación.
Junto a esa sintaxis, la guía establece cuatro reglas prácticas[2]:
- Usa 4–5 referencias, no 12. La documentación desaconseja llenar todos los espacios; cada recurso adicional diluye la atención.
- Para cada personaje, usa un retrato y una imagen de cuerpo entero. Esa pareja fija mejor la identidad que una colección de ángulos.
- Evita conjuntos con varias vistas de la misma persona. ByteDance los desaconseja expresamente; pueden provocar cambios de identidad en lugar de impedirlos.
- Ordena por importancia. Cuanto antes aparezca algo en el prompt, mayor será su influencia. Coloca el personaje antes que la ubicación y la ubicación antes que el panel de estilo.
Ese es todo el secreto que muchos vídeos sobre «trucos de coherencia» vuelven a vender: define los sujetos de forma explícita, aporta menos referencias y de mayor calidad, y ordénalas con intención.
El mismo personaje en varios vídeos
La documentación establece un límite que ningún tutorial debería difuminar: Seedance 2.0 no tiene un ID de personaje persistente, una entrada seed ni memoria entre solicitudes. Ni la referencia de parámetros de ByteDance ni la API de reAPI exponen un seed[1][3]. Por tanto, la pregunta «¿Seedance usa números seed?» tiene una respuesta clara: no; el control de la determinación depende de las referencias, no de un seed.
En su lugar, esto es lo que funciona, en el orden de un flujo de producción:
Inmoviliza el conjunto de referencias. Utiliza las mismas imágenes del personaje, en el mismo orden y con las mismas expresiones de vinculación en cada solicitud. La coherencia de Seedance 2.0 procede de entradas idénticas: guarda el conjunto junto a los prompts y trata cualquier cambio como una nueva versión del personaje.
Encadena con return_last_frame. La API puede devolver el último fotograma de una generación[1]. Úsalo como primer fotograma del siguiente clip para mantener la continuidad entre escenas sin volver a sortear la identidad en las uniones.
Permite que los rostros generados vuelvan a entrar de forma válida. El contenido generado por la plataforma para tu cuenta durante los últimos 30 días se considera una entrada de confianza aunque contenga rostros[7]. Eso hace posible el trabajo iterativo con personajes dentro de las reglas sobre rostros.
A escala de evaluación, el informe técnico de ByteDance sitúa a Seedance 2.0 en primer lugar entre sus competidores en coherencia del sujeto[5]. Los mecanismos anteriores permiten aplicar esa capacidad a una serie, no solo a un clip.
Voz, música y la cuestión de la sincronización labial
Las referencias de audio de Seedance 2.0 orientan tres elementos: el sonido del resultado, el ritmo de la interpretación y el carácter de la voz. La API acepta hasta tres clips que sumen 15 segundos en el rol reference_audio[1]. El flujo práctico para «hacer que mi personaje interprete esta canción» es tan directo como parece: adjunta la pista (mediante una URL pública en plataformas API), vincula el personaje desde las imágenes y describe la interpretación en el prompt.
En cuanto a la sincronización labial, las fuentes difieren y conviene ser precisos. La documentación de la API de ByteDance describe la generación conjunta de audio y vídeo y los resultados guiados por audio; las palabras «lip-sync» no aparecen. Es la documentación de producto de Dreamina la que lo promete: afirma que una muestra de voz guía el carácter vocal y «aligns lip-sync, pacing, expressions»[4]. En la práctica, la misma familia de modelos impulsa ambas plataformas. Sin embargo, si tu canal de producción exige por contrato una sincronización exacta de la boca, prueba con tu propio material en vez de citar una página de documentación: la formulación de la API promete deliberadamente menos.
La coherencia de voz entre clips sigue la misma lógica que la coherencia visual: reutiliza siempre la misma muestra de voz en el mismo espacio. No existe un voice ID que puedas fijar; la muestra es el ID.
Prompts con varios planos que resisten la generación
El patrón oficial para incluir varios planos en un clip es una descripción de storyboard numerada: «Shot 1: … Shot 2: … Shot 3: …»[2]. La guía incluye dos advertencias directas: los segundos exactos por plano no se respetan de forma fiable, así que describe la secuencia y el énfasis en vez de usar códigos de tiempo[2]; además, cada plano multiplica la complejidad, por lo que la regla de usar menos referencias cobra aún más importancia en prompts con varios planos.
Para cualquier pieza que supere lo que admite una sola generación (Seedance 2.0 tiene un límite de 15 segundos[1]), el flujo es: storyboard → prompts por clip con el conjunto de referencias inmovilizado → uniones con return_last_frame. Seedance 2.5 ya amplía una sola generación a 30 segundos y ofrece control de prompts por segmento. Nuestra guía de estado de Seedance 2.5 recoge sus límites actuales de producción.
Si quieres ejecutar todo esto mediante una API, la superficie completa de referencias (imágenes, vídeos, audio, primer fotograma y devolución del último fotograma) está disponible en Seedance 2.0 de reAPI, con facturación por segundo. Solo un vídeo de origen real selecciona la tarifa reducida; el reloj facturable incluye entonces la duración de salida más la duración total de los vídeos de origen redondeada al siguiente segundo entero[3].
Preguntas frecuentes
¿Cuántas imágenes de referencia admite Seedance 2.0?
Hasta 9 imágenes, además de 3 vídeos (15 segundos en total) y 3 clips de audio (15 segundos en total) en una sola solicitud[1]. ByteDance recomienda utilizar 4–5 recursos bien elegidos en lugar del máximo[2].
¿Cómo mantengo a la misma persona en varios vídeos de Seedance 2.0?
Inmoviliza un conjunto de referencias (retrato + cuerpo entero), vincúlalo con la sintaxis subject@image, reutilízalo de forma idéntica en cada solicitud y encadena las escenas con return_last_frame[1][2]. No existe un parámetro de bloqueo de personajes: el conjunto de referencias es el bloqueo.
¿Seedance 2.0 utiliza números seed como entrada?
No. No existe ningún parámetro seed en el esquema de solicitud documentado por ByteDance ni en la API de reAPI[1][3]. La repetibilidad procede de usar referencias y prompts idénticos; es una repetibilidad aproximada, no bit a bit.
¿Puede Seedance 2.0 sincronizar los labios con una canción de Suno?
Adjunta la pista como referencia de audio y describe la interpretación vocal en el prompt. La API documenta la generación guiada por audio[1], mientras que la afirmación explícita sobre la sincronización labial procede de la documentación de Dreamina[4]. Para una sincronización apta para publicación, valida el resultado con tus propias imágenes.
¿Cuántos clips de audio admite Seedance 2.0?
Tres, con un máximo total de 15 segundos, y nunca solos: el audio debe acompañar a otro contenido en la solicitud[1].
¿Cómo describo varios planos en un clip de Seedance 2.0?
Utiliza un storyboard numerado, «Shot 1 / Shot 2 / Shot 3», como indica la guía oficial, que también advierte que las duraciones exactas de cada plano son aproximadas[2].
¿Por qué se rechazó el rostro de mi personaje?
Los rostros de personas reales no pueden subirse directamente como referencias. Es una regla del modelo con excepciones documentadas basadas en el consentimiento[7]. Encontrarás todos los detalles en nuestra guía del error «not eligible».
El método de coherencia en una frase
Vincula los sujetos de forma explícita, proporciona 4–5 referencias deliberadas con el personaje en primer lugar, inmoviliza ese conjunto para toda la serie, encadena los clips mediante el último fotograma y reutiliza la misma muestra de voz cuando el sonido sea importante. Todo lo anterior procede de la documentación de ByteDance, no del folclore, y cada elemento funciona mediante un solo endpoint de reAPI. Así se consigue la coherencia de personajes en Seedance 2.0 sin misterios: menos referencias, de mayor calidad y utilizadas siempre de la misma manera.
Referencias
- Volcano Engine / BytePlus (ByteDance). Referencia de la API de Seedance 2.0: roles de contenido, límites de referencias, exclusividad del primer fotograma y return_last_frame. Consultado en julio de 2026 en docs.byteplus.com/en/docs/ModelArk/1520757
- Volcano Engine / BytePlus (ByteDance). Guía oficial de prompts de Seedance 2.0: sintaxis de vinculación de sujetos, cantidad y orden de referencias, patrón de varios planos. Consultado en julio de 2026 en docs.byteplus.com/en/docs/ModelArk/2222480
- reAPI. Seedance 2.0: documentación de la API y página del modelo. Consultado en julio de 2026 en reapi.ai/docs/seedance-2-0
- Dreamina (CapCut). Página de la herramienta Seedance 2.0: muestra de voz y sincronización labial. Consultado en julio de 2026 en dreamina.capcut.com/tools/seedance-2-0
- ByteDance Seed. Artículo de lanzamiento e informe técnico de Seedance 2.0 (arXiv:2604.14148). Consultado en julio de 2026 en seed.bytedance.com/en/blog/seedance-2-0-official-launch
- Dreamina (CapCut). Tutorial de prompts de Seedance 2.0: referencias @AssetName y Multiframes. Consultado en julio de 2026 en dreamina.capcut.com/resource/seedance-2-0-prompt
- Volcano Engine / BytePlus (ByteDance). Excepciones de entrada de confianza para contenido generado y recursos con consentimiento verificado. Consultado en julio de 2026 en docs.byteplus.com/en/docs/ModelArk/2291680
Lecturas relacionadas
- reAPI. Seedance 2.0 «Not Eligible»: por qué ocurre y qué funciona. reapi.ai/blog/seedance-not-eligible-explained
- reAPI. Qué es Seedance 2.0 y cómo utilizarlo (guía de 2026). reapi.ai/blog/what-is-seedance-2-0-and-how-to-use-it
- reAPI. Seedance 2.5: estado, acceso API y límites actuales. reapi.ai/blog/seedance-2-5-what-we-know-2026
Autor

Categorías
Más publicaciones

¿Qué puede hacer reAPI? Casos de uso de imagen, vídeo y LLM
Descubre qué puede hacer reAPI hoy: API separadas para chat y medios cubren imagen, vídeo, audio y lenguaje, con casos reales y guía de inicio.


Alternativas a fal.ai en 2026: 5 opciones comparadas
¿Buscas alternativas a fal.ai en 2026? Compara Replicate, Together AI, RunPod, Hugging Face y reAPI en modelos, precios, velocidad y compatibilidad de la API.


La API Veo 3.1 más barata en 2026: precios reales
Veo 3.1 cuesta desde $0.40/sec con Google hasta $0.046 por clip de 8 segundos en reAPI. Comparación de cinco proveedores, mayo de 2026.
