Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
GPT Image 2 y Seedance 2.0: coherencia de personajes
2026/08/02

GPT Image 2 y Seedance 2.0: coherencia de personajes

Usa ambos para reducir desviación de caracteres. Construye referencias, anima fotogramas y encadena clips sin perder identidad en secuencias.

El flujo de trabajo más confiable de GPT Image 2 + Seedance 2.0 separa el diseño de identidad del movimiento. Primero construye y aprueba el personaje en GPT Image 2, luego reutiliza ese mismo paquete visual para crear el fotograma inicial de cada toma, y luego pide a Seedance 2.0 que anime el fotograma en lugar de reinventar a la persona a partir de texto.

Esto reduce la desviación de caracteres porque cada modelo realiza un trabajo. GPT Image 2 controla la cara, la silueta, el vestuario y el encuadre. Seedance controla el movimiento, la cámara, el tiempo y el audio. No es una garantía de que un personaje "nunca derive"—ninguna API actual expone un bloqueo de identidad perfecto—pero es un flujo de trabajo de producción repetible con puntos de control claros.

Resumen

  • Bloquea el fotograma antes de generar movimiento. Un fotograma inicial débil o inconsistente se convierte en un vídeo débil.
  • Crea un paquete de personaje canónico. Mantén un retrato neutral, vista de cuerpo completo, vista de tres cuartos y un bloque de identidad breve.
  • Genera cada fotograma de toma a partir de esas referencias congeladas. GPT Image 2 en reAPI acepta hasta 16 URL de imagen pública en una solicitud imagen a imagen.
  • Pide a Seedance movimiento, no identidad. Pasa el fotograma aprobado y describe acción, cámara, ritmo y sonido.
  • Reutiliza referencias sin cambiarlas a mitad del proyecto. Una cara "mejor" a mitad de una secuencia crea una segunda definición del personaje.
  • Encadena clips con el fotograma final devuelto. Seedance 2.0 puede devolver un fotograma final para el siguiente segmento, reduciendo saltos visuales en las uniones.

Por qué los personajes se desvían entre tomas de vídeo de IA

Las descripciones de texto no son registros de identidad. "Una mujer con cabello corto negro, ojos verdes y una chaqueta roja" describe una categoría que contiene millones de caras posibles. Cada solicitud de texto a vídeo nueva puede muestrear a otra persona válida mientras sigue las palabras.

La desviación también entra a través de cambios que parecen inofensivos para un revisor humano:

  • un corte diferente oculta la línea de la mandíbula o las proporciones del cuerpo;
  • los cambios dramáticos de iluminación alteran aparentemente el color de los ojos, el cabello y la piel;
  • los indicadores de vestuario compiten con los detalles faciales;
  • una nueva referencia introduce una nariz, edad o peinado diferente;
  • las instrucciones de movimiento piden giros u oclusión que el fotograma de origen no puede respaldar.

Seedance 2.0 acepta texto, imágenes, audio y vídeo como modalidades de referencia, con hasta nueve imágenes, tres vídeos y tres clips de audio en su plataforma abierta actual.[2] Más referencias no significa automáticamente más coherencia. Solo funcionan cuando están de acuerdo.

El flujo de trabajo de coherencia de personajes de dos etapas

El diseño de identidad GPT Image 2 que fluye hacia verificaciones de movimiento y continuidad de Seedance 2.0

La tubería tiene seis puertas. No avances hasta que la puerta actual pase, porque reparar la identidad después de la animación es más lento que regenerar un fotograma.

1. Escribe un contrato de identidad

Define solo las características que deben sobrevivir en cada toma. Mantén el bloque lo suficientemente corto para pegarlo sin cambios en indicadores de imagen.

CHARACTER: Mara, fictional adult woman, early 30s
FACE: oval face, wide-set brown eyes, straight nose, small scar above left eyebrow
HAIR: chin-length black bob, center part
WARDROBE: burnt-orange field jacket, charcoal crew-neck shirt
ANCHOR: narrow silver compass pendant
DO NOT CHANGE: age, facial geometry, hair length, scar side, pendant shape

Evita etiquetas subjetivas como "hermosa", "genial" o "cinematográfica". Invitan al modelo a rediseñar a la persona. Los anclajes físicos son más fáciles de auditar.

2. Genera el retrato maestro en GPT Image 2

Comienza con luz uniforme, una expresión neutral, geometría facial visible y un fondo simple. GPT Image 2 admite generación y edición de imágenes; OpenAI documenta texto como entrada e imagen como entrada y salida.[1]

curl https://reapi.ai/api/v1/images/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-image-2",
    "prompt": "Character reference portrait. Fictional adult woman, early 30s, oval face, wide-set brown eyes, straight nose, small scar above left eyebrow, chin-length black bob with center part, neutral expression, even soft light, plain warm-gray background, realistic editorial photography, no text",
    "size": "3:4",
    "resolution": "2k"
  }'

Guarda la URL devuelta como el retrato canónico. No elijas una imagen de héroe dramático como maestro; elige la cara que es más fácil de leer.

3. Expande un retrato en un paquete de referencia

Usa solicitudes imagen a imagen con el retrato aprobado en image_urls. Genera una vista neutral de cuerpo completo, vistas de tres cuartos izquierdo y derecho, y una hoja de vestuario. Pide al modelo que preserve la identidad en lugar de "hacer una persona similar".

curl https://reapi.ai/api/v1/images/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-image-2",
    "prompt": "Preserve the exact identity, age, facial geometry, scar position, hair cut, jacket, shirt, and compass pendant from the reference. Create a clean full-body character sheet with front and three-quarter views, neutral stance, even studio light, plain background, no labels, no extra people",
    "image_urls": ["https://your-cdn.com/mara-master.png"],
    "size": "16:9",
    "resolution": "2k"
  }'

La ruta de gpt-image-2 económica devuelve una imagen por solicitud y acepta hasta 16 URL de referencia HTTP(S) públicas. No expone una semilla o ID de personaje persistente.[3] La coherencia proviene por lo tanto de suministrar repetidamente los mismos píxeles aprobados.

4. Crea un fotograma de inicio controlado para cada toma

Escribe la lista de tomas antes de generar más imágenes. Para cada toma, alimenta el retrato maestro y la hoja de personaje de vuelta a GPT Image 2, luego cambia solo la escena, la pose, la lente y la composición.

Preserve the exact identity and wardrobe from Image 1 and Image 2.
Medium-wide 16:9 frame. Mara stands beside a rain-streaked train window at
night, body at three-quarter angle, face fully visible, compass pendant visible.
Camera at eye level, 50mm lens, soft carriage practical light.
No additional people. Do not change facial geometry, age, hairstyle, scar side,
jacket color, or pendant.

Aprueba el fotograma estático frente al maestro antes de pagar para animarlo. Este es el punto más barato para rechazar una cara cambiada, un anclaje faltante o una pose incompatible.

5. Anima el fotograma con Seedance 2.0

Pasa el fotograma de toma aprobado primero, seguido de una o dos referencias de identidad canónica si es necesario. Seedance elige el modo imagen a vídeo cuando image_urls está presente; no hay un campo mode separado en reAPI.[4]

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedance-2.0-face",
    "prompt": "@Image1 remains the same character. She turns slowly toward the rain-streaked window and exhales. Subtle blink, natural breathing, gentle train vibration. Slow 10% camera push-in. Preserve face, black bob, eyebrow scar, orange jacket, and silver compass pendant. No scene cut, no wardrobe change.",
    "image_urls": [
      "https://your-cdn.com/shot-01-start.png",
      "https://your-cdn.com/mara-master.png"
    ],
    "size": "16:9",
    "resolution": "720p",
    "duration": 5,
    "generate_audio": true,
    "return_last_frame": true
  }'

Usa una variante Face para material de fuente de persona real identificable. Los personajes sintéticos pueden usar una ruta no Face u oficial elegible, pero los modelos y las reglas de seguridad aún se aplican. Solo sube los parecidos para los que tienes derecho y consentimiento.

6. Revisar, rechazar y encadenar

Revisa el clip completado fotograma por fotograma. Verifica la cara al principio, en el medio y al final, no solo la miniatura.

VerificarCondición de aprobaciónSi falla
Geometría facialLos ojos, la nariz, la mandíbula y la edad permanecen establesRegenera desde el mismo fotograma de inicio aprobado
Silueta de cabelloLa longitud y la raya siguen siendo reconociblesReduce los giros de cabeza o el movimiento del viento
Anclajes de identidadLa cicatriz, el colgante y la chaqueta permanecen presentesAcorta el indicador y reafirma los invariantes
Manos y oclusiónLa cara no se reconstruye después de una oclusión largaReduce la oclusión o divide la acción
Fotograma finalLo suficientemente limpio para comenzar la siguiente tomaSolicita otra toma antes de encadenar

Cuando un clip pase, usa output.last_frame_url como la primera imagen de la siguiente solicitud de Seedance. Mantén el retrato canónico en los espacios de referencia restantes. El fotograma final protege la continuidad espacial; el retrato maestro protege la identidad.

Reglas de indicación que reducen la desviación de caracteres

El orden de las instrucciones importa. Un indicador de movimiento útil de Seedance sigue esta secuencia:

identity binding → action → camera → environment motion → audio → invariants

Por ejemplo:

@Image1 remains the same character. She takes two measured steps toward the
door and looks over her left shoulder. Handheld camera tracks backward at chest
height. Curtains move slightly in the draft; quiet room tone and footsteps.
Preserve face, age, black bob, eyebrow scar, orange jacket, and pendant. No cut,
no new person, no costume change, no extreme motion blur.

No repitas una descripción visual larga que entre en conflicto con el fotograma suministrado. El fotograma ya define la escena. El indicador debe gastar la mayoría de sus fichas en el cambio a lo largo del tiempo.

Qué no hacer

Cinco accesos comunes empeoran la desviación.

  1. No generes cada toma a partir de texto. Cada solicitud muestrea a una persona nueva.
  2. No reemplaces al maestro después de la toma tres. Arregla una mala toma, no la identidad canónica.
  3. No mezcles referencias de diferentes generaciones. Los desacuerdos menores en la cara o la ropa se convierten en instrucciones que compiten.
  4. No pidas movimiento extremo de inmediato. Prueba un parpadeo, un giro pequeño o una caminata breve antes de giros, giros, multitudes y oclusión pesada.
  5. No uses un fotograma final desviado como la única siguiente referencia. Emparejalo con el maestro limpio o regenera la transición.

La guía de coherencia de caracteres de Seedance 2.0 cubre el ordenamiento de referencias, la reutilización de voz, las indicaciones de varias tomas y cadenas más largas con más detalle.

Estrategia de costo e iteración

Este flujo de trabajo cuesta menos cuando los fallos se capturan en la etapa de imagen fija. Una solicitud de GPT Image 2 produce un candidato, mientras que Seedance factura el vídeo por duración y resolución de salida. El vídeo de referencia cargado también puede agregar segundos facturables; las referencias de imagen no.[3][4]

Un bucle de producción disciplinado es:

  1. Genera borradores de personajes de 1K o 2K con bajo recuento.
  2. Aprueba un maestro y deja de explorar identidad.
  3. Genera y revisa cada fotograma inicial como imagen fija.
  4. Anima pruebas de 720p de cinco segundos con movimiento simple.
  5. Aumenta la duración o la resolución solo después de que el indicador pase.

Las tasas actuales pueden cambiar, así que calcula el presupuesto desde la página de modelo GPT Image 2 en vivo y la página de modelo Seedance 2.0 en lugar de copiar una cifra antigua por imagen o por segundo en una hoja de cálculo de producción. La guía de costo por segundo de Seedance explica las dimensiones de facturación.

Una estructura de carpetas reutilizable

Trata la coherencia de caracteres como gestión de activos, no suerte de indicación.

project/
  character/
    identity-contract.txt
    master-portrait.png
    character-sheet.png
    approved-refs.json
  shots/
    01-train-window/
      start-frame.png
      motion-prompt.txt
      output.mp4
      last-frame.png
    02-platform/
      start-frame.png
      motion-prompt.txt

Versiona el contrato de identidad y las URL de referencia. Si el director de arte aprueba un rediseño real, crea el paquete de personaje v2 y regenera todas las tomas dependientes en lugar de mezclar versiones.

Preguntas frecuentes

¿Garantiza GPT Image 2 + Seedance 2.0 desviación cero de caracteres?

No. Reduce la desviación anclando cada toma a imágenes aprobadas, pero ninguna API expone un bloqueo de personaje persistente perfecto. El movimiento, la oclusión, las referencias en conflicto y los clips largos aún pueden cambiar la identidad.

¿Cuántas referencias de personaje debo usar?

Comienza con el fotograma de toma aprobado más un retrato maestro. Agrega una hoja de personaje solo cuando contribuya con un ángulo faltante o información de cuerpo completo. El máximo de API no es un objetivo.

¿Debería el retrato maestro de GPT Image 2 ser cinematográfico?

No. Usa luz uniforme, una expresión neutral, una cara visible y un fondo simple. Construye iluminación cinematográfica en cada fotograma de toma después de que la identidad sea aprobada.

¿Qué modelo de Seedance 2.0 debo usar para una persona real?

Usa una variante Face que acepte entradas de personas reales identificables y confirma que tienes consentimiento y derechos de uso. Las rutas oficiales o no Face pueden rechazar tales referencias.[4]

¿Puedo reutilizar el fotograma final de Seedance para el siguiente clip?

Sí. Establece return_last_frame: true, luego pasa la URL devuelta a la siguiente solicitud. Mantén la referencia maestra original junto a ella para que los errores pequeños no se comparen a lo largo de la secuencia.

¿Debería agregar indicadores negativos como "sin desviación de cara"?

Los invariantes breves pueden ayudar, pero la calidad de referencia y el movimiento alcanzable importan más. Un fotograma inicial limpio más una acción pequeña visible es más fuerte que una larga lista de términos negativos.

El flujo de trabajo de vídeo de IA de coherencia de caracteres en una oración

GPT Image 2 define y organiza el personaje; Seedance 2.0 anima fotogramas aprobados; una puerta de revisión humana evita que una toma desviada contamine la siguiente. Ese es el flujo de trabajo práctico de coherencia de caracteres de GPT Image 2 + Seedance 2.0—no una promesa de identidad perfecta, sino una tubería controlada que puede repetirse, medirse y mejorarse.

Para una descripción general más amplia de la generación de imágenes, lee Cómo usar GPT Image 2. Para referencias de Seedance más allá de caracteres, consulta la documentación de la API de Seedance 2.0.

Referencias

  1. OpenAI. GPT Image 2 model documentation — image generation and editing, modalities, endpoints, and snapshots. Retrieved August 2, 2026. developers.openai.com/api/docs/models/gpt-image-2
  2. Team Seedance et al. Seedance 2.0: Advancing Video Generation for World Complexity. April 2026. arxiv.org/abs/2604.14148
  3. reAPI. GPT Image 2 API documentation — reference limits, resolutions, and async task behavior. Retrieved August 2, 2026. reapi.ai/docs/gpt-image-2
  4. reAPI. Seedance 2.0 API documentation — mode routing, reference limits, variants, last-frame return, and billing. Retrieved August 2, 2026. reapi.ai/docs/seedance-2-0
  5. Devenko AI. GPT Image 2.0 + Seedance 2.0: The Only Workflow Where Your Character Never Drifts. July 2026. devenkoai.medium.com