
Agente de vídeo de IA: bucle crítico para control de calidad
Construye un bucle crítico para agentes de vídeo con reglas de aceptación, alcances de reparación, límites de reintentos y revisión humana antes de finalizar.
Un agente de vídeo de IA necesita una decisión de aceptación separada después de la generación. Una tarea puede completarse con éxito mientras que el clip aún cambia una cara, tuerce un producto, inventa texto de etiqueta o termina en un fotograma que no puede conectar con la siguiente toma. Un bucle crítico detecta esos fallos, explica qué se rompió y envía solo la toma afectada para reparación.
Este es un flujo de trabajo evaluador-optimizador aplicado a la producción de vídeo. El generador crea un clip; el crítico lo compara con criterios explícitos; el agente acepta, repara, escala o detiene.[1]
TL;DR
- Escribe un contrato de toma antes de la generación. Separa los detalles que deben mantenerse fijos del movimiento, la iluminación y los cambios de cámara permitidos.
- Ejecuta comprobaciones determinísticas primero: estado de la tarea, URL de salida, legibilidad del archivo, duración, dimensiones y presencia de audio.
- Haz que el crítico devuelva evidencia y alcance de reparación, no una puntuación de calidad vaga.
- Reintenta solo la toma fallida y preserva cada parte que ya pasó.
- Establece un límite para los intentos completados. Un bucle sin condición de parada puede convertir una toma difícil en una factura abierta.
- Mantén una compuerta humana para similitudes, copia legal, afirmaciones de marca y el corte final.

Por qué una generación completada no es una toma aceptada
La infraestructura de generación y la revisión creativa responden preguntas diferentes. El sistema de tareas sabe si un proveedor devolvió un archivo. No sabe si la botella mantuvo sus proporciones, el actor permaneció reconocible o el último fotograma coincide con el guion gráfico.
Esa distinción también afecta el costo. En reAPI, las tareas completed reportan el cargo resuelto en usage.credits, mientras que las tareas fallidas se reembolsan cuando el flujo de trabajo termina en fallo.[3] Si una tarea se completa y tu equipo rechaza el clip por un defecto creativo, sigue siendo una generación completada. La aplicación, por lo tanto, necesita un presupuesto para reintentos creativos, incluso cuando los fallos del proveedor no cuestan nada.
Trata el resultado de la generación como un candidato, no como un activo terminado.
Paso 1: Dale al agente de vídeo de IA un contrato de toma
Un crítico no puede tomar una decisión consistente desde "¿se ve bien?" Escribe las reglas de aceptación antes de la primera solicitud para que el planificador, generador, crítico y revisor humano juzguen lo mismo.
{
"shot_id": "03-product-orbit",
"intent": "Reveal the side label while keeping the bottle centered",
"must_keep": [
"bottle silhouette and cap width",
"label colors and aspect ratio",
"no added words or marks",
"single continuous shot"
],
"allowed_change": [
"camera moves 30 degrees left",
"background becomes slightly warmer"
],
"end_state": "front label readable and product centered",
"max_completed_attempts": 3,
"max_provider_failures": 2
}El contrato debe describir condiciones observables. "Premium", "cinemático" y "bonito" pueden pertenecer al resumen creativo, pero son malas reglas de aprobación/rechazo. "Ancho de tapa sin cambios" y "sin texto añadido" son más fáciles de inspeccionar y reparar.
Si el trabajo requiere preparación detallada de referencia de producto, usa el flujo de trabajo de comercio electrónico de Seedance 2.5. Si el fallo es cambio de identidad entre tomas, el flujo de trabajo de carácter de GPT Image 2 y Seedance cubre el paquete de referencia y el traspaso de continuidad. El bucle crítico se sitúa encima de cualquier flujo de trabajo en lugar de reemplazarlo.
Paso 2: Rechaza fallos técnicos antes de usar un crítico de modelo
No todas las comprobaciones necesitan otra llamada de IA. Usa código para hechos que el código puede verificar, luego reserva el juicio visual para un evaluador multimodal o una persona.
| Comprobación | Mejor método | Acción de fallo |
|---|---|---|
| Estado terminal de tarea | Estado de API | Espera, reintenta un fallo verdadero o detente |
| URL de salida existe | Validación de respuesta | Rechaza antes de revisión |
| El archivo puede decodificarse | Sonda de medios | Rechaza como salida rota |
| La duración está dentro de tolerancia | Metadatos de medios | Repara o revisión humana |
| Las dimensiones coinciden con especificación de entrega | Metadatos de medios | Rechaza o redimensiona si se permite |
| Pista de audio esperada existe | Metadatos de medios | Repara audio o regenera |
| Fotogramas primero y último existen | Extracción de fotograma | Continúa con comprobaciones de continuidad |
Este orden importa. Pedir a un modelo de visión que evalúe un archivo corrupto pierde tiempo y produce retroalimentación ambigua. Una compuerta técnica limpia da al crítico evidencia válida para inspeccionar.
El mismo principio aparece en evaluación de agentes en general: las evaluaciones útiles mezclan métodos y ninguna capa individual detecta cada problema.[2]
Paso 3: Pide al crítico evidencia, severidad y alcance de reparación
Una puntuación general oculta la decisión que realmente necesitas. Un crítico que devuelve 0.78 no te dice si regenerar la toma, reparar el audio o enviar el clip a una persona.
Usa salida estructurada en su lugar:
{
"decision": "repair",
"severity": "hard_fail",
"failed_check": "bottle geometry changes during the orbit",
"evidence": {
"time_range": "4.2s-5.0s",
"observation": "cap narrows and label aspect ratio shifts"
},
"repair_scope": "shot_03_only",
"preserve": ["camera path", "lighting", "duration"],
"next_instruction": "reinforce product geometry from the identity reference"
}Mantén el vocabulario del crítico pequeño. Cuatro decisiones suelen ser suficientes:
accept: cada regla dura pasó;repair: el fallo tiene un alcance estrecho y accionable;human_review: la evidencia es ambigua o el juicio es sensible;stop: se alcanzó el límite de reintentos o presupuesto.
Esta estructura previene un fallo común en control automático de calidad de vídeo: el crítico reescribe todo el resumen después de encontrar un defecto local.
Paso 4: Repara solo lo que falló
La reparación selectiva es el beneficio económico principal del bucle. Si cinco tomas pasan y la sexta tiene un mal fotograma final, no envíes la secuencia completa de nuevo a través de la generación.
| Fallo | Respuesta estrecha | Qué debe permanecer congelado |
|---|---|---|
| Producto o cara se desplaza tarde | Regenera la única toma desde el mismo fotograma de inicio aprobado | Referencias de identidad, encuadre, duración |
| El fotograma final pierde la transición | Reafirma el estado final o acorta la acción | Fotograma de apertura, carácter, escenario |
| El texto generado es incorrecto | Elimina texto crítico de la generación y añádelo en postproducción | Movimiento y composición aceptados |
| Falta audio | Repara la ruta de audio o regenera solo cuando la sincronización nativa es esencial | Clip visual aceptado cuando es posible |
| El movimiento de cámara es incorrecto | Simplifica a un movimiento con fotograma final definido | Sujeto, entorno, iluminación |
No dejes que el crítico introduzca una segunda dirección creativa. Su trabajo es comparar, diagnosticar y acotar el siguiente intento. El planificador es dueño del resumen.
Paso 5: Establece un presupuesto de reintentos y una regla de detención
Cada bucle automatizado necesita una salida. La orientación de Anthropic sobre evaluador-optimizador recomienda el patrón cuando los criterios de evaluación son claros y la retroalimentación puede producir mejora medible; es un ajuste pobre cuando el crítico no puede articular una corrección útil.[1]
Usa ambos un límite de intentos y un límite de gasto:
creative retry ceiling =
maximum completed attempts × estimated completed-task costLa estimación proviene de la tarjeta de tarifas en vivo del modelo elegido. El monto resuelto proviene de usage.credits de la tarea; lee ese valor en lugar de intentar reconstruir reglas de facturación específicas del modelo en el cliente.[3]
Una política de detención práctica podría escalar cuando la misma regla dura falla dos veces, cuando el siguiente reparo cambiaría una propiedad previamente aceptada, o cuando el presupuesto restante no puede cubrir otro intento. Estas son decisiones de producto, no límites de modelo universales.
Una implementación mínima de bucle crítico
El bucle puede estar encima de cualquier modelo de vídeo asincrónico. El modelo de medios genera; la aplicación almacena el id de tarea, espera un estado terminal, ejecuta comprobaciones técnicas y llama al crítico solo en salida válida.
type CriticDecision =
| { action: 'accept' }
| { action: 'repair'; repairPrompt: string }
| { action: 'human_review'; reason: string }
| { action: 'stop'; reason: string };
async function produceAcceptedShot(contract: ShotContract) {
let request = contract.initialRequest;
let completedAttempts = 0;
let providerFailures = 0;
while (
completedAttempts < contract.maxCompletedAttempts &&
providerFailures < contract.maxProviderFailures
) {
const task = await submitVideo(request);
const result = await pollUntilTerminal(task.id);
if (result.status === 'failed') {
providerFailures++;
continue;
}
completedAttempts++;
await runDeterministicMediaChecks(result.output.video_urls[0], contract);
const decision: CriticDecision = await reviewShot(result, contract);
if (decision.action === 'accept') return result;
if (decision.action !== 'repair') return decision;
request = applyNarrowRepair(
contract.initialRequest,
decision.repairPrompt
);
}
return { action: 'stop', reason: 'attempt or provider-failure ceiling reached' };
}El código de producción también necesita persistencia, tiempos de espera, manejo de límites de velocidad y un registro de qué salida aprobó finalmente la persona. Lo más importante es no enviar un duplicado simplemente porque el cliente dejó de esperar. Las tareas de vídeo pueden ejecutarse durante minutos, y el endpoint de tarea proporciona el estado autoritario.[3]
Dónde reAPI encaja en un flujo de trabajo de agente de vídeo de IA
El bucle crítico no debe depender de un modelo de vídeo. El planificador puede necesitar una toma larga para una toma, un control de referencia más fuerte para otra, o una ruta de borrador más barata mientras la dirección visual está sin resolver.
reAPI expone modelos de vídeo actuales a través de un catálogo y usa un ciclo de vida de tarea asincrónico para la generación de medios.[4] Eso mantiene el envío, encuesta, uso resuelto, manejo de fallos y almacenamiento de salida consistente mientras los campos de solicitud específicos del modelo permanecen explícitos. El agente puede cambiar de modelos sin fingir que sus superficies de control son idénticas.
Comienza con el catálogo de modelos de vídeo, luego usa la documentación del modelo seleccionado para sus campos reales. Usa la referencia canónica de API de Tareas para encuesta, salida, uso, errores y semántica de reembolso.
FAQ
¿Un crítico de vídeo de IA necesita ver el vídeo completo?
No siempre. Las comprobaciones determinísticas pueden inspeccionar metadatos, mientras que un crítico visual puede comenzar con fotogramas muestreados y los estados de inicio y final planificados. Movimiento continuo, sincronización de labios, sonido o artefactos de corta duración pueden requerir revisión completa de vídeo y audio. Escala cuando el evaluador disponible no puede inspeccionar la evidencia relevante.
¿El generador y el crítico deben usar el mismo modelo?
Pueden, pero no tienen que. La separación de roles importa más que el número de vendedores de modelos. El crítico necesita el contrato, la evidencia de salida y un esquema de decisión restringido; no debe heredar permiso para reescribir el resumen creativo.
¿Cuántos reintentos debe permitir un agente de vídeo de IA?
No hay número universal. Establece el límite desde importancia de la toma, costo de generación completada, tiempo de entrega y probabilidad de que la retroalimentación del crítico pueda cambiar el resultado. Escala fallos duros repetidos en lugar de buclar hasta que el presupuesto desaparezca.
¿Se cobran las generaciones de vídeo fallidas en reAPI?
Las tareas fallidas se reembolsan automáticamente. Un clip completado que tu crítico rechaza por razones creativas sigue siendo una tarea completada y reporta su cargo resuelto en usage.credits.[3]
¿Qué comprobaciones siempre deben requerir una persona?
Mantén una decisión humana para afirmaciones legales o fácticas, similitudes identificables, texto de marca crítico, contenido sensible y aprobación editorial final. Las comprobaciones automatizadas deben reducir la cola de revisión, no asumir silenciosamente responsabilidad.
Conclusión
Un flujo de trabajo de agente de vídeo de IA se vuelve útil cuando puede rechazar una toma técnicamente exitosa pero inutilizable. Define el contrato primero, usa código para comprobaciones objetivas, exige evidencia del crítico, repara solo el alcance fallido y detente cuando se agote el presupuesto o la calidad de retroalimentación. El bucle no garantiza una generación perfecta. Previene que una toma mala se convierta silenciosamente en el problema del editor.
References
- Anthropic. Building effective agents: evaluator-optimizer workflows, gates, and stopping conditions. Retrieved August 27, 2026 from anthropic.com
- Anthropic. Demystifying evals for AI agents. Retrieved August 27, 2026 from anthropic.com
- reAPI. Tasks API: polling,
usage.credits, status values, and refund behavior. Retrieved August 27, 2026 from reapi.ai/docs/api/tasks - reAPI. Live model catalog and video model availability. Retrieved August 27, 2026 from reapi.ai/models
Further reading
- reAPI. Seedance 2.5 for E-commerce Video: A Real Workflow. reapi.ai/blog/seedance-2-5-ecommerce-video
- reAPI. GPT Image 2 + Seedance 2.0: A Character Consistency Workflow. reapi.ai/blog/gpt-image-2-seedance-2-0-character-workflow
- reAPI. AI video generation API comparison. reapi.ai/blog/best-ai-video-generation-api-2026
Autor

Categorías
Más publicaciones

Grok Imagine: 1.0 vs 1.5 vs Image 2.0, cuál elegir
Tres modelos Grok Imagine repartidos entre vídeo e imagen. Cuál tiene API pública, cuál es más barato y la confusa trampa de nomenclatura que cuesta horas.


Vídeos musicales con IA: de canción y fotos a vídeo completo
Convierte MP3 de 10 segundos a 5 minutos e imágenes 1-7 en vídeos musicales mediante una solicitud API, con subtítulos y tablas de precios precisos.


Cómo dirigir actuación natural en video AI usando beat sheets
Planifica escenas de diálogos de IA con beats de actuación, estados de personaje, progresión de cámara, prompts, checks de revisión y ejemplos API.
