Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Costo de imágenes IA vs video: 2-9 veces más caro
2026/08/05

Costo de imágenes IA vs video: 2-9 veces más caro

El costo IA por megapíxel es 2-9 veces mayor que un fotograma de vídeo. Análisis de precios por fotograma en ocho niveles de vídeo y siete modelos.

Un segundo de vídeo 720p de Seedance 2.0 Face cuesta $0.15375 y contiene 24 fotogramas, lo que pone cada fotograma en $0.0064[1]. La imagen individual más barata en la misma plataforma, Nano Banana 2 Lite, cuesta $0.015[2]. El costo de generación de imágenes IA es 2.3 veces el fotograma de vídeo, y ese fotograma de vídeo llega con 23 hermanos temporalmente consistentes.

Esa inversión se mantiene en todos los niveles que vendemos y se amplía en el extremo económico, donde un fotograma Seedance 2.0 Mini cuesta alrededor de $0.00158 frente a $0.015 para la imagen independiente menos cara. Aproximadamente nueve a uno. Vale la pena entender por qué, porque cambia qué herramienta eliges cuando necesitas una imagen fija.

TL;DR

  • un fotograma de vídeo 720p cuesta $0.0064; la imagen independiente más barata cuesta $0.015[1][2].
  • Normalizado por megapíxel, las imágenes cuestan 2 a 9 veces más que un fotograma de vídeo generado.
  • La brecha de costo es más amplia en el extremo bajo (fotograma Mini 480p a $0.00158, aproximadamente 9 veces más barato que cualquier imagen) y más estrecha a 4K, donde las imágenes cuestan alrededor de 2 veces más.
  • La facturación de vídeo se basa en píxeles totales en el clip; la facturación de imagen por generación, así que clips cortos subvencionan su propio recuento de fotogramas.
  • El problema es el control. Un fotograma de vídeo no es direccionable, no es regenerable y no se puede guiar por solicitud de forma aislada.
  • Extraer fotogramas fijos del vídeo generado es barato y legítimo; también es la herramienta equivocada cuando necesitas nueve composiciones no relacionadas.

Los números por fotograma

El vídeo se cotiza por segundo y se renderiza a 24 fotogramas por segundo, por lo que el costo por fotograma es la tarifa por segundo dividida entre 24. La tabla usa tarifas sin vídeo de origen en la familia Seedance 2.0[1][3]:

NivelPor segundoPor fotogramaPor megapíxel
Mini 480p$0.038$0.00158$0.0039
Mini 720p$0.082$0.00342$0.0037
Fast Face 480p$0.062$0.00258$0.0063
Fast Face 720p$0.132$0.00550$0.0060
Face 480p$0.07125$0.00297$0.0072
Face 720p$0.15375$0.00641$0.0070
Face 1080p$0.3825$0.01594$0.0077
Face 4K$0.780$0.03250$0.0039

Frente al catálogo de imágenes[2][4][5][6]:

ModeloPor imagenPor megapíxel
Nano Banana 2 Lite 1K$0.015$0.0143
Nano Banana 2 1K$0.028$0.0267
Nano Banana 2 4K$0.064$0.0077
Nano Banana Pro 1K$0.033$0.0315
Seedream 5.0 Pro 1K$0.032$0.0305
GPT Image 2 1K$0.030$0.0286
GPT Image 2 4K$0.080$0.0096

El costo de generación de imágenes IA por megapíxel tiene un piso de $0.0143 y el nivel de vídeo más barato cuesta $0.0035. Cuatro veces. Compara los modelos de imagen insignia contra vídeo de nivel medio y el múltiplo alcanza nueve.

Por qué el costo de generación de imágenes IA diverge del vídeo

El vídeo se factura en total de píxeles enviados. La fórmula publicada para la familia Seedance multiplica la duración por el área del fotograma por la velocidad de fotogramas, luego divide en cubos de tokens[7]. Cada fotograma se factura de forma idéntica a todos los demás fotogramas, y no hay una sobrecarga fija por solicitud que valga la pena mencionar.

Las imágenes se facturan por invocación. Sea lo que sea que el modelo gaste en interpretación de solicitud, programación de muestreo y pases de seguridad se amortiza entre exactamente un resultado. Un clip de cuatro segundos amortiza la misma clase de sobrecarga entre 96.

El segundo factor es lo que se le pide al modelo que haga. Un modelo de imagen trata cada generación como un problema independiente: composición nueva, sujeto nuevo, todo nuevo. Un modelo de vídeo resuelve una composición y luego la propaga, lo cual es una operación fundamentalmente más barata por fotograma aunque sea un problema más difícil en general.

Ninguno de esos es un capricho de precios que alguien eligió. Es lo que realmente cuestan los flujos de trabajo, reflejado en la tarifa.

Cuándo extraer un fotograma fijo del vídeo es lo correcto

La aritmética sugiere un arbitraje obvio, y para algunos trabajos realmente funciona.

Si necesitas una toma heroica de un sujeto específico en una posición específica, el mínimo de cuatro segundos a 1080p cuesta $1.53 y devuelve 96 fotogramas candidatos a aproximadamente $0.01594 cada uno. Elige el mejor. Frente a $0.033 por una sola imagen Nano Banana Pro, estás pagando alrededor de 46 veces el precio total por 96 veces las opciones, con el sujeto mantenido consistente en todos ellos.

Si necesitas que un personaje aparezca en varios planos con la misma cara, el vídeo es el mecanismo de consistencia más barato por un margen amplio. Ese es todo el argumento de la generación impulsada por referencias, y es por qué el nivel de referencia existe a una tarifa por segundo más baja.

Si necesitas variedad de hoja de contacto en un concepto, la misma lógica se aplica. Veinte segundos de Mini 480p en múltiples solicitudes es $0.76 y produce 480 fotogramas.

Cuándo es incorrecto, que es a menudo

Un fotograma de vídeo no es direccionable. No puedes indicar el fotograma 37. Diriges el clip y aceptas lo que cae, mientras que un modelo de imagen te da una semilla, una solicitud completa y una regeneración en una salida única.

La compresión es real. Los fotogramas de vídeo provienen de una secuencia codificada con artefactos de compensación de movimiento que un generador fijo nunca introduce. A 480p, en un sujeto con textura fina, esto es visible y no se puede corregir en postproducción.

La renderización de texto se desmorona. Si la imagen fija necesita palabras legibles en ella, GPT Image 2 existe precisamente porque los modelos de vídeo no mantienen la tipografía estable fotograma a fotograma[6].

Las relaciones de aspecto están limitadas. Los niveles de vídeo envían 16:9 y un puñado de proporciones estándar. Los modelos de imagen en la misma plataforma alcanzan 1:4, 4:1 y 8:1[4], que el vídeo no puede hacer a ningún precio.

Y nueve composiciones no relacionadas significa nueve generaciones de cualquier forma. La ventaja por fotograma se evapora en el momento en que necesitas fotogramas que no están relacionados entre sí, porque la relacionabilidad es lo único que estás comprando.

El número que realmente importa para un producto

Ni el costo por fotograma ni por imagen es la cifra en la que presupuestar. Presupuesta sobre el costo por resultado aceptado.

Un flujo de trabajo de imagen que acepta uno de cuatro generaciones a $0.030 cuesta $0.120 por resultado. Un flujo de trabajo de vídeo que genera el mínimo de cuatro segundos a 720p Face por $0.615, luego mantiene un fotograma, cuesta $0.615 por resultado, y eso es peor, hasta que necesites resultados adicionales del mismo clip.

Ejecuta tu propia tasa de aceptación antes de decidir qué costo se aplica. La ventaja del costo de generación de imágenes IA de los fotogramas de vídeo es real, pero solo se convierte en dinero ahorrado cuando tu flujo de trabajo consume más de un fotograma por generación.

Dónde aparece la brecha en una factura real

Toma una tienda online que necesita 500 imágenes de producto fijas al mes. A Nano Banana Pro, el costo es $16.50. Cosechar los mismos 500 fotogramas del vídeo 1080p significa 21 segundos de generación a aproximadamente $8.033, más o menos la mitad, y cada fotograma comparte iluminación y tratamiento de cámara.

Ahora cambia el encargo a 500 productos no relacionados. La ruta de vídeo colapsa, porque 500 sujetos diferentes significa 500 clips separados, y el costo de repente es la opción más barata por un margen amplio. Mismo volumen mensual, respuesta opuesta, y la variable de decisión nunca fue el precio.

Esa es la forma útil de leer las tablas anteriores. El costo de generación de imágenes IA prima no es un margen en resultados equivalentes. Es lo que pagas por la independencia entre generaciones, e independencia es todo el punto de tu flujo de trabajo o es peso muerto. Averigua cuál tienes antes de optimizar el número equivocado.

FAQ

¿Un fotograma de vídeo coincide con la calidad que compra el costo de generación de imágenes IA?

No. Proviene de una secuencia codificada, así que lleva artefactos de compresión, y generalmente es más suave en la textura fina. A 1080p y superior, la diferencia se reduce considerablemente.

¿Puedo extraer fotogramas de un vídeo generado?

Sí. La salida es un archivo de vídeo estándar, así que cualquier herramienta de extracción de fotogramas lo maneja. Nada en la plataforma lo restringe.

¿Por qué el vídeo 4K es más barato por megapíxel que 1080p?

La tasa de tokens para el nivel 4K es más baja que para el nivel 1080p[7]. El costo total sigue siendo mucho más alto porque el fotograma lleva cuatro veces los píxeles, pero normalizado por megapíxel sale adelante.

¿Cuál es más barato para la consistencia de caracteres en planos?

Vídeo, decisivamente. La generación impulsada por referencias mantiene un sujeto estable en fotogramas a la tarifa por segundo, que es lo que los modelos de imagen cobran por resultado para aproximar.

¿El nivel de vídeo de referencia cambia esta matemática?

Reduce la tarifa por segundo pero agrega tu clip de entrada a la duración facturada[7]. Para la cosecha de fotogramas sin entrada de referencia, se aplica la tarifa simple.

¿Qué resolución renderiza realmente los niveles de vídeo?

480p renderiza alrededor de 864 x 496, 720p a 1280 x 720, 1080p a 1920 x 1080 y 4K a 3840 x 2160[7]. Esas son las dimensiones que utiliza la columna por megapíxel.

¿Las generaciones fallidas cuestan dinero?

No. Los trabajos fallidos se reembolsan automáticamente en reAPI[1].

Elegir entre los dos

Las tarjetas de tarifa dicen que los fotogramas de vídeo son baratos y el costo de generación de imágenes IA es alto, y tomado literalmente eso es correcto por un factor de dos a nueve. Tomado como consejo es engañoso, porque los dos productos no son sustitutos. El vídeo te vende una secuencia en la que cada fotograma se relaciona con sus vecinos. Las imágenes te venden un control independiente sobre un resultado a la vez.

Los flujos de trabajo donde la matemática realmente paga son los que quieren relacionabilidad: hojas de personajes, variaciones de disparo en un sujeto fijo, hojas de contacto de un concepto único. Para cualquier cosa que requiera nueve composiciones distintas o texto legible, el costo de generación de imágenes IA más alto compra un control que no puedes obtener de un fotograma de vídeo a ningún precio, y ese control es generalmente la compra más barata al final.

References

  1. reAPI. Seedance 2.0 Face, Fast Face, and Mini — model pages and live pricing. Retrieved August 17, 2026 from reapi.ai/models/seedance-2-0 and reapi.ai/models/seedance-2-0-mini
  2. reAPI. Nano Banana 2 Lite — model page and live pricing. Retrieved August 2026 from reapi.ai/models/nano-banana-2-lite
  3. reAPI. Seedance 2.0 Mini — model page and live pricing. Retrieved August 2026 from reapi.ai/models/seedance-2-0-mini
  4. reAPI. Nano Banana 2 — model page and live pricing. Retrieved August 2026 from reapi.ai/models/gemini-3-1-flash-image-preview
  5. reAPI. Nano Banana Pro — model page and live pricing. Retrieved August 2026 from reapi.ai/models/gemini-3-pro-image-preview
  6. reAPI. GPT Image 2 — model page and live pricing. Retrieved August 2026 from reapi.ai/models/gpt-image-2
  7. BytePlus. ModelArk — model pricing, token calculation formula and per-video examples. Retrieved August 2026 from docs.byteplus.com/en/docs/ModelArk/1544106