
Costo de imágenes IA vs video: 2-9 veces más caro
El costo IA por megapíxel es 2-9 veces mayor que un fotograma de vídeo. Análisis de precios por fotograma en ocho niveles de vídeo y siete modelos.
Un segundo de vídeo 720p de Seedance 2.0 Face cuesta $0.15375 y contiene 24 fotogramas, lo que pone cada fotograma en $0.0064[1]. La imagen individual más barata en la misma plataforma, Nano Banana 2 Lite, cuesta $0.015[2]. El costo de generación de imágenes IA es 2.3 veces el fotograma de vídeo, y ese fotograma de vídeo llega con 23 hermanos temporalmente consistentes.
Esa inversión se mantiene en todos los niveles que vendemos y se amplía en el extremo económico, donde un fotograma Seedance 2.0 Mini cuesta alrededor de $0.00158 frente a $0.015 para la imagen independiente menos cara. Aproximadamente nueve a uno. Vale la pena entender por qué, porque cambia qué herramienta eliges cuando necesitas una imagen fija.
TL;DR
- un fotograma de vídeo 720p cuesta $0.0064; la imagen independiente más barata cuesta $0.015[1][2].
- Normalizado por megapíxel, las imágenes cuestan 2 a 9 veces más que un fotograma de vídeo generado.
- La brecha de costo es más amplia en el extremo bajo (fotograma Mini 480p a $0.00158, aproximadamente 9 veces más barato que cualquier imagen) y más estrecha a 4K, donde las imágenes cuestan alrededor de 2 veces más.
- La facturación de vídeo se basa en píxeles totales en el clip; la facturación de imagen por generación, así que clips cortos subvencionan su propio recuento de fotogramas.
- El problema es el control. Un fotograma de vídeo no es direccionable, no es regenerable y no se puede guiar por solicitud de forma aislada.
- Extraer fotogramas fijos del vídeo generado es barato y legítimo; también es la herramienta equivocada cuando necesitas nueve composiciones no relacionadas.
Los números por fotograma
El vídeo se cotiza por segundo y se renderiza a 24 fotogramas por segundo, por lo que el costo por fotograma es la tarifa por segundo dividida entre 24. La tabla usa tarifas sin vídeo de origen en la familia Seedance 2.0[1][3]:
| Nivel | Por segundo | Por fotograma | Por megapíxel |
|---|---|---|---|
| Mini 480p | $0.038 | $0.00158 | $0.0039 |
| Mini 720p | $0.082 | $0.00342 | $0.0037 |
| Fast Face 480p | $0.062 | $0.00258 | $0.0063 |
| Fast Face 720p | $0.132 | $0.00550 | $0.0060 |
| Face 480p | $0.07125 | $0.00297 | $0.0072 |
| Face 720p | $0.15375 | $0.00641 | $0.0070 |
| Face 1080p | $0.3825 | $0.01594 | $0.0077 |
| Face 4K | $0.780 | $0.03250 | $0.0039 |
Frente al catálogo de imágenes[2][4][5][6]:
| Modelo | Por imagen | Por megapíxel |
|---|---|---|
| Nano Banana 2 Lite 1K | $0.015 | $0.0143 |
| Nano Banana 2 1K | $0.028 | $0.0267 |
| Nano Banana 2 4K | $0.064 | $0.0077 |
| Nano Banana Pro 1K | $0.033 | $0.0315 |
| Seedream 5.0 Pro 1K | $0.032 | $0.0305 |
| GPT Image 2 1K | $0.030 | $0.0286 |
| GPT Image 2 4K | $0.080 | $0.0096 |
El costo de generación de imágenes IA por megapíxel tiene un piso de $0.0143 y el nivel de vídeo más barato cuesta $0.0035. Cuatro veces. Compara los modelos de imagen insignia contra vídeo de nivel medio y el múltiplo alcanza nueve.
Por qué el costo de generación de imágenes IA diverge del vídeo
El vídeo se factura en total de píxeles enviados. La fórmula publicada para la familia Seedance multiplica la duración por el área del fotograma por la velocidad de fotogramas, luego divide en cubos de tokens[7]. Cada fotograma se factura de forma idéntica a todos los demás fotogramas, y no hay una sobrecarga fija por solicitud que valga la pena mencionar.
Las imágenes se facturan por invocación. Sea lo que sea que el modelo gaste en interpretación de solicitud, programación de muestreo y pases de seguridad se amortiza entre exactamente un resultado. Un clip de cuatro segundos amortiza la misma clase de sobrecarga entre 96.
El segundo factor es lo que se le pide al modelo que haga. Un modelo de imagen trata cada generación como un problema independiente: composición nueva, sujeto nuevo, todo nuevo. Un modelo de vídeo resuelve una composición y luego la propaga, lo cual es una operación fundamentalmente más barata por fotograma aunque sea un problema más difícil en general.
Ninguno de esos es un capricho de precios que alguien eligió. Es lo que realmente cuestan los flujos de trabajo, reflejado en la tarifa.
Cuándo extraer un fotograma fijo del vídeo es lo correcto
La aritmética sugiere un arbitraje obvio, y para algunos trabajos realmente funciona.
Si necesitas una toma heroica de un sujeto específico en una posición específica, el mínimo de cuatro segundos a 1080p cuesta $1.53 y devuelve 96 fotogramas candidatos a aproximadamente $0.01594 cada uno. Elige el mejor. Frente a $0.033 por una sola imagen Nano Banana Pro, estás pagando alrededor de 46 veces el precio total por 96 veces las opciones, con el sujeto mantenido consistente en todos ellos.
Si necesitas que un personaje aparezca en varios planos con la misma cara, el vídeo es el mecanismo de consistencia más barato por un margen amplio. Ese es todo el argumento de la generación impulsada por referencias, y es por qué el nivel de referencia existe a una tarifa por segundo más baja.
Si necesitas variedad de hoja de contacto en un concepto, la misma lógica se aplica. Veinte segundos de Mini 480p en múltiples solicitudes es $0.76 y produce 480 fotogramas.
Cuándo es incorrecto, que es a menudo
Un fotograma de vídeo no es direccionable. No puedes indicar el fotograma 37. Diriges el clip y aceptas lo que cae, mientras que un modelo de imagen te da una semilla, una solicitud completa y una regeneración en una salida única.
La compresión es real. Los fotogramas de vídeo provienen de una secuencia codificada con artefactos de compensación de movimiento que un generador fijo nunca introduce. A 480p, en un sujeto con textura fina, esto es visible y no se puede corregir en postproducción.
La renderización de texto se desmorona. Si la imagen fija necesita palabras legibles en ella, GPT Image 2 existe precisamente porque los modelos de vídeo no mantienen la tipografía estable fotograma a fotograma[6].
Las relaciones de aspecto están limitadas. Los niveles de vídeo envían 16:9 y un puñado de proporciones estándar. Los modelos de imagen en la misma plataforma alcanzan 1:4, 4:1 y 8:1[4], que el vídeo no puede hacer a ningún precio.
Y nueve composiciones no relacionadas significa nueve generaciones de cualquier forma. La ventaja por fotograma se evapora en el momento en que necesitas fotogramas que no están relacionados entre sí, porque la relacionabilidad es lo único que estás comprando.
El número que realmente importa para un producto
Ni el costo por fotograma ni por imagen es la cifra en la que presupuestar. Presupuesta sobre el costo por resultado aceptado.
Un flujo de trabajo de imagen que acepta uno de cuatro generaciones a $0.030 cuesta $0.120 por resultado. Un flujo de trabajo de vídeo que genera el mínimo de cuatro segundos a 720p Face por $0.615, luego mantiene un fotograma, cuesta $0.615 por resultado, y eso es peor, hasta que necesites resultados adicionales del mismo clip.
Ejecuta tu propia tasa de aceptación antes de decidir qué costo se aplica. La ventaja del costo de generación de imágenes IA de los fotogramas de vídeo es real, pero solo se convierte en dinero ahorrado cuando tu flujo de trabajo consume más de un fotograma por generación.
Dónde aparece la brecha en una factura real
Toma una tienda online que necesita 500 imágenes de producto fijas al mes. A Nano Banana Pro, el costo es $16.50. Cosechar los mismos 500 fotogramas del vídeo 1080p significa 21 segundos de generación a aproximadamente $8.033, más o menos la mitad, y cada fotograma comparte iluminación y tratamiento de cámara.
Ahora cambia el encargo a 500 productos no relacionados. La ruta de vídeo colapsa, porque 500 sujetos diferentes significa 500 clips separados, y el costo de repente es la opción más barata por un margen amplio. Mismo volumen mensual, respuesta opuesta, y la variable de decisión nunca fue el precio.
Esa es la forma útil de leer las tablas anteriores. El costo de generación de imágenes IA prima no es un margen en resultados equivalentes. Es lo que pagas por la independencia entre generaciones, e independencia es todo el punto de tu flujo de trabajo o es peso muerto. Averigua cuál tienes antes de optimizar el número equivocado.
FAQ
¿Un fotograma de vídeo coincide con la calidad que compra el costo de generación de imágenes IA?
No. Proviene de una secuencia codificada, así que lleva artefactos de compresión, y generalmente es más suave en la textura fina. A 1080p y superior, la diferencia se reduce considerablemente.
¿Puedo extraer fotogramas de un vídeo generado?
Sí. La salida es un archivo de vídeo estándar, así que cualquier herramienta de extracción de fotogramas lo maneja. Nada en la plataforma lo restringe.
¿Por qué el vídeo 4K es más barato por megapíxel que 1080p?
La tasa de tokens para el nivel 4K es más baja que para el nivel 1080p[7]. El costo total sigue siendo mucho más alto porque el fotograma lleva cuatro veces los píxeles, pero normalizado por megapíxel sale adelante.
¿Cuál es más barato para la consistencia de caracteres en planos?
Vídeo, decisivamente. La generación impulsada por referencias mantiene un sujeto estable en fotogramas a la tarifa por segundo, que es lo que los modelos de imagen cobran por resultado para aproximar.
¿El nivel de vídeo de referencia cambia esta matemática?
Reduce la tarifa por segundo pero agrega tu clip de entrada a la duración facturada[7]. Para la cosecha de fotogramas sin entrada de referencia, se aplica la tarifa simple.
¿Qué resolución renderiza realmente los niveles de vídeo?
480p renderiza alrededor de 864 x 496, 720p a 1280 x 720, 1080p a 1920 x 1080 y 4K a 3840 x 2160[7]. Esas son las dimensiones que utiliza la columna por megapíxel.
¿Las generaciones fallidas cuestan dinero?
No. Los trabajos fallidos se reembolsan automáticamente en reAPI[1].
Elegir entre los dos
Las tarjetas de tarifa dicen que los fotogramas de vídeo son baratos y el costo de generación de imágenes IA es alto, y tomado literalmente eso es correcto por un factor de dos a nueve. Tomado como consejo es engañoso, porque los dos productos no son sustitutos. El vídeo te vende una secuencia en la que cada fotograma se relaciona con sus vecinos. Las imágenes te venden un control independiente sobre un resultado a la vez.
Los flujos de trabajo donde la matemática realmente paga son los que quieren relacionabilidad: hojas de personajes, variaciones de disparo en un sujeto fijo, hojas de contacto de un concepto único. Para cualquier cosa que requiera nueve composiciones distintas o texto legible, el costo de generación de imágenes IA más alto compra un control que no puedes obtener de un fotograma de vídeo a ningún precio, y ese control es generalmente la compra más barata al final.
References
- reAPI. Seedance 2.0 Face, Fast Face, and Mini — model pages and live pricing. Retrieved August 17, 2026 from reapi.ai/models/seedance-2-0 and reapi.ai/models/seedance-2-0-mini
- reAPI. Nano Banana 2 Lite — model page and live pricing. Retrieved August 2026 from reapi.ai/models/nano-banana-2-lite
- reAPI. Seedance 2.0 Mini — model page and live pricing. Retrieved August 2026 from reapi.ai/models/seedance-2-0-mini
- reAPI. Nano Banana 2 — model page and live pricing. Retrieved August 2026 from reapi.ai/models/gemini-3-1-flash-image-preview
- reAPI. Nano Banana Pro — model page and live pricing. Retrieved August 2026 from reapi.ai/models/gemini-3-pro-image-preview
- reAPI. GPT Image 2 — model page and live pricing. Retrieved August 2026 from reapi.ai/models/gpt-image-2
- BytePlus. ModelArk — model pricing, token calculation formula and per-video examples. Retrieved August 2026 from docs.byteplus.com/en/docs/ModelArk/1544106
Autor

Categorías
Más publicaciones

Qué es Seedance 2.0 y cómo utilizarlo: guía de 2026
Qué es Seedance 2.0, cuáles son sus sitios oficiales, todas las plataformas disponibles y cómo llamar a la API. Verificado en julio de 2026.


Ventana de contexto GPT-6 Astra: el número 258K en Codex
Entiende la ventana de contexto de 1,05M tokens de GPT-6 Astra, por qué Codex muestra 258K en sesión y cómo medir compresión sin estimaciones.


FLUX 3 contra Seedance 2.5: fotogramas, duración y precio
Elige FLUX 3 o Seedance 2.5 según duración máxima, fotogramas ordenados, referencias, edición, audio generado, flujo Draft, resolución y costo de API.
