Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Gemini Omni vs Seedance 2.0: modelos de vídeo en 2026
2026/05/20

Gemini Omni vs Seedance 2.0: modelos de vídeo en 2026

Gemini Omni vs Seedance 2.0 en mayo de 2026: Google I/O frente al n.º 1 de Arena. Comparamos funciones, multiplaño, audio y precios.

Google lanzó Gemini Omni Flash el 19 de mayo de 2026 durante I/O. ByteDance ocupa el primer puesto de Artificial Analysis Video Arena con Seedance 2.0 desde febrero. Si ahora mismo eliges entre Gemini Omni y Seedance 2.0, estás decidiendo entre el primer modelo de vídeo de Google centrado en razonamiento y edición, y el modelo que, según los benchmarks, es el mejor generador puro del mercado.

La diferencia es más marcada que en la mayoría de comparativas «X vs Y» de esta categoría. Seedance 2.0 devuelve en una sola pasada un clip de hasta 4K, con varias tomas y audio acoplado. Gemini Omni Flash entrega un clip de 10 segundos que puedes seguir editando mediante una conversación. A continuación comparamos cada capacidad con fuentes de las páginas oficiales de ambos proveedores y precios de los listados activos de reAPI.

Resumen rápido

  • Fecha de lanzamiento. Seedance 2.0 se lanzó el 12 de febrero de 2026[5]. Gemini Omni Flash se presentó el 19 de mayo de 2026 en Google I/O[1].
  • Diferencia en benchmarks. Seedance 2.0 registra un Elo de 1,269 en texto a vídeo y 1,351 en imagen a vídeo en Artificial Analysis Video Arena, con el puesto #1 en ambas categorías[6]. Gemini Omni no figuraba en la clasificación cuando se lanzó.
  • Resolución máxima. Gemini Omni Flash admite 720p, 1080p y 4K[7]. Seedance 2.0 Face también admite 4K; Fast Face y Mini llegan hasta 720p[8].
  • Duración. Gemini Omni Flash genera 4, 6, 8 o 10 segundos[7]. Seedance 2.0 genera entre 4 y 15 segundos, con cortes entre varias tomas dentro del mismo clip[5].
  • Referencias. Gemini Omni Flash acepta 0, 1 o 3 imágenes de entrada[9]. Seedance 2.0 acepta hasta 9 imágenes + 3 clips de vídeo + 3 clips de audio por solicitud[10].
  • Modelo de edición. Gemini Omni está diseñado en torno a ediciones conversacionales de varios turnos[1]. Seedance 2.0 genera en una sola pasada a partir de numerosas referencias.
  • La decisión. Elige Gemini Omni si iterar sobre un mismo clip importa más que alcanzar la máxima calidad en bruto. Elige Seedance 2.0 si quieres producir un clip pulido de una vez y continuar con el siguiente.

De dónde viene cada modelo

Seedance 2.0 nació en ByteDance Seed y se lanzó el 12 de febrero de 2026[5]. El lanzamiento se volvió viral por sus clips fotorrealistas de celebridades reconocibles, y Disney envió a ByteDance una carta de cese y desistimiento al día siguiente[11]. El modelo incluye marcas de agua C2PA de forma predeterminada. ByteDance lo presenta como una «arquitectura unificada de generación conjunta multimodal de audio y vídeo» que recibe texto, imágenes, vídeo y audio, y genera vídeo con audio nativo y sincronización labial en más de 8 idiomas.

Gemini Omni Flash es el primer modelo de una nueva familia de Google DeepMind anunciada en Google I/O el 19 de mayo de 2026. Sundar Pichai lo situó durante la presentación dentro de la apuesta de Google por los modelos del mundo: «La IA está pasando de predecir texto a simular la realidad. Gemini Omni es el siguiente paso en esa dirección»[4]. La propia página de producto de Google afirma que Gemini Omni sustituirá a Veo en la aplicación Gemini[3]. Los resultados incorporan marcas de agua SynthID y pueden verificarse mediante la aplicación Gemini, Chrome y Google Search[1].

Ambos modelos funcionan detrás del endpoint REST de medios de reAPI, POST /api/v1/videos/generations. Para alternar entre ellos solo hay que cambiar el campo model del cuerpo de la solicitud; no hace falta modificar el resto de la infraestructura.

Qué significa en la práctica cada especificación de Gemini Omni vs Seedance 2.0

CapacidadGemini Omni FlashSeedance 2.0
Texto a vídeo
Imagen a vídeo (una referencia)sí (1 ref.)
Imagen a vídeo (varias referencias)hasta 3 (modo fusión)hasta 9 imágenes
Interpolación entre primer y último fotogramanosí (image_with_roles)
Vídeo de referencianohasta 3 clips, ≤15s en total[10]
Audio de referenciasolo referencia de voz en el lanzamiento[1]hasta 3 clips, ≤15s en total[10]
Síntesis de audio nativosí (generación conjunta y sincronización labial por fonemas)[5]
Varias tomas en un resultadonosí, varios cortes en una generación[5]
Edición conversacional de varios turnos[1]no
Salida 4K[7]sí en Face[8]
Opciones de duración4 / 6 / 8 / 10s[7]cualquier valor entre 4–15s[10]
Relaciones de aspecto16:9, 9:16[9]16:9, 9:16, 1:1, 4:3, 3:4, 21:9, adaptativa[10]
Marcas de aguaSynthID (Google)[1]C2PA (activada por defecto)[5]
Función de avatarsí (solo para consumidores en el lanzamiento)[1]no

Dos filas concentran casi toda la decisión. Seedance 2.0 admite un paquete de referencias 9+3+3 en una sola solicitud. Gemini Omni Flash admite 0/1/3 imágenes de referencia y una referencia de voz. Si tu flujo consiste en decirle al modelo «aquí está el producto, aquí está el clip con el estilo de marca, aquí está la base musical; ahora compón», el proceso de Seedance 2.0 está hecho para ello[10]. Gemini Omni todavía no está diseñado para ese flujo.

La otra fila decisiva es la de edición. La edición conversacional de varios turnos de Gemini Omni no tiene equivalente en Seedance. «Haz invisible el violín. Ahora cambia el ángulo de cámara para situarlo sobre el hombro del violinista. Ahora traslada al violinista al entorno de la imagen» es una secuencia real de instrucciones del blog de Google[1]. Cada instrucción se apoya en la anterior y conserva la coherencia del personaje y la escena. Seedance 2.0 no funciona así. Escribes una instrucción con un conjunto de referencias y recibes un clip.

La diferencia de benchmark que nadie ha cerrado todavía

Seedance 2.0 ocupa el puesto #1 de Artificial Analysis Video Arena, con un Elo de 1,269 en texto a vídeo y 1,351 en imagen a vídeo[6]. Ambas puntuaciones superan a Veo 3.1, Kling 3.0 y Sora 2 dentro de la misma clasificación.

Gemini Omni Flash se lanzó cuatro días antes de esta publicación y Google no lo incluyó en Arena en el momento del lanzamiento. Las primeras pruebas prácticas ofrecen opiniones divididas. TechCrunch calificó las demostraciones para consumidores de realmente impresionantes, aunque señaló que varias funciones no operaban correctamente durante I/O[4]. Revisores independientes que publicaron al día siguiente afirmaron que la calidad de generación en bruto estaba «por detrás» de Seedance 2.0 en conjunto, mientras que el renderizado de texto, la intuición física y las ediciones conversacionales de Omni abrían nuevas posibilidades. Hasta que Arena reúna suficientes votos para Omni Flash, la conclusión honesta es esta: Seedance 2.0 es el líder verificado en calidad en bruto. Gemini Omni Flash ofrece la superficie de edición más novedosa que se ha publicado.

La misma instrucción ejecutada en Gemini Omni Flash y Seedance 2.0, una al lado de la otra. Observa con tus propios ojos la diferencia de calidad en bruto antes de confiar en las cifras Elo.

Si un Elo de benchmark determina tu compra, Seedance 2.0 gana hoy. Si desarrollas un producto en el que el refinamiento iterativo importa más que el mejor fotograma aislado, esa diferencia de Elo deja de ser el eje adecuado.

Editar mediante conversación o componerlo todo desde el principio

La gran apuesta de Gemini Omni es la conversación. La página de producto de Google lo dice sin rodeos: «Gemini Omni hace que crear vídeos sea tan fácil como mantener una conversación»[3]. El blog va más allá con un ejemplo completo: un clip de un violinista refinado mediante cuatro instrucciones sucesivas. Los personajes mantienen la consistencia, la física se conserva y la escena recuerda lo ocurrido antes[1]. Es la propuesta de «Nano Banana para vídeo» y la parte del modelo con la que ningún otro modelo de vídeo de 2026 compite directamente.

Gemini Omni Flash aprovecha el conocimiento del mundo de Gemini para fundamentar una generación a partir de una sola instrucción. El paso de razonamiento es lo que separa los resultados de Omni de una ejecución basada exclusivamente en difusión.

Seedance 2.0 adopta la filosofía opuesta: componerlo todo por adelantado. Entrégale texto + 9 imágenes + 3 referencias de vídeo + 3 referencias de audio de una vez y el modelo las fusionará en un resultado coherente[10]. El diseño de ByteDance presupone que el usuario conoce las especificaciones, dispone de los recursos y quiere un clip terminado sin intercambios posteriores. El sistema de referencias es la superficie de edición. Si quieres otro resultado, cambias las referencias y vuelves a enviar la solicitud; no iteras.

Para anuncios de marca y producto, el modelo de composición previa de Seedance 2.0 encaja bien con el funcionamiento habitual de los briefs creativos. Para experimentar en redes sociales, crear ediciones de fans o abordar cualquier trabajo en el que el autor no sepa qué quiere hasta ver el primer montaje, gana el bucle conversacional de Gemini Omni.

Dos significados distintos de «multi»

Ambos modelos presentan «multi» como un elemento diferenciador, pero se refieren a cosas distintas.

En Seedance 2.0, «multi» significa varias tomas dentro de una generación: un único resultado de 15 segundos contiene varios cortes y transiciones, como un storyboard ya editado[5]. Escribes una instrucción que describe la progresión de la escena y el modelo emite un clip con los cortes incorporados. Esto reduce a una sola llamada lo que, con Veo o Gemini Omni, sería un flujo de 3 a 4 llamadas.

En Gemini Omni, «multi» significa refinamiento de varios turnos sobre una toma: cada instrucción conversacional transforma el clip existente sin perder el hilo[1]. No obtienes más tomas, sino una versión más refinada de la misma. El coste se acumula entre turnos, pero la consistencia es precisamente la ventaja. Refinar la misma escena durante 5 turnos es un producto completamente distinto de generar 5 escenas diferentes.

Existe un flujo que necesita ambas cosas. Genera el storyboard con las varias tomas de Seedance 2.0 y refina momentos concretos con los varios turnos de Gemini Omni. Tener ambos modelos detrás de un solo endpoint convierte ese flujo en un cambio de 30 líneas en lugar de una migración de proveedor.

Cálculo de precios: 720p / 1080p / 4K con audio

Comparar el precio por segundo de Seedance 2.0 con el precio por generación de Gemini Omni Flash produce resultados distintos según la duración del clip. La tabla siguiente muestra cuánto cuesta en reAPI la opción viable más barata de cada modelo para una misma especificación de salida.

Especificación de salidaGemini Omni Flash (por generación)Ruta pública más barata de Seedance 2.0, sin vídeo de origen
5s a 720p con audiono disponible (las duraciones de Omni son 4 / 6 / 8 / 10)$0.410 (Mini)[8]
6s a 720p con audio$0.204[7]$0.492 (Mini)[8]
8s a 1080p con audio$0.216[7]$3.060 (Face)[8]
10s a 1080p con audio$0.240[7]$3.825 (Face)[8]
10s a 4K con audio$0.480[7]$7.800 (Face)[8]

Hay dos puntos importantes. Primero, la tarifa por generación de Gemini Omni Flash apenas varía con la duración dentro de un mismo nivel de resolución: 4s cuestan $0.18 y 10s cuestan $0.24 a 720p/1080p[7]. La tarifa por segundo de Seedance 2.0 crece de forma lineal con la duración, por lo que, cuanto más largo sea el clip, mayor será la ventaja de precio de Omni a igual resolución. Segundo, solo un vídeo de origen real selecciona la tarifa reducida de Seedance. Las imágenes, los fotogramas inicial y final y el audio mantienen la tarifa base; las solicitudes con vídeo de origen facturan la duración de salida más la duración total de los vídeos de origen redondeada hacia arriba[8]. Por eso la tabla usa precios sin vídeo de origen.

Con las tarifas de la tabla, Gemini Omni Flash es la opción más barata para un clip de 6 segundos a 1080p con audio. Para storyboards de varias tomas que superen los 10 segundos o cualquier resultado que necesite incorporar vídeo y audio de referencia, Seedance 2.0 es el único de estos dos modelos que puede hacerlo.

Cuándo elegir cada uno

Elige Gemini Omni Flash cuando:

  • Quieras iterar sobre un clip y editarlo en varios turnos sin empezar de cero
  • Necesites una salida 4K más barata
  • El límite de 10 segundos sea suficiente para tu caso de uso (Brichtova explicó a TechCrunch que es una decisión de producto, no un límite del modelo[4])
  • El precio fijo por generación simplifique tus previsiones de costes
  • Quieras disponer de generación de avatares (hoy en el nivel de consumo, con acceso por API en camino[1])

Elige Seedance 2.0 cuando:

  • Produzcas un clip pulido por llamada, sin iteración
  • Un storyboard de varias tomas en una salida de 15 segundos sustituya un flujo de 3 a 4 llamadas
  • La generación necesite vídeo de referencia, audio de referencia o ambos
  • El diálogo sincronizado con los labios en idiomas distintos del inglés sea un requisito innegociable
  • Necesites formato ultrapanorámico 21:9 u otras relaciones de aspecto poco habituales
  • El dato del Elo de Arena sea importante para tus compradores

Ninguno es mejor en todos los casos. La comparación entre Gemini Omni y Seedance 2.0 solo se resuelve cuando conoces la especificación de salida y la forma de iterar de tu equipo.

Preguntas frecuentes

¿Gemini Omni es una actualización de Veo 3.1?

La página de producto de Google afirma que Gemini Omni sustituirá a Veo en la aplicación Gemini[3]. Veo 3.1 seguirá disponible mediante Vertex AI, Gemini API y agregadores. En las superficies para consumidores (aplicación Gemini, Flow y YouTube Shorts), Omni Flash pasa a ser la opción predeterminada.

¿Seedance 2.0 se puede usar gratis?

No a nivel de API. Seedance 2.0 pertenece al nivel de pago en todos los proveedores que lo ofrecen. Los productos de consumo de ByteDance (Dreamina y CapCut) incluyen cierta cuota de Seedance 2.0 en sus niveles gratuitos, pero esas cuotas no son accesibles mediante API.

¿Gemini Omni Flash admite varias tomas como Seedance 2.0?

No. Gemini Omni Flash genera tomas continuas individuales de hasta 10 segundos[7]. Las secuencias de varias tomas en un solo clip son una capacidad de Seedance 2.0[5]. Para crear un storyboard con Gemini Omni, debes generar cada toma por separado o usar la edición conversacional de varios turnos para refinar una toma por fases.

¿Puedo usar ambos mediante un mismo endpoint?

Sí. Ambos modelos funcionan en POST /api/v1/videos/generations de reAPI con la misma estructura de solicitud. Para alternar entre ellos basta con cambiar model de gemini-omni a doubao-seedance-2.0-face y ajustar los campos que no son equivalentes (image_urls de Omni acepta 0/1/3 elementos, mientras que Seedance admite hasta 9; Omni no dispone de video_urls ni audio_urls).

¿Qué modelo ofrece una física mejor?

Ambos proveedores presentan el realismo físico como una función destacada. El blog de Google afirma que Omni tiene «una mejor comprensión intuitiva de fuerzas como la gravedad, la energía cinética y la dinámica de fluidos»[1]. El artículo técnico de Seedance 2.0 de ByteDance aborda el movimiento complejo y la interacción física. El Elo de imagen a vídeo de Artificial Analysis Arena, donde la física suele determinar los votos, sitúa actualmente a Seedance 2.0 en 1,351, por delante de todos los modelos probados[6]. Hasta que Omni Flash consiga suficientes votos en Arena, «Seedance lidera en física» es la conclusión verificada.

¿Qué ocurre con el riesgo de propiedad intelectual de Hollywood?

Es un riesgo real con Seedance 2.0. ByteDance recibió una carta de cese y desistimiento de Disney el 13 de febrero de 2026 por inquietudes sobre los datos de entrenamiento[11]. No uses en tus instrucciones personajes, películas o estilos de estudios concretos si no tienes los derechos correspondientes. Los resultados de Gemini Omni Flash incluyen marcas de agua SynthID; los de Seedance 2.0, marcas C2PA. Ambas permiten detectar posteriormente las obras derivadas.

¿Cuándo estará disponible la API de Gemini Omni?

Google afirmó que el acceso a la API para desarrolladores y empresas llegaría «en las próximas semanas» tras el lanzamiento del 19 de mayo[4]. reAPI incorporó Gemini Omni al endpoint estándar de vídeo en el lanzamiento, por lo que ya puedes utilizarlo sin esperar al despliegue de la API directa de Google. Consulta la documentación de Gemini Omni para ver la estructura de la solicitud y la página del modelo para conocer el precio actual.

Enrutamiento de ambos modelos en un mismo flujo

Para la mayoría de equipos que producen vídeo con IA en 2026, Gemini Omni vs Seedance 2.0 no es una decisión que se tome una sola vez, sino una decisión de enrutamiento por solicitud. Seedance 2.0 se ocupa de las salidas pulidas en una sola pasada, las composiciones con varias referencias y cualquier storyboard que necesite varias tomas dentro de un único clip. Gemini Omni Flash asume el trabajo en 4K de menor coste, los clips con audio a 1080p y todo aquello que quieras iterar mediante conversación. Ambos pasan por el gateway multimedia REST/de tareas de reAPI, con su propia clave y saldo; el gateway de chat compatible con OpenAI usa otra clave y otro saldo. Así, el enrutamiento sigue siendo un cambio de configuración y no una migración de proveedor.

Si tuviera que elegir un solo modelo para todo, escogería Seedance 2.0 para resultados comerciales que se entregan hoy a clientes de pago, gracias a su liderazgo verificado en Arena. Elegiría Gemini Omni Flash para cualquier flujo en el que el segundo borrador importe más que el primero y dejaría que la siguiente ronda de benchmarks resolviera la cuestión de la calidad. La diferencia entre Gemini Omni y Seedance 2.0 es el ejemplo más claro que he visto en el vídeo de 2026 de que «elige uno y no cambies» es, en realidad, la respuesta equivocada.

Referencias

  1. Google. Presentación de Gemini Omni. Koray Kavukcuoglu, 19 de mayo de 2026. Consultado en mayo de 2026 en blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni
  2. Google DeepMind. Gemini Omni — Página del modelo. Consultado en mayo de 2026 en deepmind.google/models/gemini-omni
  3. Google. Gemini Omni — Resumen de generación de vídeo. Consultado en mayo de 2026 en gemini.google/overview/video-generation
  4. Rebecca Bellan. Gemini Omni de Google convierte imágenes, audio y texto en vídeo, y eso es solo el principio. TechCrunch, 19 de mayo de 2026. techcrunch.com/2026/05/19/googles-gemini-omni-turns-images-audio-and-text-into-video-and-thats-just-the-start
  5. ByteDance Seed. Lanzamiento oficial de Seedance 2.0. 12 de febrero de 2026. seed.bytedance.com/en/blog/official-launch-of-seedance-2-0
  6. Artificial Analysis. Clasificación Video Arena. Consultado en mayo de 2026 en artificialanalysis.ai/video/arena
  7. reAPI. Gemini Omni — Página del modelo (precio actual). Consultado en mayo de 2026 en reapi.ai/models/gemini-omni
  8. reAPI. Seedance 2.0 Face, Fast Face y Mini: páginas de los modelos, precios actuales, facturación con vídeo de origen y resoluciones. Consultado el 17 de agosto de 2026 en reapi.ai/models/seedance-2-0 y reapi.ai/models/seedance-2-0-mini
  9. reAPI. Gemini Omni — Referencia de la API. Consultado en mayo de 2026 en reapi.ai/docs/gemini-omni
  10. reAPI. Seedance 2.0 — Referencia de la API. Consultado en mayo de 2026 en reapi.ai/docs/seedance-2-0
  11. Colaboradores de Wikipedia. Seedance 2.0. Consultado en mayo de 2026 en en.wikipedia.org/wiki/Seedance_2.0

Lecturas relacionadas