
Gemini Omni vs Veo 3.1: ¿conviene migrar en mayo de 2026?
Gemini Omni vs Veo 3.1 en mayo de 2026: Google solo sustituye Veo en la app Gemini, no en la API. Mapeo de los cinco canales, diff de código y quién gana.
En la página de Gemini Omni, Google lo resume en cinco palabras: «Gemini Omni will replace Veo in the Gemini app.»[3] Si solo lees el marketing, darías por hecho que Veo 3.1 está descontinuado. No lo está. Veo 3.1 sigue disponible en Vertex AI, en la Gemini API y en todos los agregadores que lo listan. La propia actualización de Google del 28 de abril de 2026 a la documentación de Veo 3.1 en la Gemini API es más reciente que el lanzamiento de Omni[4].
Así que, al elegir entre Gemini Omni y Veo 3.1 en mayo de 2026, no estás eligiendo entre un modelo descontinuado y su sustituto. Estás eligiendo entre un modelo de siete meses que cobra por segundo y tiene cinco canales, y otro de dos días que cobra por generación y tiene uno. La respuesta correcta depende de qué canal de Veo 3.1 llamarías en su lugar y de si el flujo de trabajo necesita audio, 4K, control de primer y último fotograma o edición multiturno.
Resumen
- Alcance de la «sustitución». Google reemplazó Veo por Omni solo en la app Gemini, en Flow y en YouTube Shorts[3]. En la Gemini API, Veo 3.1 sigue siendo el modelo de vídeo documentado[4].
- Cuándo llega el acceso por API. Veo 3.1 en la Gemini API: activo desde octubre de 2025. API pública de Gemini Omni: «en las próximas semanas» a partir del 19 de mayo de 2026[5]. Con reAPI, hoy puedes llamar a los dos desde el mismo endpoint.
- La vía más barata sin audio. Veo 3.1 Lite a 0,05 $ por clip de 8 segundos en 720p/1080p[6] le gana a los 0,216 $ de Gemini Omni por 8s en 1080p[7] por unas 4 veces.
- La vía más barata con audio. Gemini Omni Flash a 0,216 $ por 8s en 1080p[7] le gana a Veo 3.1 Fast Official a 1,20 $ (8s × 0,15 $/s)[6] por 5,5 veces.
- 4K. Veo 3.1 Fast alt a 0,30 $ por clip de 8s gana en coste. Gemini Omni a 0,432 $ por 8s gana por el audio incluido.
- Flexibilidad de duración. Gemini Omni admite 4/6/8/10s[8]. Veo 3.1 alt fija la duración en 8s; Veo 3.1 official admite 4/6/8s.
- Interpolación de primer y último fotograma. Solo Veo 3.1 Official. Gemini Omni no expone anclaje de primer ni de último fotograma.
- Edición conversacional multiturno. Solo Gemini Omni[1].
- El reparto. Quédate en Veo 3.1 Lite para clips mudos baratos. Quédate en Veo 3.1 Official para cadenas de primer y último fotograma. Pásate a Gemini Omni para cualquier carga con audio en 1080p o 4K, y para cualquier flujo donde iterar importe más que acertar a la primera.
Qué sustituyó Google en realidad
La afirmación «Gemini Omni sustituye a Veo» vale para exactamente tres superficies de consumo: la app Gemini, Google Flow y YouTube Shorts[3]. Ahí dentro, Omni Flash es ya el modelo de vídeo por defecto. Veo 3.1 desaparece de la interfaz de esos productos.
Fuera de esas superficies, Veo 3.1 es el mismo producto que era el 18 de mayo. La documentación de vídeo de la Gemini API en ai.google.dev sigue listando Veo 3.1 como el modelo compatible de texto a vídeo e imagen a vídeo[4]. Vertex AI sigue exponiendo Veo 3.1 con person_generation, resize_mode y demás controles de producción. Los agregadores que enrutan a los pesos de Veo 3.1 de Google no se ven afectados. Incluso el anuncio de la propia Google del 28 de abril de 2026 sobre nuevas capacidades de Veo 3.1 en la Gemini API (filtros de seguridad añadidos, prompts más largos) llegó al blog público menos de un mes antes del lanzamiento de Omni[4], un ritmo poco propio de un modelo que se retira.
Nicole Brichtova, directora de gestión de producto de Google DeepMind, dijo a TechCrunch que Omni es "more than a Veo update" y lo describió como "the next step towards the progression of combining the intelligence of Gemini with the rendering capabilities of our media models."[5] La formulación es deliberada. Omni es otra categoría de producto (razonamiento + edición), no una mejora directa de la síntesis de vídeo por segundo de Veo.
Para quien elige entre Gemini Omni y Veo 3.1, la conclusión es esta: no migres porque lo haya hecho la interfaz de consumo. Migra cuando la capacidad o la cuenta de costes apunten a Omni para tu carga concreta.
La matriz de capacidades
| Capacidad | Gemini Omni Flash | Veo 3.1 (5 canales) |
|---|---|---|
| Texto a vídeo | sí | sí |
| Imagen a vídeo (una sola) | sí (1 referencia) | sí (Fast / Quality alt, niveles Official) |
| Varias imágenes de referencia | hasta 3 (modo fusión)[8] | hasta 3 (solo Fast alt)[9] |
| Anclaje del primer fotograma | no | sí (niveles Official)[9] |
| Interpolación de primer + último fotograma | no | sí (niveles Official)[9] |
| Edición conversacional multiturno | sí[1] | no |
| Salida en 4K | sí (0,432 $ por 8s con audio)[7] | sí (nivel 4K con audio en Official; tarifa plana por generación en alt)[6] |
| Opciones de duración | 4 / 6 / 8 / 10s[8] | alt: 8s fijos; Official: 4 / 6 / 8s[9] |
| Relaciones de aspecto | 16:9, 9:16[8] | 16:9, 9:16[9] |
| Longitud máxima del prompt | 2.000 caracteres[8] | 4.000 caracteres[9] |
| Control del audio | incluido (siempre activo) | alt: sin audio; Official: interruptor generate_audio |
Control de person_generation | no expuesto | Official: allow_adult / disallow[9] |
| Función de avatar (consumo) | sí[1] | no |
| Marca de agua | SynthID[1] | SynthID |
| Modelo de facturación | por generación | alt: por generación; Official: por segundo |
Tres asimetrías hacen casi todo el trabajo en la decisión.
La interpolación de primer y último fotograma de Veo 3.1. Omni no tiene equivalente. Si tu pipeline ancla los clips en un fotograma inicial y otro final conocidos (encadenar un storyboard, repetir clips hero con la composición fijada), Veo 3.1 Official es el único de los dos modelos que te da ese control.
La edición conversacional multiturno de Omni. Veo no tiene equivalente. «Haz que el violín sea invisible. Ahora cambia el ángulo de cámara.» Cada instrucción remodela el clip existente sin perder la escena[1]. Veo no puede iterar sobre su propia salida: tienes que regenerar con un prompt nuevo cada vez.
El interruptor de audio de Veo 3.1 en Official. Veo Official te deja generar vídeo mudo con descuento. Omni incluye audio en cada generación a un único precio. Si no quieres audio, puedes ahorrar un 33 % en Veo Fast Official poniendo generate_audio: false; Omni no expone ese interruptor.
Los cinco canales de Veo 3.1 que Omni no sustituye
En reAPI, Veo 3.1 son cinco canales, no un modelo, y cada uno tiene una superficie distinta[6]. Cada uno responde a un motivo distinto para quedarte o migrar.
veo3.1-lite es el canal económico. Por generación, duración fijada en 8 segundos, sin audio, solo prompt (sin entrada de imagen). 0,05 $ por clip de 8s en 720p/1080p[6]. Gemini Omni, a 0,216 $ por 8s en 1080p, sale unas 4 veces más caro con la misma especificación de salida. Si tu carga es «bocetar rápido y tirar casi todo», Lite es imbatible.
veo3.1-fast es el canal de trabajo del lado alt. Por generación, acepta hasta 3 imágenes de referencia, 8s fijos. 0,10 $ por 8s en 720p/1080p, 0,30 $ por 8s en 4K. El modo de fusión de tres imágenes de Omni cubre una superficie parecida, pero al doble de precio para salida en 1080p.
veo3.1-quality es el canal de alta fidelidad del lado alt. 0,75 $ por 8s en 720p/1080p, 2,40 $ por 8s en 4K. Se usa cuando el renderizado de caras, la legibilidad del texto o la consistencia de personaje son determinantes. La calidad bruta de Omni está sin confirmar en este nivel de precio; los reseñadores que escribieron al día siguiente del lanzamiento dijeron que la calidad agregada de Omni "trails" la frontera de la clasificación[5].
veo3.1-fast-official desbloquea los controles de nivel Vertex: anclaje de primer y último fotograma, interruptor generate_audio, enum person_generation, duraciones de 4 / 6 / 8s. Por segundo. 0,15 $/s para 720p/1080p con audio. Ninguno de estos controles tiene equivalente en Omni.
veo3.1-quality-official es el nivel de producción. 0,40 $/s para 720p/1080p con audio. La misma superficie de control que Fast Official, con mayor fidelidad visual. Se usa para planos hero y creatividades de pago.
Al decidir entre Gemini Omni y Veo 3.1, la pregunta correcta no es «qué modelo gana», sino «cuál de los cinco canales de Veo 3.1 usa hoy esta carga, y cubre la superficie de Omni esos controles?».
Migrar el cuerpo de la petición
En reAPI, ambos modelos corren sobre POST /api/v1/videos/generations. La migración es una edición del cuerpo de la petición, no un cambio de endpoint. Esta es la traducción campo a campo desde la configuración de Veo 3.1 más habitual hacia Omni.
Petición de Veo 3.1 Fast (canal alt):
{
"model": "veo3.1-fast",
"prompt": "A neon city street in the rain, slow camera pan",
"image_urls": ["https://your-cdn.com/ref.jpg"],
"generation_type": "frame",
"aspect_ratio": "16:9",
"resolution": "1080p"
}La misma petición, migrada a Gemini Omni:
{
"model": "gemini-omni",
"prompt": "A neon city street in the rain, slow camera pan",
"image_urls": ["https://your-cdn.com/ref.jpg"],
"duration": 8,
"aspect_ratio": "16:9",
"resolution": "1080p"
}Hay tres cambios que conviene conocer. Primero, generation_type no existe en Omni: el modo se deduce del número de image_urls (0 texto a vídeo, 1 imagen a vídeo, 3 fusión)[8]. Segundo, Omni acepta duration como campo de primera clase, mientras que Veo alt lo fija en 8s. Tercero, Omni rechaza image_urls con longitud 2 con un 400 y el código de error 20003[8]; Veo Fast acepta 1, 2 o 3.
Si tu petición de origen era veo3.1-fast-official, la migración pierde más cosas. Elimina first_frame_image, last_frame_image, generate_audio, person_generation y resize_mode: Omni no expone ninguno. Si alguno de ellos era estructural, no migres.
La cuenta de precios en los canales que importan
Para un clip de 8 segundos en 1080p en reAPI en mayo de 2026:
| Canal | Con audio | Sin audio |
|---|---|---|
veo3.1-lite | no compatible | 0,05 $ (alt, por generación)[6] |
veo3.1-fast | no compatible | 0,10 $ (alt, por generación)[6] |
veo3.1-quality | no compatible | 0,75 $ (alt, por generación)[6] |
veo3.1-fast-official | 1,20 $ (8s × 0,15 $/s) | 0,80 $ (8s × 0,10 $/s)[6] |
veo3.1-quality-official | 3,20 $ (8s × 0,40 $/s) | 1,60 $ (8s × 0,20 $/s)[6] |
gemini-omni | 0,216 $ (por generación, audio incluido)[7] | 0,216 $ (sin interruptor)[7] |
Dos observaciones. Primero: si necesitas audio y no estás en Veo Official, Gemini Omni es la vía más barata en reAPI. La tarifa con audio de Omni, 0,216 $, es 5,5 veces más barata que los 1,20 $ de Veo Fast Official y 14,8 veces más barata que los 3,20 $ de Veo Quality Official. Segundo: si no necesitas audio, Veo Lite a 0,05 $ sigue siendo imbatible. Omni no tiene descuento por modo mudo porque el precio no depende del audio.
Para 4K con audio a 8s: Gemini Omni a 0,432 $ frente a Veo Quality Official a 4,80 $ (8s × 0,60 $/s). Omni es 11 veces más barato en 4K con audio. Aquí es donde el modelo de cobro por generación cae con más fuerza a favor de Omni.
Cuándo quedarte en Veo 3.1
- El flujo de trabajo usa anclaje de primer y último fotograma para encadenar planos en una secuencia más larga
- El flujo de trabajo necesita
person_generationendisallowpor cumplimiento normativo - La especificación de salida es vídeo mudo y el suelo de 0,05 $ de Veo Lite importa a escala
- El pipeline sale a producción hoy y una versión de Omni con dos días de vida introduce un riesgo incómodo
- La longitud del prompt supera con frecuencia los 2.000 caracteres (Veo permite 4.000)
- El equipo tiene un contrato de Vertex AI con condiciones negociadas
Cuándo migrar a Gemini Omni
- Pagas
veo3.1-fast-officialcon audio a 1,20 $ o más por clip de 8s y el flujo de edición iterativa no necesita anclaje del primer fotograma - Necesitas 4K con audio (los 0,432 $ de Omni por 8s le ganan a los 4,80 $ de Veo Quality Official por 11 veces)
- El flujo de trabajo es intensivo en edición: regenerar desde cero en cada retoque quema presupuesto y rompe la consistencia de personaje
- La flexibilidad de duración (4 / 6 / 8 / 10s) importa y estás harto del bloqueo de 8 segundos en alt
- Quieres consolidar en un solo modelo detrás de un solo endpoint y el equipo puede asumir la pérdida de los controles Official de Veo
Preguntas frecuentes
¿Se está descontinuando Veo 3.1?
No. Google retiró Veo 3.1 de las superficies de consumo de la app Gemini, Flow y YouTube Shorts y lo sustituyó por Gemini Omni Flash[3]. La documentación de vídeo de la Gemini API sigue listando Veo 3.1 como compatible, con una actualización tan reciente como la del 28 de abril de 2026[4]. La superficie de Veo 3.1 en Vertex AI está intacta.
¿Cuándo se abre la API pública de Gemini Omni?
Google dijo que el acceso por API para desarrolladores y empresas llegaría «en las próximas semanas» tras el anuncio del 19 de mayo de 2026[5]. A fecha de este artículo, no hay documentado ningún ID de modelo público de la Gemini API para Omni. En reAPI, Gemini Omni ya es invocable hoy como gemini-omni en el endpoint estándar de vídeo, antes del despliegue directo de la API de Google.
¿Puedo usar los dos modelos detrás de un mismo endpoint?
Sí. Ambos corren sobre POST /api/v1/videos/generations en reAPI. Cambiar es modificar el campo "model". Las correspondencias de campos no son idénticas (ver la sección de migración de arriba): Omni elimina first_frame_image, last_frame_image, generate_audio, person_generation y resize_mode.
¿Gemini Omni admite anclaje de primer y último fotograma?
No. Omni solo expone fusión de imágenes con cardinalidad 0, 1 o 3[8]. No existe el concepto de fotograma «inicial» ni «final». Si tu pipeline depende de fijar la composición de apertura o de cierre, Veo 3.1 Official es el único modelo que te lo da.
¿Qué modelo sale más barato para iterar?
Depende de si necesitas audio. Veo 3.1 Lite a 0,05 $ por clip mudo de 8s es la vía más barata para cualquier borrador desechable[6]. Si necesitas audio en cada borrador, Gemini Omni a 0,216 $ por 8s en 1080p con audio es la tarifa con audio más barata de reAPI[7].
¿La API de Gemini Omni bajará de precio a reAPI cuando salga?
Es posible. Los pronósticos independientes sitúan a Omni Flash entre 0,20 $ y 0,60 $ por segundo de vídeo de salida directamente en Google, más el precio de entrada por tokens. Los 0,216 $ de reAPI por clip de 8s en 1080p equivalen a unos 0,027 $/s planos, por debajo del extremo bajo de esa previsión para Google directo. La diferencia real no se sabrá hasta que Google publique precios oficiales.
¿Qué pasa con la calidad de Gemini Omni frente a Veo 3.1?
Omni Flash se lanzó dos días antes de este artículo y todavía no está en la clasificación Video Arena de Artificial Analysis[10]. Veo 3.1 lleva meses ahí y queda por detrás de Seedance 2.0 pero por delante de Sora 2 en agregado. Las primeras pruebas prácticas con Omni calificaron las demos de consumo de impresionantes, pero señalaron que la calidad agregada "trails" la frontera de la clasificación[5]. Trata a Omni como la superficie de edición más novedosa, no como el líder de calidad verificado, hasta que la Arena reúna suficientes votos.
Enrutar los dos durante el próximo trimestre
En mayo de 2026 no decides Gemini Omni vs Veo 3.1 una sola vez para todo el pipeline. Enrutas por petición. Manda las cargas de borrador, mudas y ancladas al primer fotograma al canal de Veo 3.1 que corresponda. Manda las cargas con audio, en 4K y de edición multiturno a Gemini Omni Flash. Con los dos detrás de un mismo endpoint compatible con OpenAI, ese enrutado es un cambio de configuración de 30 líneas.
Si tuviera que estandarizar en un solo modelo ahora mismo, me quedaría en Veo 3.1 para cualquier pipeline que sirva a clientes de pago, por la solidez de siete meses de historial en producción. A Gemini Omni le daría las cargas nuevas donde su edición multiturno y su audio incluido cuentan. La lectura de «Gemini Omni sustituye a Veo» es cierta para la interfaz de consumo de Google y engañosa en todo lo demás. Lee la pregunta Gemini Omni vs Veo 3.1 como «en qué sigue ganándose el sueldo cada canal» y el plan de migración se escribe solo.
References
- Google. Introducing Gemini Omni. Koray Kavukcuoglu, May 19, 2026. Retrieved May 2026 from blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni
- Google DeepMind. Gemini Omni — Model page. Retrieved May 2026 from deepmind.google/models/gemini-omni
- Google. Gemini Omni — Video Generation overview. Retrieved May 2026 from gemini.google/overview/video-generation
- Google. Enhanced Veo 3.1 capabilities are now available in the Gemini API. April 28, 2026. blog.google/innovation-and-ai/technology/developers-tools/veo-3-1-gemini-api
- Rebecca Bellan. Google's Gemini Omni turns images, audio, and text into video — and that's just the start. TechCrunch, May 19, 2026. techcrunch.com/2026/05/19/googles-gemini-omni-turns-images-audio-and-text-into-video-and-thats-just-the-start
- reAPI. Veo 3.1 — Model page (live pricing across 5 channels). Retrieved May 2026 from reapi.ai/models/veo3-1
- reAPI. Gemini Omni — Model page (live pricing). Retrieved May 2026 from reapi.ai/models/gemini-omni
- reAPI. Gemini Omni — API reference. Retrieved May 2026 from reapi.ai/docs/gemini-omni
- reAPI. Veo 3.1 — API reference. Retrieved May 2026 from reapi.ai/docs/veo3-1
- Artificial Analysis. Video Arena Leaderboard. Retrieved May 2026 from artificialanalysis.ai/video/arena
Further reading
- Google. Generate videos with Veo 3.1 in the Gemini API. ai.google.dev/gemini-api/docs/video
- reAPI. Gemini Omni vs Seedance 2.0: The 2026 Video Model Split. reapi.ai/blog/gemini-omni-vs-seedance-2-0-2026
- reAPI. Veo 3.1 vs Seedance 2.0: Picking a Video Model in 2026. reapi.ai/blog/veo-3-1-vs-seedance-2-0-2026
- reAPI. Cheapest Veo 3.1 API in 2026. reapi.ai/blog/cheapest-veo-3-1-api-2026
Autor

Categorías
Más publicaciones

Generador de Video AI Con Gente Real: Qué Funciona de Verdad
Un generador de video AI con gente real: referencias consentidas funcionan, sintéticos fotorrealistas dan falsos positivos, celebridades rechazadas siempre.


Alternativas a Together AI en 2026: 5 opciones comparadas
¿Buscas alternativas a Together AI en 2026? Compara OpenRouter, Replicate, RunPod, Hugging Face y reAPI en modelos, precios, velocidad y diseño de la API.


Guía de Dreamina Seedance 2.5: 30 s y vídeo largo
Guía de Dreamina Seedance 2.5 con ejemplos de vídeo de 30 segundos, extensión, vídeo largo, tiempos, referencias, edición, audio y storyboards.
