
Gemini Omni API: especificaciones, precios y límites
Guía de la vista previa de Gemini Omni: ID de modelo, API de Interacciones, 720p, precios, límites de entrada, edición multiturno y diferencias con reAPI.
La API de Gemini Omni directa de Google está disponible como vista previa pública pagada bajo el ID de modelo gemini-omni-flash-preview. Funciona a través de la API de Interacciones de Gemini, genera vídeo de 3 a 10 segundos a 720p y 24 FPS, y cuesta aproximadamente $0.10 por segundo de salida de vídeo. Puede crear vídeo a partir de texto o imágenes, generar audio con el vídeo y editar un resultado en múltiples turnos pasando una previous_interaction_id.[1][2]
Esas especificaciones describen la API de Gemini Developer directa de Google. Sin embargo, no describen cada API que lleva el nombre Gemini Omni. En particular, la gemini-omni de reAPI es un contrato de vídeo enrutado por proveedor con un punto final diferente, nombre de modelo, cuerpo de solicitud, niveles de resolución y método de facturación. Trata los dos como integraciones separadas.
Especificaciones de Gemini Omni API de un vistazo
| Elemento | Vista previa pública directa de Google |
|---|---|
| ID de modelo | gemini-omni-flash-preview |
| API | API de Interacciones de Gemini |
| Punto final REST | POST https://generativelanguage.googleapis.com/v1beta/interactions |
| Acceso | Nivel de API de Gemini pagado; sin nivel gratuito |
| Entrada | Texto, imágenes y vídeo para edición |
| Salida | Vídeo con audio generado |
| Duración de salida | 3–10 segundos |
| Especificación de salida | 720p, 24 FPS |
| Relación de aspecto | 16:9 o 9:16 |
| Ventana de contexto | 1,048,576 tokens |
| Precio de salida de vídeo | $17.50 por 1M tokens de salida, aproximadamente $0.10 por segundo |
| Edición con estado | Sí, a través de previous_interaction_id |
| Ciclo de vida | Vista previa; la interfaz y los límites pueden cambiar |
Google agregó el modelo a vista previa pública el 30 de junio de 2026. Sus notas de la versión y tarjeta de modelo son las fuentes más claras para los límites de salida: ambas identifican vídeo 720p entre 3 y 10 segundos, mientras que la tarjeta de modelo también especifica 24 FPS y la ventana de contexto de 1,048,576 tokens.[2][3]
La ID de modelo y el punto final correctos
La ID de modelo directa es:
gemini-omni-flash-previewNo la acortes a gemini-omni en una solicitud directa de Google. Ese identificador más corto pertenece al contrato enrutado por proveedor de reAPI, no a la API de Gemini Developer.
Google expone Omni a través de la API de Interacciones en lugar del patrón anterior de generación de vídeo de larga duración que usa Veo. Una solicitud REST mínima se ve así:
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/interactions?key=$GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-omni-flash-preview",
"input": "A continuous handheld shot of a tabby cat crossing a sunny kitchen. Natural room audio, no dialogue."
}'La respuesta REST directa devuelve una interacción con una matriz de steps. El MP4 generado aparece como contenido de vídeo en un paso de model_output. Los SDK de Python y JavaScript de Google agregan un campo de conveniencia output_video, por lo que el código SDK y el análisis REST sin procesar no son idénticos.[1]
Para salida vertical, agrega un formato de respuesta:
{
"response_format": {
"type": "video",
"aspect_ratio": "9:16"
}
}El panorama 16:9 es el predeterminado. La guía pública no documenta un campo de solicitud duration numérico como lo hace la ruta de reAPI. Google indica que la salida cae dentro de 3–10 segundos y muestra tiempos de lenguaje natural y códigos de tiempo en avisos, tales como [0-3s], [3-6s], y [6-10s].[1]
Cómo funciona la facturación directa de Google
Gemini Omni Flash Preview solo está disponible en el nivel pagado. Los precios estándar actuales de Google son:[4]
| Medidor | Precio directo de Google |
|---|---|
| Tokens de entrada, cualquier modalidad listada | $1.50 por 1M tokens |
| Salida de texto, incluidos tokens de pensamiento | $9.00 por 1M tokens |
| Salida de vídeo, incluidos tokens de pensamiento | $17.50 por 1M tokens |
Google convierte vídeo 720p en tokens de salida a 5,792 tokens por segundo. A $17.50 por millón de tokens, eso son aproximadamente $0.101 por segundo de salida. Una estimación aproximada de salida de vídeo es por lo tanto:
Salida de 3 segundos ≈ $0.30
Salida de 6 segundos ≈ $0.61
Salida de 10 segundos ≈ $1.01Estos son cálculos para el componente de salida de vídeo, no totales de facturación garantizados. Los medios de entrada, el texto de entrada, la salida de texto y el consumo de tokens de pensamiento pueden agregarse al cargo. Los reintentos y turnos de edición adicionales también son nuevas interacciones facturables.
La distinción importante es que Google no publica un precio plano de "$X por generación" para esta vista previa. Factura el consumo de tokens. Si una ruta de terceros cita un precio fijo para un trabajo de 8 u 10 segundos, ese es el contrato de producto del tercero.
Edición de vídeo multiturno con la API de Interacciones
La edición con estado es la razón más fuerte para usar la interfaz directa de Google. La primera solicitud crea un vídeo y devuelve una ID de interacción. Una segunda solicitud apunta a ese estado con previous_interaction_id:
import base64
from google import genai
client = genai.Client()
first = client.interactions.create(
model="gemini-omni-flash-preview",
input="A woman playing violin outdoors in soft morning light.",
)
edited = client.interactions.create(
model="gemini-omni-flash-preview",
previous_interaction_id=first.id,
input="Remove the violin. Keep everything else the same.",
)
with open("edited.mp4", "wb") as file:
file.write(base64.b64decode(edited.output_video.data))Cada turno produce un vídeo nuevo. El modelo lleva adelante el estado del vídeo y la conversación, por lo que el mensaje de edición puede nombrar solo el cambio solicitado. La orientación de Google favorece instrucciones de edición cortas y sugiere agregar "Keep everything else the same" cuando preservar el resto de la escena sea importante.[1]
El estado tiene un costo operativo. Si estableces store: false, el resultado no puede editarse más tarde a través de previous_interaction_id. Persiste la ID de interacción junto con el registro de activos cuando las revisiones posteriores son parte del flujo de trabajo del producto. Si no necesitas edición, Google recomienda background=false, store=false, y stream=false para una solicitud sincrónica más rápida.
Soporte de entrada y límites de vista previa actuales
La tarjeta de modelo enumera entrada de texto, imagen y vídeo. La entrada de vídeo se limita a 10 segundos cuando se usa para edición, mientras que la salida generada permanece entre 3–10 segundos a 720p y 24 FPS.[3]
La guía admite varias formas de solicitud:
- texto a vídeo;
- imagen a vídeo desde una imagen de inicio;
- múltiples imágenes de referencia de asunto o estilo;
- edición con estado de un resultado generado previamente;
- edición de un vídeo cargado a través de la API de archivos.
Esa lista amplia necesita una advertencia de etapa de vista previa. Las limitaciones actuales de Google dicen que las referencias de audio cargadas no son compatibles, aunque el modelo genera una pista de audio con vídeo. Las referencias de múltiples vídeos no son compatibles. La extensión de vídeo, la interpolación entre fotogramas primero y último, y la edición de voz tampoco están disponibles. Las referencias de vídeo genéricas de hasta tres segundos pueden pasar la validación de esquema de API pero no son procesadas correctamente por el modelo en la actualidad.[1]
También hay restricciones regionales. La edición de vídeos cargados no está disponible actualmente en el Área Económica Europea, Suiza o el Reino Unido, aunque los usuarios en esas regiones pueden editar vídeo generado por el modelo. La edición de imágenes que involucren menores y ciertas personas reconocibles conlleva restricciones adicionales.
Otros límites de ingeniería que vale la pena planificar:
- sin capacidad de procesamiento provisionada;
- sin instrucciones del sistema,
temperature,top_p, secuencias de parada o parámetro de indicación negativa dedicada; - el inglés es totalmente compatible, mientras que otros idiomas no han sido formalmente evaluados;
- los filtros de seguridad de contenido se aplican tanto a los avisos como a los medios generados;
- cada vídeo generado lleva una marca de agua SynthID invisible;
- las salidas grandes deben usar entrega por URI en lugar de base64 insertada.
El campo de indicación negativa dedicada falta, pero las instrucciones negativas aún se pueden escribir en el mensaje ordinario: "No dialogue," "No scene cuts," o "Do not add text."
API directa de Google versus gemini-omni de reAPI
Los nombres son lo suficientemente similares como para causar errores de implementación. Los contratos no son intercambiables:
| Detalle del contrato | Vista previa directa de Google | Ruta de proveedor de reAPI |
|---|---|---|
| Modelo | gemini-omni-flash-preview | gemini-omni |
| Punto final | /v1beta/interactions | /api/v1/videos/generations |
| Ejecución | Respuesta de interacción; medios en línea o URI | Envío de tarea asincrónica y encuesta |
| Resolución de salida | Google documenta 720p | Niveles de entrega de proveedor: 720p, 1080p, 4K |
| Duración | 3–10 segundos de salida; tiempos de mensaje | duration explícita: 4, 6, 8, o 10 |
| Imágenes | Contenido multimodal de Interacciones | image_urls públicos, con 0, 1, o 3 entradas |
| Entrada de vídeo | Flujo de trabajo de edición directa y restricciones de vista previa | Una entrada pública de video_urls, reglas de ruta de proveedor |
| Estado multiturno | previous_interaction_id | Sin campo equivalente en el contrato de generación de vídeo |
| Facturación | Basada en tokens; aproximadamente $0.10 por segundo de salida | Facturación de ruta de proveedor por trabajo |
| Forma del resultado | Interacción steps / SDK output_video | Tarea output.video_urls |
La referencia de API de Gemini Omni de reAPI documenta la ruta de proveedor. Acepta un mensaje de hasta 2,000 caracteres, campos explícitos de duración y resolución, 16:9 o 9:16, entradas de URL públicas, y encuesta de tareas. Sus opciones 1080p y 4K son niveles de entrega de proveedor; no son evidencia de que la vista previa pública directa de Google exponga esas resoluciones.
Aquí está la forma mínima equivalente en reAPI:
{
"model": "gemini-omni",
"prompt": "A continuous handheld shot of a tabby cat crossing a sunny kitchen.",
"duration": 6,
"resolution": "1080p",
"aspect_ratio": "16:9"
}La ruta devuelve una ID de tarea, que el cliente encuesta hasta que output.video_urls esté disponible. No devuelve una ID de interacción de Google y no debe ser tratada como un envoltorio alrededor de la API de Interacciones directa.
Declaración: reAPI publica este artículo y opera el punto final enrutado por proveedor de reAPI descrito arriba. Las especificaciones y precios directos de Google en esta guía provienen de la documentación de Google; los detalles del contrato de reAPI provienen de nuestra referencia de API publicada. La distinción se indica porque reAPI tiene un interés comercial en el producto enrutado.
¿Qué API deberías usar?
Usa la vista previa directa de Google cuando el producto necesite específicamente edición conversacional, un historial de interacción almacenado o una relación de facturación directa de Google. También es la ruta más clara cuando un equipo desea construir contra la interfaz más nueva de Google y acepta el riesgo del ciclo de vida de la vista previa.
Usa un contrato enrutado por proveedor cuando un esquema de solicitud fijo, niveles explícitos de resolución y duración, entradas de URL públicas y un patrón de tarea asincrónica común sean más útiles que el estado de interacción de Google. Valida la facturación y las restricciones de medios propios de la ruta en lugar de copiar la configuración de Google en él.
Esta opción es independiente de elegir un modelo de vídeo. Si la pregunta real es si mantener Veo en un flujo de trabajo de producción, lee la comparación de Gemini Omni versus Veo 3.1. Si la decisión es sobre control de referencia multimodal y estilo de generación, la comparación de Gemini Omni versus Seedance 2.0 cubre esa intención de búsqueda. Esta página trata solo sobre el contrato de API de Gemini Omni.
Preguntas frecuentes
¿Está disponible ahora la API de Gemini Omni?
Sí. Google lanzó gemini-omni-flash-preview en el nivel de API de Gemini Developer pagado el 30 de junio de 2026. Es una vista previa pública, no un modelo de producción generalmente disponible.[2]
¿Qué resolución admite la API de Gemini Omni directa?
La tarjeta de modelo de Google actualmente documenta salida 720p a 24 FPS. No deduzcas soporte directo 1080p o 4K de una ruta de Gemini Omni de terceros.[3]
¿Cuánto cuesta el vídeo de Gemini Omni?
Google cobra $17.50 por 1M tokens de salida de vídeo y calcula vídeo 720p a 5,792 tokens por segundo. Eso funciona a aproximadamente $0.10 por segundo de salida, antes de otro consumo de entrada o salida.[4]
¿Puede Gemini Omni editar el mismo vídeo más de una vez?
Sí. Pasa la ID de la interacción anterior como previous_interaction_id en la siguiente solicitud de API de Interacciones. Mantén el almacenamiento habilitado y persiste la ID si el usuario puede volver para otra edición.[1]
¿Acepta Gemini Omni una referencia de audio?
No en la vista previa actual de API directa. Genera audio con vídeo, pero la lista de limitaciones de Google dice que cargar referencias de audio no es compatible.[1]
¿Es gemini-omni el ID de modelo de Google?
No. La ID de modelo directa de Google es gemini-omni-flash-preview. gemini-omni es el identificador utilizado por el contrato enrutado por proveedor separado de reAPI.
Sources
- Google AI for Developers. Generate and edit videos with Gemini Omni Flash. Updated July 30, 2026. ai.google.dev/gemini-api/docs/omni
- Google AI for Developers. Gemini API release notes — June 30, 2026. ai.google.dev/gemini-api/docs/changelog
- Google AI for Developers. Gemini Omni Flash model card. ai.google.dev/gemini-api/docs/models/gemini-omni-flash
- Google AI for Developers. Gemini Developer API pricing — Gemini Omni Flash Preview. Retrieved July 30, 2026. ai.google.dev/gemini-api/docs/pricing
Autor

Categorías
gemini-omni de reAPI¿Qué API deberías usar?Preguntas frecuentes¿Está disponible ahora la API de Gemini Omni?¿Qué resolución admite la API de Gemini Omni directa?¿Cuánto cuesta el vídeo de Gemini Omni?¿Puede Gemini Omni editar el mismo vídeo más de una vez?¿Acepta Gemini Omni una referencia de audio?¿Es gemini-omni el ID de modelo de Google?SourcesMás publicaciones

Kling Motion Control: v2.6 vs v3, precios y preparación
Usa Kling Motion Control v2.6 o v3 con el modo de orientación, duración de origen y nivel de precio para reducir la desviación de rostro y cuerpo.


Guía de prompts de Dreamina Seedance 2.5: referencias y tiempos
Mejora tus prompts para Seedance 2.5 con límites documentados, etapas de 30 segundos, control temporal, edición, extensión y fotogramas clave.


Vídeos musicales con IA: de canción y fotos a vídeo completo
Convierte MP3 de 10 segundos a 5 minutos e imágenes 1-7 en vídeos musicales mediante una solicitud API, con subtítulos y tablas de precios precisos.
