Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
API Gemini Omni : aperçu, spécifications et tarification
2026/07/30

API Gemini Omni : aperçu, spécifications et tarification

Préview de l'API Gemini Omni de Google : identifiant du modèle, API Interactions, 720p, tarification, limites des entrées et différences avec reAPI.

L'API Gemini Omni directe de Google est désormais disponible en tant que préversion publique payante avec l'identifiant du modèle gemini-omni-flash-preview. Elle s'exécute via l'API Interactions de Gemini, génère des vidéos 3 à 10 secondes en 720p et 24 FPS, et coûte environ $0,10 par seconde de vidéo générée. Elle peut créer une vidéo à partir de texte ou d'images, générer l'audio avec la vidéo, et éditer un résultat en plusieurs tours en passant un previous_interaction_id.[1][2]

Ces spécifications décrivent l'API Gemini Developer directe de Google. Elles ne décrivent pas chaque API portant le nom Gemini Omni. En particulier, le gemini-omni de reAPI est un contrat vidéo routé par un fournisseur avec un point de terminaison différent, un nom de modèle, un corps de requête, des niveaux de résolution et une méthode de facturation différents. Traitez les deux comme des intégrations séparées.

Spécifications de l'API Gemini Omni en un coup d'œil

ÉlémentPréversion publique directe Google
ID du modèlegemini-omni-flash-preview
APIAPI Interactions Gemini
Point de terminaison RESTPOST https://generativelanguage.googleapis.com/v1beta/interactions
AccèsNiveau Gemini API payant ; pas d'accès gratuit
EntréeTexte, images et vidéo pour l'édition
SortieVidéo avec audio généré
Longueur de sortie3 à 10 secondes
Spécification de sortie720p, 24 FPS
Format d'écran16:9 ou 9:16
Fenêtre de contexte1 048 576 tokens
Prix de la sortie vidéo$17,50 par 1M de tokens de sortie, environ $0,10 par seconde
Édition avec étatOui, via previous_interaction_id
Cycle de viePréversion ; l'interface et les limites peuvent changer

Google a ajouté le modèle à la préversion publique le 30 juin 2026. Ses notes de version et sa fiche de modèle sont les sources les plus claires pour les limites de sortie : toutes deux identifient la vidéo 720p entre 3 et 10 secondes, tandis que la fiche de modèle spécifie également 24 FPS et la fenêtre de contexte de 1 048 576 tokens.[2][3]

L'identifiant de modèle et le point de terminaison corrects

L'identifiant de modèle direct est :

gemini-omni-flash-preview

Ne le raccourcissez pas en gemini-omni dans une requête Google directe. Cet identifiant plus court appartient au contrat routé par fournisseur de reAPI, non à l'API Gemini Developer.

Google expose Omni via l'API Interactions plutôt que le modèle de génération vidéo à long terme plus ancien utilisé par Veo. Une requête REST minimale ressemble à ceci :

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/interactions?key=$GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-omni-flash-preview",
    "input": "A continuous handheld shot of a tabby cat crossing a sunny kitchen. Natural room audio, no dialogue."
  }'

La réponse REST directe retourne une interaction avec un tableau steps. Le MP4 généré apparaît comme contenu vidéo dans une étape model_output. Les SDK Python et JavaScript de Google ajoutent un champ de commodité output_video, donc le code SDK et l'analyse REST brute ne sont pas identiques.[1]

Pour une sortie en portrait, ajoutez un format de réponse :

{
  "response_format": {
    "type": "video",
    "aspect_ratio": "9:16"
  }
}

Le paysage 16:9 est la valeur par défaut. Le guide public ne documente pas un champ de requête duration numérique comme le fait la route de reAPI. Google déclare que la sortie se situe entre 3 et 10 secondes et affiche les timings en langage naturel et les codes temporels dans les invites, tels que [0-3s], [3-6s] et [6-10s].[1]

Comment fonctionne la tarification Google directe

Gemini Omni Flash Preview n'est disponible que sur le niveau payant. Les prix standard actuels de Google sont :[4]

CompteurPrix direct Google
Tokens d'entrée, toute modalité listée$1,50 par 1M de tokens
Sortie texte, y compris les tokens de réflexion$9,00 par 1M de tokens
Sortie vidéo, y compris les tokens de réflexion$17,50 par 1M de tokens

Google convertit les vidéos 720p en tokens de sortie à 5 792 tokens par seconde. À $17,50 par million de tokens, cela représente environ $0,101 par seconde de sortie. Une estimation approximative de la sortie vidéo est donc :

Sortie 3 secondes  ≈ $0,30
Sortie 6 secondes  ≈ $0,61
Sortie 10 secondes ≈ $1,01

Ce sont des estimations pour la composante de sortie vidéo, pas des totaux de facture garantis. Les médias d'entrée, le texte d'entrée, la sortie texte et la consommation de tokens de réflexion peuvent s'ajouter aux frais. Les tentatives et les tours d'édition supplémentaires sont également des interactions facturables nouvelles.

La distinction importante est que Google ne publie pas un prix forfaitaire « $X par génération » pour cette préversion. Il facture la consommation de tokens. Si un itinéraire tiers cite un prix fixe pour un travail de 8 ou 10 secondes, c'est le contrat du produit du tiers.

Édition vidéo multi-tours avec l'API Interactions

L'édition avec état est la raison la plus forte d'utiliser l'interface Google directe. La première requête crée une vidéo et renvoie un ID d'interaction. Une deuxième requête pointe vers cet état avec previous_interaction_id :

import base64
from google import genai

client = genai.Client()

first = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="A woman playing violin outdoors in soft morning light.",
)

edited = client.interactions.create(
    model="gemini-omni-flash-preview",
    previous_interaction_id=first.id,
    input="Remove the violin. Keep everything else the same.",
)

with open("edited.mp4", "wb") as file:
    file.write(base64.b64decode(edited.output_video.data))

Chaque tour produit une nouvelle vidéo. Le modèle transmet l'état de la vidéo et la conversation, donc l'invite d'édition peut nommer uniquement la modification demandée. Les directives de Google privilégient les instructions d'édition courtes et suggèrent d'ajouter « Keep everything else the same » quand la préservation du reste de la scène est importante.[1]

L'état a un coût opérationnel. Si vous définissez store: false, le résultat ne peut pas être édité ultérieurement via previous_interaction_id. Persistez l'ID d'interaction à côté du dossier d'actifs lorsque les révisions ultérieures font partie du flux de travail du produit. Si vous n'avez pas besoin d'édition, Google recommande background=false, store=false et stream=false pour une requête synchrone plus rapide.

Support des entrées et limitations actuelles de la préversion

La fiche de modèle répertorie l'entrée texte, image et vidéo. L'entrée vidéo est limitée à 10 secondes lorsqu'elle est utilisée pour l'édition, tandis que la sortie générée reste entre 3 et 10 secondes en 720p et 24 FPS.[3]

Le guide supporte plusieurs formes de requête :

  • texte vers vidéo ;
  • image vers vidéo à partir d'une image de démarrage ;
  • plusieurs images de référence de sujet ou de style ;
  • édition avec état d'un résultat précédemment généré ;
  • édition d'une vidéo chargée via l'API Files.

Cette liste large a besoin d'un avertissement au stade de la préversion. Les limitations actuelles de Google indiquent que les références audio chargées ne sont pas prises en charge, même si le modèle génère une piste audio avec la vidéo. Le référencement de plusieurs vidéos n'est pas pris en charge. L'extension vidéo, l'interpolation entre les premières et dernières images et l'édition vocale ne sont également pas disponibles. Les références vidéo génériques jusqu'à trois secondes peuvent valider le schéma API mais ne sont pas correctement traitées par le modèle pour le moment.[1]

Il y a aussi des restrictions régionales. L'édition des vidéos téléchargées n'est actuellement pas disponible dans l'Espace économique européen, en Suisse ou au Royaume-Uni, bien que les utilisateurs de ces régions puissent éditer les vidéos générées par le modèle. L'édition d'images impliquant des mineurs et certaines personnes reconnaissables entraîne des restrictions supplémentaires.

Autres limites d'ingénierie à planifier :

  • pas de débit provisionné ;
  • pas d'instructions système, temperature, top_p, séquences d'arrêt ou paramètre de prompt négatif dédié ;
  • l'anglais est entièrement pris en charge, tandis que les autres langues n'ont pas été formellement évaluées ;
  • les filtres de sécurité du contenu s'appliquent aux invites et aux médias générés ;
  • chaque vidéo générée porte un filigrane SynthID invisible ;
  • les grandes sorties doivent utiliser la livraison par URI plutôt que base64 en ligne.

Le champ de prompt négatif dédié manque, mais les instructions négatives peuvent toujours être écrites dans l'invite ordinaire : « No dialogue », « No scene cuts » ou « Do not add text ».

API Google directe vs gemini-omni de reAPI

Les noms sont assez similaires pour causer des erreurs de mise en œuvre. Les contrats ne sont pas interchangeables :

Détail du contratPréversion directe GoogleRoute fournie reAPI
Modèlegemini-omni-flash-previewgemini-omni
Point de terminaison/v1beta/interactions/api/v1/videos/generations
ExécutionRéponse d'interaction ; média en ligne ou URISoumission et sondage de tâche asynchrone
Résolution de sortieGoogle documente 720pNiveaux de livraison du fournisseur : 720p, 1080p, 4K
DuréeSortie 3 à 10 secondes ; timing du texteduration explicite : 4, 6, 8 ou 10
ImagesContenu multimodal Interactionsimage_urls public, avec 0, 1 ou 3 entrées
Entrée vidéoFlux de travail d'édition direct et restrictions de préversionUne entrée video_urls publique, règles de route du fournisseur
État multi-toursprevious_interaction_idPas de champ équivalent dans le contrat de génération vidéo
FacturationBasée sur les tokens ; environ $0,10 par seconde de sortieTarification route du fournisseur par tâche
Forme du résultatInteraction steps / SDK output_videooutput.video_urls de tâche

La référence API Gemini Omni de reAPI documente la route du fournisseur. Elle accepte un texte d'invite jusqu'à 2 000 caractères, des champs de durée et de résolution explicites, 16:9 ou 9:16, des entrées d'URL publiques et le sondage de tâche. Ses options 1080p et 4K sont des niveaux de livraison du fournisseur ; ce ne sont pas des preuves que la préversion publique directe de Google expose ces résolutions.

Voici la forme minimale équivalente sur reAPI :

{
  "model": "gemini-omni",
  "prompt": "A continuous handheld shot of a tabby cat crossing a sunny kitchen.",
  "duration": 6,
  "resolution": "1080p",
  "aspect_ratio": "16:9"
}

La route retourne un ID de tâche, que le client interroge jusqu'à ce que output.video_urls soit disponible. Elle ne retourne pas un ID d'interaction Google et ne doit pas être traitée comme un wrapper autour de l'API Interactions directe.

Divulgation : reAPI publie cet article et exploite le point de terminaison routé par fournisseur reAPI décrit ci-dessus. Les spécifications et prix Google directs dans ce guide proviennent de la documentation de Google ; les détails du contrat reAPI proviennent de notre référence API publiée. La distinction est énoncée car reAPI a un intérêt commercial dans le produit routé.

Quelle API devriez-vous utiliser ?

Utilisez la préversion directe de Google quand le produit a spécifiquement besoin d'édition conversationnelle, d'un historique d'interaction stocké ou d'une relation de facturation Google directe. C'est aussi l'itinéraire le plus clair quand une équipe souhaite construire contre la nouvelle interface Google et accepte le risque du cycle de vie de la préversion.

Utilisez un contrat routé par fournisseur quand un schéma de requête fixe, des niveaux de résolution et de durée explicites, des entrées d'URL publiques et un modèle de tâche asynchrone commun sont plus utiles que l'état d'interaction Google. Validez la tarification et les contraintes de médias propres à la route plutôt que de copier les paramètres de Google.

Ce choix est distinct de celui de choisir un modèle vidéo. Si la question réelle est de savoir s'il faut garder Veo dans un flux de travail en production, lisez la comparaison Gemini Omni vs Veo 3.1. Si la décision concerne le contrôle de référence multimodal et le style de génération, la comparaison Gemini Omni vs Seedance 2.0 couvre cette intention de recherche. Cette page ne concerne que le contrat de l'API Gemini Omni.

Questions fréquemment posées

L'API Gemini Omni est-elle disponible maintenant ?

Oui. Google a publié gemini-omni-flash-preview sur le niveau Gemini Developer API payant le 30 juin 2026. C'est une préversion publique, pas un modèle de production disponible en général.[2]

Quelle résolution l'API Gemini Omni directe supporte-t-elle ?

La fiche de modèle de Google documente actuellement la sortie 720p à 24 FPS. Ne déduisez pas le support direct 1080p ou 4K à partir d'une route Gemini Omni tierce.[3]

Combien coûte la vidéo Gemini Omni ?

Google facture $17,50 par 1M de tokens de sortie vidéo et calcule les vidéos 720p à 5 792 tokens par seconde. Cela représente environ $0,10 par seconde de sortie, avant toute autre consommation d'entrée ou de sortie.[4]

Gemini Omni peut-il éditer la même vidéo plus d'une fois ?

Oui. Passez l'ID de l'interaction précédente comme previous_interaction_id dans la prochaine requête de l'API Interactions. Gardez le stockage activé et persistez l'ID si l'utilisateur peut revenir pour une autre édition.[1]

Gemini Omni accepte-t-il une référence audio ?

Pas dans la préversion de l'API directe actuelle. Il génère l'audio avec la vidéo, mais la liste des limitations de Google dit que le chargement de références audio n'est pas pris en charge.[1]

gemini-omni est-il l'identifiant du modèle Google ?

Non. L'identifiant du modèle Google direct est gemini-omni-flash-preview. gemini-omni est l'identifiant utilisé par le contrat routé par fournisseur séparé de reAPI.

References

  1. Google AI for Developers. Generate and edit videos with Gemini Omni Flash. Updated July 30, 2026. ai.google.dev/gemini-api/docs/omni
  2. Google AI for Developers. Gemini API release notes — June 30, 2026. ai.google.dev/gemini-api/docs/changelog
  3. Google AI for Developers. Gemini Omni Flash model card. ai.google.dev/gemini-api/docs/models/gemini-omni-flash
  4. Google AI for Developers. Gemini Developer API pricing — Gemini Omni Flash Preview. Retrieved July 30, 2026. ai.google.dev/gemini-api/docs/pricing