
API Gemini Omni : aperçu, spécifications et tarification
Préview de l'API Gemini Omni de Google : identifiant du modèle, API Interactions, 720p, tarification, limites des entrées et différences avec reAPI.
L'API Gemini Omni directe de Google est désormais disponible en tant que préversion publique payante avec l'identifiant du modèle gemini-omni-flash-preview. Elle s'exécute via l'API Interactions de Gemini, génère des vidéos 3 à 10 secondes en 720p et 24 FPS, et coûte environ $0,10 par seconde de vidéo générée. Elle peut créer une vidéo à partir de texte ou d'images, générer l'audio avec la vidéo, et éditer un résultat en plusieurs tours en passant un previous_interaction_id.[1][2]
Ces spécifications décrivent l'API Gemini Developer directe de Google. Elles ne décrivent pas chaque API portant le nom Gemini Omni. En particulier, le gemini-omni de reAPI est un contrat vidéo routé par un fournisseur avec un point de terminaison différent, un nom de modèle, un corps de requête, des niveaux de résolution et une méthode de facturation différents. Traitez les deux comme des intégrations séparées.
Spécifications de l'API Gemini Omni en un coup d'œil
| Élément | Préversion publique directe Google |
|---|---|
| ID du modèle | gemini-omni-flash-preview |
| API | API Interactions Gemini |
| Point de terminaison REST | POST https://generativelanguage.googleapis.com/v1beta/interactions |
| Accès | Niveau Gemini API payant ; pas d'accès gratuit |
| Entrée | Texte, images et vidéo pour l'édition |
| Sortie | Vidéo avec audio généré |
| Longueur de sortie | 3 à 10 secondes |
| Spécification de sortie | 720p, 24 FPS |
| Format d'écran | 16:9 ou 9:16 |
| Fenêtre de contexte | 1 048 576 tokens |
| Prix de la sortie vidéo | $17,50 par 1M de tokens de sortie, environ $0,10 par seconde |
| Édition avec état | Oui, via previous_interaction_id |
| Cycle de vie | Préversion ; l'interface et les limites peuvent changer |
Google a ajouté le modèle à la préversion publique le 30 juin 2026. Ses notes de version et sa fiche de modèle sont les sources les plus claires pour les limites de sortie : toutes deux identifient la vidéo 720p entre 3 et 10 secondes, tandis que la fiche de modèle spécifie également 24 FPS et la fenêtre de contexte de 1 048 576 tokens.[2][3]
L'identifiant de modèle et le point de terminaison corrects
L'identifiant de modèle direct est :
gemini-omni-flash-previewNe le raccourcissez pas en gemini-omni dans une requête Google directe. Cet identifiant plus court appartient au contrat routé par fournisseur de reAPI, non à l'API Gemini Developer.
Google expose Omni via l'API Interactions plutôt que le modèle de génération vidéo à long terme plus ancien utilisé par Veo. Une requête REST minimale ressemble à ceci :
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/interactions?key=$GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-omni-flash-preview",
"input": "A continuous handheld shot of a tabby cat crossing a sunny kitchen. Natural room audio, no dialogue."
}'La réponse REST directe retourne une interaction avec un tableau steps. Le MP4 généré apparaît comme contenu vidéo dans une étape model_output. Les SDK Python et JavaScript de Google ajoutent un champ de commodité output_video, donc le code SDK et l'analyse REST brute ne sont pas identiques.[1]
Pour une sortie en portrait, ajoutez un format de réponse :
{
"response_format": {
"type": "video",
"aspect_ratio": "9:16"
}
}Le paysage 16:9 est la valeur par défaut. Le guide public ne documente pas un champ de requête duration numérique comme le fait la route de reAPI. Google déclare que la sortie se situe entre 3 et 10 secondes et affiche les timings en langage naturel et les codes temporels dans les invites, tels que [0-3s], [3-6s] et [6-10s].[1]
Comment fonctionne la tarification Google directe
Gemini Omni Flash Preview n'est disponible que sur le niveau payant. Les prix standard actuels de Google sont :[4]
| Compteur | Prix direct Google |
|---|---|
| Tokens d'entrée, toute modalité listée | $1,50 par 1M de tokens |
| Sortie texte, y compris les tokens de réflexion | $9,00 par 1M de tokens |
| Sortie vidéo, y compris les tokens de réflexion | $17,50 par 1M de tokens |
Google convertit les vidéos 720p en tokens de sortie à 5 792 tokens par seconde. À $17,50 par million de tokens, cela représente environ $0,101 par seconde de sortie. Une estimation approximative de la sortie vidéo est donc :
Sortie 3 secondes ≈ $0,30
Sortie 6 secondes ≈ $0,61
Sortie 10 secondes ≈ $1,01Ce sont des estimations pour la composante de sortie vidéo, pas des totaux de facture garantis. Les médias d'entrée, le texte d'entrée, la sortie texte et la consommation de tokens de réflexion peuvent s'ajouter aux frais. Les tentatives et les tours d'édition supplémentaires sont également des interactions facturables nouvelles.
La distinction importante est que Google ne publie pas un prix forfaitaire « $X par génération » pour cette préversion. Il facture la consommation de tokens. Si un itinéraire tiers cite un prix fixe pour un travail de 8 ou 10 secondes, c'est le contrat du produit du tiers.
Édition vidéo multi-tours avec l'API Interactions
L'édition avec état est la raison la plus forte d'utiliser l'interface Google directe. La première requête crée une vidéo et renvoie un ID d'interaction. Une deuxième requête pointe vers cet état avec previous_interaction_id :
import base64
from google import genai
client = genai.Client()
first = client.interactions.create(
model="gemini-omni-flash-preview",
input="A woman playing violin outdoors in soft morning light.",
)
edited = client.interactions.create(
model="gemini-omni-flash-preview",
previous_interaction_id=first.id,
input="Remove the violin. Keep everything else the same.",
)
with open("edited.mp4", "wb") as file:
file.write(base64.b64decode(edited.output_video.data))Chaque tour produit une nouvelle vidéo. Le modèle transmet l'état de la vidéo et la conversation, donc l'invite d'édition peut nommer uniquement la modification demandée. Les directives de Google privilégient les instructions d'édition courtes et suggèrent d'ajouter « Keep everything else the same » quand la préservation du reste de la scène est importante.[1]
L'état a un coût opérationnel. Si vous définissez store: false, le résultat ne peut pas être édité ultérieurement via previous_interaction_id. Persistez l'ID d'interaction à côté du dossier d'actifs lorsque les révisions ultérieures font partie du flux de travail du produit. Si vous n'avez pas besoin d'édition, Google recommande background=false, store=false et stream=false pour une requête synchrone plus rapide.
Support des entrées et limitations actuelles de la préversion
La fiche de modèle répertorie l'entrée texte, image et vidéo. L'entrée vidéo est limitée à 10 secondes lorsqu'elle est utilisée pour l'édition, tandis que la sortie générée reste entre 3 et 10 secondes en 720p et 24 FPS.[3]
Le guide supporte plusieurs formes de requête :
- texte vers vidéo ;
- image vers vidéo à partir d'une image de démarrage ;
- plusieurs images de référence de sujet ou de style ;
- édition avec état d'un résultat précédemment généré ;
- édition d'une vidéo chargée via l'API Files.
Cette liste large a besoin d'un avertissement au stade de la préversion. Les limitations actuelles de Google indiquent que les références audio chargées ne sont pas prises en charge, même si le modèle génère une piste audio avec la vidéo. Le référencement de plusieurs vidéos n'est pas pris en charge. L'extension vidéo, l'interpolation entre les premières et dernières images et l'édition vocale ne sont également pas disponibles. Les références vidéo génériques jusqu'à trois secondes peuvent valider le schéma API mais ne sont pas correctement traitées par le modèle pour le moment.[1]
Il y a aussi des restrictions régionales. L'édition des vidéos téléchargées n'est actuellement pas disponible dans l'Espace économique européen, en Suisse ou au Royaume-Uni, bien que les utilisateurs de ces régions puissent éditer les vidéos générées par le modèle. L'édition d'images impliquant des mineurs et certaines personnes reconnaissables entraîne des restrictions supplémentaires.
Autres limites d'ingénierie à planifier :
- pas de débit provisionné ;
- pas d'instructions système,
temperature,top_p, séquences d'arrêt ou paramètre de prompt négatif dédié ; - l'anglais est entièrement pris en charge, tandis que les autres langues n'ont pas été formellement évaluées ;
- les filtres de sécurité du contenu s'appliquent aux invites et aux médias générés ;
- chaque vidéo générée porte un filigrane SynthID invisible ;
- les grandes sorties doivent utiliser la livraison par URI plutôt que base64 en ligne.
Le champ de prompt négatif dédié manque, mais les instructions négatives peuvent toujours être écrites dans l'invite ordinaire : « No dialogue », « No scene cuts » ou « Do not add text ».
API Google directe vs gemini-omni de reAPI
Les noms sont assez similaires pour causer des erreurs de mise en œuvre. Les contrats ne sont pas interchangeables :
| Détail du contrat | Préversion directe Google | Route fournie reAPI |
|---|---|---|
| Modèle | gemini-omni-flash-preview | gemini-omni |
| Point de terminaison | /v1beta/interactions | /api/v1/videos/generations |
| Exécution | Réponse d'interaction ; média en ligne ou URI | Soumission et sondage de tâche asynchrone |
| Résolution de sortie | Google documente 720p | Niveaux de livraison du fournisseur : 720p, 1080p, 4K |
| Durée | Sortie 3 à 10 secondes ; timing du texte | duration explicite : 4, 6, 8 ou 10 |
| Images | Contenu multimodal Interactions | image_urls public, avec 0, 1 ou 3 entrées |
| Entrée vidéo | Flux de travail d'édition direct et restrictions de préversion | Une entrée video_urls publique, règles de route du fournisseur |
| État multi-tours | previous_interaction_id | Pas de champ équivalent dans le contrat de génération vidéo |
| Facturation | Basée sur les tokens ; environ $0,10 par seconde de sortie | Tarification route du fournisseur par tâche |
| Forme du résultat | Interaction steps / SDK output_video | output.video_urls de tâche |
La référence API Gemini Omni de reAPI documente la route du fournisseur. Elle accepte un texte d'invite jusqu'à 2 000 caractères, des champs de durée et de résolution explicites, 16:9 ou 9:16, des entrées d'URL publiques et le sondage de tâche. Ses options 1080p et 4K sont des niveaux de livraison du fournisseur ; ce ne sont pas des preuves que la préversion publique directe de Google expose ces résolutions.
Voici la forme minimale équivalente sur reAPI :
{
"model": "gemini-omni",
"prompt": "A continuous handheld shot of a tabby cat crossing a sunny kitchen.",
"duration": 6,
"resolution": "1080p",
"aspect_ratio": "16:9"
}La route retourne un ID de tâche, que le client interroge jusqu'à ce que output.video_urls soit disponible. Elle ne retourne pas un ID d'interaction Google et ne doit pas être traitée comme un wrapper autour de l'API Interactions directe.
Divulgation : reAPI publie cet article et exploite le point de terminaison routé par fournisseur reAPI décrit ci-dessus. Les spécifications et prix Google directs dans ce guide proviennent de la documentation de Google ; les détails du contrat reAPI proviennent de notre référence API publiée. La distinction est énoncée car reAPI a un intérêt commercial dans le produit routé.
Quelle API devriez-vous utiliser ?
Utilisez la préversion directe de Google quand le produit a spécifiquement besoin d'édition conversationnelle, d'un historique d'interaction stocké ou d'une relation de facturation Google directe. C'est aussi l'itinéraire le plus clair quand une équipe souhaite construire contre la nouvelle interface Google et accepte le risque du cycle de vie de la préversion.
Utilisez un contrat routé par fournisseur quand un schéma de requête fixe, des niveaux de résolution et de durée explicites, des entrées d'URL publiques et un modèle de tâche asynchrone commun sont plus utiles que l'état d'interaction Google. Validez la tarification et les contraintes de médias propres à la route plutôt que de copier les paramètres de Google.
Ce choix est distinct de celui de choisir un modèle vidéo. Si la question réelle est de savoir s'il faut garder Veo dans un flux de travail en production, lisez la comparaison Gemini Omni vs Veo 3.1. Si la décision concerne le contrôle de référence multimodal et le style de génération, la comparaison Gemini Omni vs Seedance 2.0 couvre cette intention de recherche. Cette page ne concerne que le contrat de l'API Gemini Omni.
Questions fréquemment posées
L'API Gemini Omni est-elle disponible maintenant ?
Oui. Google a publié gemini-omni-flash-preview sur le niveau Gemini Developer API payant le 30 juin 2026. C'est une préversion publique, pas un modèle de production disponible en général.[2]
Quelle résolution l'API Gemini Omni directe supporte-t-elle ?
La fiche de modèle de Google documente actuellement la sortie 720p à 24 FPS. Ne déduisez pas le support direct 1080p ou 4K à partir d'une route Gemini Omni tierce.[3]
Combien coûte la vidéo Gemini Omni ?
Google facture $17,50 par 1M de tokens de sortie vidéo et calcule les vidéos 720p à 5 792 tokens par seconde. Cela représente environ $0,10 par seconde de sortie, avant toute autre consommation d'entrée ou de sortie.[4]
Gemini Omni peut-il éditer la même vidéo plus d'une fois ?
Oui. Passez l'ID de l'interaction précédente comme previous_interaction_id dans la prochaine requête de l'API Interactions. Gardez le stockage activé et persistez l'ID si l'utilisateur peut revenir pour une autre édition.[1]
Gemini Omni accepte-t-il une référence audio ?
Pas dans la préversion de l'API directe actuelle. Il génère l'audio avec la vidéo, mais la liste des limitations de Google dit que le chargement de références audio n'est pas pris en charge.[1]
gemini-omni est-il l'identifiant du modèle Google ?
Non. L'identifiant du modèle Google direct est gemini-omni-flash-preview. gemini-omni est l'identifiant utilisé par le contrat routé par fournisseur séparé de reAPI.
References
- Google AI for Developers. Generate and edit videos with Gemini Omni Flash. Updated July 30, 2026. ai.google.dev/gemini-api/docs/omni
- Google AI for Developers. Gemini API release notes — June 30, 2026. ai.google.dev/gemini-api/docs/changelog
- Google AI for Developers. Gemini Omni Flash model card. ai.google.dev/gemini-api/docs/models/gemini-omni-flash
- Google AI for Developers. Gemini Developer API pricing — Gemini Omni Flash Preview. Retrieved July 30, 2026. ai.google.dev/gemini-api/docs/pricing
Auteur

Catégories
gemini-omni de reAPIQuelle API devriez-vous utiliser ?Questions fréquemment poséesL'API Gemini Omni est-elle disponible maintenant ?Quelle résolution l'API Gemini Omni directe supporte-t-elle ?Combien coûte la vidéo Gemini Omni ?Gemini Omni peut-il éditer la même vidéo plus d'une fois ?Gemini Omni accepte-t-il une référence audio ?gemini-omni est-il l'identifiant du modèle Google ?ReferencesPlus d'articles

Génération vidéo IA : deux unités de facturation incomparables
Deux unités de facturation coexistent dans les API vidéo IA : à la seconde et forfaitaire. Où se situe le point d'équilibre et comment tarifer un clip réel.


Migration GPT-6 Astra : Responses, outils et retour en arrière
Migrez vers GPT-6 Astra : découverte du modèle, requête Responses API, contrôle du raisonnement, vérification des outils et plan de retour arrière.


Voir si ChatGPT l'a écrit ? Des indices, pas des preuves
Repérez les signaux d'IA répétitifs, comprenez pourquoi aucune phrase ne prouve ChatGPT, et apprenez à examiner les textes suspects de façon plus juste.
