
Gemini Omni API: 공개 미리보기 사양, 가격, 제한
Google의 Gemini Omni API 공개 미리보기 설명: 모델 ID, Interactions API, 720p 출력, 가격, 입력 제한, 멀티턴 편집, reAPI와의 차이.
Google의 직접 Gemini Omni API는 모델 ID gemini-omni-flash-preview로 유료 공개 미리보기를 통해 이용 가능해졌습니다. Gemini Interactions API를 사용하며, 720p와 24 FPS로 초당 3~10초 비디오를 생성하고 약 $0.10 정도의 초당 비용이 듭니다. 텍스트나 이미지에서 비디오를 생성할 수 있고, 비디오와 함께 오디오를 생성하며, previous_interaction_id를 전달해 여러 턴에 걸쳐 결과를 편집할 수 있습니다.[1][2]
이러한 사양은 Google의 직접 Gemini Developer API를 설명합니다. 그러나 Gemini Omni라는 이름을 가진 모든 API를 설명하지는 않습니다. 특히 reAPI의 gemini-omni는 다른 엔드포인트, 모델 이름, 요청 본문, 해상도 계층, 청구 방식을 가진 공급자 라우팅 비디오 계약입니다. 두 가지를 별개의 통합으로 취급하세요.
Gemini Omni API 사양 한눈에 보기
| 항목 | Google 직접 공개 미리보기 |
|---|---|
| 모델 ID | gemini-omni-flash-preview |
| API | Gemini Interactions API |
| REST 엔드포인트 | POST https://generativelanguage.googleapis.com/v1beta/interactions |
| 액세스 | 유료 Gemini API 계층; 무료 계층 없음 |
| 입력 | 텍스트, 이미지, 편집용 비디오 |
| 출력 | 생성된 오디오가 포함된 비디오 |
| 출력 길이 | 3~10초 |
| 출력 사양 | 720p, 24 FPS |
| 종횡비 | 16:9 또는 9:16 |
| 컨텍스트 윈도우 | 1,048,576 토큰 |
| 비디오 출력 가격 | 100만 출력 토큰당 $17.50, 약 초당 $0.10 |
| 상태 유지 편집 | 예, previous_interaction_id를 통해 |
| 수명 주기 | 미리보기; 인터페이스와 제한이 변경될 수 있음 |
Google은 2026년 6월 30일에 공개 미리보기에 모델을 추가했습니다. 릴리스 노트와 모델 카드는 출력 제한에 대한 가장 명확한 출처입니다. 둘 다 3~10초의 720p 비디오를 식별하며, 모델 카드는 24 FPS와 1,048,576토큰 컨텍스트 윈도우도 지정합니다.[2][3]
올바른 모델 ID와 엔드포인트
직접 모델 ID는:
gemini-omni-flash-preview직접 Google 요청에서 이를 gemini-omni로 단축하지 마세요. 이 더 짧은 식별자는 reAPI의 공급자 라우팅 계약에만 속하며, Gemini Developer API에는 속하지 않습니다.
Google은 Veo가 사용하는 이전 장시간 실행 비디오 생성 패턴이 아닌 Interactions API를 통해 Omni를 노출합니다. 최소 REST 요청은 다음과 같습니다:
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/interactions?key=$GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-omni-flash-preview",
"input": "A continuous handheld shot of a tabby cat crossing a sunny kitchen. Natural room audio, no dialogue."
}'직접 REST 응답은 steps 배열이 있는 상호작용을 반환합니다. 생성된 MP4는 model_output 단계의 비디오 콘텐츠로 나타납니다. Google의 Python 및 JavaScript SDK는 output_video 편의 필드를 추가하므로, SDK 코드와 원본 REST 구문 분석은 동일하지 않습니다.[1]
세로 출력의 경우, 응답 형식을 추가합니다:
{
"response_format": {
"type": "video",
"aspect_ratio": "9:16"
}
}가로 16:9이 기본값입니다. 공개 가이드는 reAPI의 경로가 하는 것처럼 숫자 duration 요청 필드를 문서화하지 않습니다. Google은 출력이 3~10초 범위에 속한다고 명시하며, 프롬프트에서 [0-3s], [3-6s], [6-10s] 같은 자연어 타이밍과 타임코드를 보여줍니다.[1]
Google 직접 가격 책정의 작동 원리
Gemini Omni Flash Preview는 유료 계층에서만 사용 가능합니다. Google의 현재 표준 가격은:[4]
| 측정기 | Google 직접 가격 |
|---|---|
| 입력 토큰, 모든 양식 | 100만 토큰당 $1.50 |
| 텍스트 출력, 사고 토큰 포함 | 100만 토큰당 $9.00 |
| 비디오 출력, 사고 토큰 포함 | 100만 토큰당 $17.50 |
Google은 720p 비디오를 출력 토큰으로 초당 5,792토큰으로 변환합니다. 100만 토큰당 $17.50일 때, 이는 약 출력 초당 $0.101입니다. 대략적인 비디오 출력 추정값은 따라서:
3초 출력 ≈ $0.30
6초 출력 ≈ $0.61
10초 출력 ≈ $1.01이러한 값은 비디오 출력 구성 요소에 대한 추정값이며 보장된 청구 총액이 아닙니다. 입력 미디어, 입력 텍스트, 텍스트 출력, 사고 토큰 소비가 청구에 추가될 수 있습니다. 재시도 및 추가 편집 턴도 새로운 청구 가능 상호작용입니다.
중요한 차이점은 Google이 이 미리보기에 대해 정액 "$X 생성당" 가격을 게시하지 않는다는 것입니다. 토큰 소비에 따라 청구됩니다. 써드파티 경로가 8초 또는 10초 작업에 대해 고정 가격을 인용하는 경우, 이는 써드파티의 제품 계약입니다.
Interactions API를 사용한 멀티턴 비디오 편집
상태 유지 편집은 Google의 직접 인터페이스를 사용하는 가장 강력한 이유입니다. 첫 번째 요청은 비디오를 생성하고 상호작용 ID를 반환합니다. 두 번째 요청은 previous_interaction_id로 그 상태를 가리킵니다:
import base64
from google import genai
client = genai.Client()
first = client.interactions.create(
model="gemini-omni-flash-preview",
input="A woman playing violin outdoors in soft morning light.",
)
edited = client.interactions.create(
model="gemini-omni-flash-preview",
previous_interaction_id=first.id,
input="Remove the violin. Keep everything else the same.",
)
with open("edited.mp4", "wb") as file:
file.write(base64.b64decode(edited.output_video.data))각 턴은 새로운 비디오를 생성합니다. 모델은 비디오 상태와 대화를 전달하므로, 편집 프롬프트는 요청된 변경 사항만 명명할 수 있습니다. Google의 지침은 짧은 편집 지침을 선호하며 나머지 장면을 유지하는 것이 중요할 때 "Keep everything else the same"을 추가할 것을 제안합니다.[1]
상태에는 운영 비용이 있습니다. store: false를 설정하면, 결과를 나중에 previous_interaction_id를 통해 편집할 수 없습니다. 나중 개정이 제품 워크플로의 일부인 경우, 자산 레코드와 함께 상호작용 ID를 유지하세요. 편집이 필요 없으면, Google은 더 빠른 동기 요청을 위해 background=false, store=false, stream=false를 권장합니다.
입력 지원 및 현재 미리보기 제한
모델 카드는 텍스트, 이미지, 비디오 입력을 나열합니다. 비디오 입력은 편집 시 10초로 제한되며, 생성된 출력은 720p와 24 FPS로 3~10초 범위에 머물러 있습니다.[3]
가이드는 여러 요청 형태를 지원합니다:
- 텍스트 대 비디오;
- 시작 이미지로부터의 이미지 대 비디오;
- 여러 주제 또는 스타일 참조 이미지;
- 이전에 생성된 결과의 상태 유지 편집;
- Files API를 통한 업로드된 비디오 편집.
이 광범위한 목록은 미리보기 단계 경고가 필요합니다. Google의 현재 제한은 업로드된 오디오 참조가 지원되지 않는다고 말하며, 모델이 비디오와 함께 오디오 트랙을 생성하더라도 그렇습니다. 여러 비디오 참조는 지원되지 않습니다. 비디오 확장, 첫 번째와 마지막 프레임 사이의 보간, 음성 편집도 불가능합니다. 최대 3초의 일반 비디오 참조는 API 스키마 검증을 통과할 수 있지만 현재 모델에 의해 올바르게 처리되지 않습니다.[1]
지역 제한도 있습니다. 업로드된 비디오 편집은 현재 유럽 경제 지역, 스위스 또는 영국에서 사용할 수 없지만, 이러한 지역의 사용자는 모델에서 생성한 비디오를 편집할 수 있습니다. 미성년자 및 특정 인식 가능한 사람이 관련된 이미지 편집에는 추가 제한이 있습니다.
계획할 가치가 있는 다른 엔지니어링 제한:
- 프로비저닝된 처리량 없음;
- 시스템 지침,
temperature,top_p, 정지 수열 또는 전용 음수 프롬프트 매개변수 없음; - 영어는 완전히 지원되며, 다른 언어는 공식적으로 평가되지 않음;
- 콘텐츠 안전 필터는 프롬프트와 생성된 미디어 모두에 적용됨;
- 생성된 모든 비디오는 보이지 않는 SynthID 워터마크를 가짐;
- 큰 출력은 인라인 base64 대신 URI 배달을 사용해야 함.
전용 음수 프롬프트 필드가 누락되어 있지만, 음수 지침은 여전히 일반 프롬프트에 작성할 수 있습니다: "No dialogue," "No scene cuts," 또는 "Do not add text."
Google 직접 API와 reAPI의 gemini-omni 비교
이름이 유사해서 구현 실수를 야기할 수 있습니다. 계약은 상호 교환할 수 없습니다:
| 계약 세부 사항 | Google 직접 미리보기 | reAPI 공급자 경로 |
|---|---|---|
| 모델 | gemini-omni-flash-preview | gemini-omni |
| 엔드포인트 | /v1beta/interactions | /api/v1/videos/generations |
| 실행 | 상호작용 응답; 인라인 또는 URI 미디어 | 비동기 작업 제출 및 폴링 |
| 출력 해상도 | Google 문서 720p | 공급자 배달 계층: 720p, 1080p, 4K |
| 지속 시간 | 3~10초 출력; 프롬프트 타이밍 | 명시적 duration: 4, 6, 8, 또는 10 |
| 이미지 | Interactions 멀티모달 콘텐츠 | 공개 image_urls, 0, 1, 또는 3개 항목 |
| 비디오 입력 | 직접 편집 워크플로 및 미리보기 제한 | 하나의 공개 video_urls 항목, 공급자 경로 규칙 |
| 멀티턴 상태 | previous_interaction_id | 비디오 생성 계약에 동등한 필드 없음 |
| 청구 | 토큰 기반; 약 출력 초당 $0.10 | 작업당 공급자 경로 가격 책정 |
| 결과 형태 | 상호작용 steps / SDK output_video | 작업 output.video_urls |
reAPI의 Gemini Omni API 참조는 공급자 경로를 문서화합니다. 최대 2,000자의 프롬프트, 명시적 지속 시간 및 해상도 필드, 16:9 또는 9:16, 공개 URL 입력, 작업 폴링을 허용합니다. 1080p 및 4K 옵션은 공급자 배달 계층입니다. Google의 직접 공개 미리보기가 이러한 해상도를 노출한다는 증거는 아닙니다.
reAPI의 동등한 최소 형태는:
{
"model": "gemini-omni",
"prompt": "A continuous handheld shot of a tabby cat crossing a sunny kitchen.",
"duration": 6,
"resolution": "1080p",
"aspect_ratio": "16:9"
}경로는 작업 ID를 반환하며, 클라이언트는 output.video_urls가 사용 가능할 때까지 폴링합니다. Google 상호작용 ID를 반환하지 않으며 직접 Interactions API 래퍼로 취급해서는 안 됩니다.
공개: reAPI는 이 기사를 발행하고 위에서 설명한 reAPI 공급자 라우팅 엔드포인트를 운영합니다. 이 가이드의 직접 Google 사양 및 가격은 Google의 문서에서 나온 것입니다. reAPI 계약 세부 사항은 게시된 API 참조에서 나온 것입니다. 구별이 명시된 이유는 reAPI가 라우팅된 제품에 상업적 이해관계를 갖기 때문입니다.
어느 API를 사용해야 하나요?
제품이 특히 대화형 편집, 저장된 상호작용 기록, 직접 Google 청구 관계를 필요로 할 때 Google의 직접 미리보기를 사용하세요. 팀이 최신 Google 인터페이스에 대해 구축하고 미리보기 수명 주기 위험을 수용하려는 경우에도 가장 명확한 경로입니다.
고정 요청 스키마, 명시적 해상도 및 지속 시간 계층, 공개 URL 입력, 일반적인 비동기 작업 패턴이 Google 상호작용 상태보다 더 유용할 때 공급자 라우팅 계약을 사용하세요. 경로의 고유한 가격 책정 및 미디어 제약을 검증하고 Google의 설정을 그 안에 복사하지 마세요.
이 선택은 비디오 모델 선택과 별개입니다. 실제 질문이 프로덕션 워크플로에서 Veo를 유지할지 여부라면, Gemini Omni vs Veo 3.1 비교를 읽으세요. 결정이 멀티모달 참조 제어 및 생성 스타일에 관한 것이라면, Gemini Omni vs Seedance 2.0 비교가 해당 검색 의도를 다룹니다. 이 페이지는 Gemini Omni API 계약에 관해서만 다룹니다.
자주 묻는 질문
Gemini Omni API는 지금 사용 가능한가요?
예. Google은 2026년 6월 30일에 유료 Gemini Developer API 계층에서 gemini-omni-flash-preview를 출시했습니다. 이는 공개 미리보기이며 일반적으로 사용 가능한 프로덕션 모델이 아닙니다.[2]
직접 Gemini Omni API는 어떤 해상도를 지원하나요?
Google의 모델 카드는 현재 24 FPS에서 720p 출력을 문서화합니다. 써드파티 Gemini Omni 경로에서 직접 1080p 또는 4K 지원을 추론하지 마세요.[3]
Gemini Omni 비디오 비용은 얼마인가요?
Google은 100만 비디오 출력 토큰당 $17.50을 청구하고 720p 비디오를 초당 5,792토큰으로 계산합니다. 이는 대략 출력 초당 $0.10이며, 다른 입력 또는 출력 소비 전입니다.[4]
Gemini Omni은 같은 비디오를 한 번 이상 편집할 수 있나요?
예. 다음 Interactions API 요청에서 이전 상호작용의 ID를 previous_interaction_id로 전달하세요. 저장을 활성화하고 사용자가 다른 편집을 위해 돌아올 수 있으면 ID를 유지하세요.[1]
Gemini Omni이 오디오 참조를 수용하나요?
현재 직접 API 미리보기에서는 아닙니다. 비디오와 함께 오디오를 생성하지만, Google의 제한 목록은 오디오 참조 업로드가 지원되지 않는다고 말합니다.[1]
gemini-omni은 Google 모델 ID인가요?
아니요. 직접 Google 모델 ID는 gemini-omni-flash-preview입니다. gemini-omni은 reAPI의 별도 공급자 라우팅 계약에서 사용하는 식별자입니다.
References
- Google AI for Developers. Generate and edit videos with Gemini Omni Flash. Updated July 30, 2026. ai.google.dev/gemini-api/docs/omni
- Google AI for Developers. Gemini API release notes — June 30, 2026. ai.google.dev/gemini-api/docs/changelog
- Google AI for Developers. Gemini Omni Flash model card. ai.google.dev/gemini-api/docs/models/gemini-omni-flash
- Google AI for Developers. Gemini Developer API pricing — Gemini Omni Flash Preview. Retrieved July 30, 2026. ai.google.dev/gemini-api/docs/pricing
작성자

카테고리
gemini-omni 비교어느 API를 사용해야 하나요?자주 묻는 질문Gemini Omni API는 지금 사용 가능한가요?직접 Gemini Omni API는 어떤 해상도를 지원하나요?Gemini Omni 비디오 비용은 얼마인가요?Gemini Omni은 같은 비디오를 한 번 이상 편집할 수 있나요?Gemini Omni이 오디오 참조를 수용하나요?gemini-omni은 Google 모델 ID인가요?References더 많은 게시물

OpenAI Astra의 10가지 수학 성과: 의미와 검증
OpenAI Astra가 수학과 이론 컴퓨터 과학에서 생성한 10가지 성과를 분석합니다. Lean 형식화, 증명 검증, 그리고 독립 전문가 검토 과정을 설명합니다.


Veo 3.1 vs Seedance 2.0: 2026년 비디오 모델 선택법
2026년 Veo 3.1과 Seedance 2.0 중 무엇을 선택할까요? 기능, 멀티샷, 오디오, 해상도와 가격을 출처가 있는 수치로 비교합니다.


Kimi K3 완벽 가이드: Moonshot 2.8T 플래그십
Kimi K3 사양, 구조, 가격과 API 동작을 정리합니다: 1M 컨텍스트, 상시 추론, 고정 샘플링, OpenAI 호환 API 호출 방법.
