
Gemini 3.6 Flash 사용법: 속도, 가격, 제한 사항
Gemini 3.6 Flash 사용법: 공식 벤치마크, Luna와 Sonnet 5에 뒤지는 부분, API 파괴적 변경 4가지, Flash-Lite와 Cyber 모델.
2026년 7월 21일 Google은 한 번의 발표에서 세 가지 Gemini 모델을 공개했습니다: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, 그리고 제한된 보안 전문가인 Gemini 3.5 Flash Cyber[1]. Pro 모델 없음, 기조연설 없음, 새로운 인텔리전스 경계에 대한 주장 없음. 전체 릴리스가 주장하는 것은 한 가지입니다: 프로덕션 환경에서 에이전트를 실행하는 팀은 더 큰 모델이 아니라 작업당 더 적은 토큰과 더 낮은 지연 시간이 필요하다는 것입니다.
이 프레이밍은 누가 대상인지 알려줍니다. Gemini 3.6 Flash를 잘 사용하는 법을 배우는 것은 복리 수학에 관한 것입니다. Google은 출력 가격을 낮춰도 모델이 동일한 작업을 위해 더 적은 토큰을 출력하므로 이 두 효과가 곱해집니다. 이 가이드는 공식 벤치마크 데이터, 3.6 Flash가 GPT-5.6 Luna와 Claude Sonnet 5에 명확히 지는 곳, 기존 코드를 깨뜨리는 4가지 API 변경, 그리고 3개 모델 중 실제로 워크로드에 맞는 것이 무엇인지를 다룹니다.
TL;DR: 2026년 7월 Gemini Flash 라인업
| 모델 | 100만 토큰당 정가 | 포지셔닝 |
|---|---|---|
| Gemini 3.6 Flash | 입력 $1.50 / 출력 $7.50 | 코딩, 에이전트, 지식 작업의 주력 모델. 3.5 Flash 대비 출력 토큰 약 17% 감소[4] |
| Gemini 3.5 Flash-Lite | 입력 $0.30 / 출력 $2.50 | 3.5 시리즈 최고속 모델, 초당 출력 토큰 350개[4]. 대량 파이프라인 작업용 |
| Gemini 3.5 Flash Cyber | 공개되지 않음 | DeepMind의 CodeMender 에이전트 내 보안 취약점 탐지기. 정부와 검증된 파트너만 이용 가능[3] |
같은 게시물에 숨겨진 로드맵 2가지: Gemini 3.5 Pro는 여전히 파트너 테스트 중이며 공개 일정 없음. Google은 Gemini 4 가장 야심 찬 사전 학습이 이미 시작되었음을 확인했습니다[1].
reAPI에서 Gemini 3.6 Flash는 100만 토큰당 입력 $1.20, 출력 $6.00으로 작동합니다. 이는 Google의 공개 요율의 80%입니다. Flash-Lite와 Flash Cyber는 게이트웨이에서 이용 불가합니다.
효율성 전략

Gemini 3.6 Flash는 100만 입력 토큰당 $1.50, 100만 출력 토큰당 $7.50이며 캐시된 입력은 100만당 $0.15[1]입니다. 선임 모델은 100만 출력당 $9를 청구했으므로 Google은 출력 가격을 약 17% 인하하면서 전반적으로 벤치마크 점수를 개선했습니다.
정가는 이야기의 작은 부분입니다. Artificial Analysis는 3.6 Flash가 동일한 워크로드에서 3.5 Flash보다 약 17% 적은 출력 토큰을 소비하는 것으로 측정했습니다[4]. Google은 Datacurve의 DeepSWE 벤치마크에서 최대 65%의 토큰 감소를 보고했습니다[1]. 모델은 또한 다단계 작업을 완료하는 데 필요한 추론 단계와 도구 호출도 더 적습니다.
작업당 수십 번 루프하는 에이전트의 경우 이 효과들이 누적됩니다: 더 저렴한 토큰, 더 적은 토큰, 더 적은 루프. 토큰당 가격 비교는 격차를 과소평가합니다.
선임 모델 대비 공식 벤치마크

Google의 출시 차트는 4개의 에이전트식 벤치마크에서 3.6 Flash와 3.5 Flash, 구식 3.1 Pro를 비교합니다[1].
| 벤치마크 | Gemini 3.1 Pro | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|---|
| DeepSWE v1.1 (장기 소프트웨어 엔지니어링) | 12% | 37% | 49% |
| MLE-Bench (머신러닝 엔지니어링) | 42.6% | 49.7% | 63.9% |
| GDPVal-AA v2 (지식 작업, Elo) | 965 | 1349 | 1421 |
| OSWorld-Verified (컴퓨터 사용) | 76.2% | 78.4% | 83.0% |
Google의 평가 방식에는 이전 세대 대비 추가 3개의 이득이 있습니다: SWE-Bench Pro는 55.1% 대비 58.7%, Terminal-Bench 2.1은 76.2% 대비 78.0%, 완전 100만 토큰 깊이의 GDM-MRCR v2 장기 맥락 검색 테스트에서 3.6 Flash는 27% 이하 대비 54.0%로 양쪽 선임 모델을 대충 2배로[5].
모델 카드에서: 지식 기준일은 2025년 1월에서 2026년 3월로 이동, 컨텍스트 경계는 입력 100만개와 출력 64K 토큰 유지, 모델은 텍스트, 이미지, 오디오, 비디오를 기본적으로 수용[2].
3.6 Flash가 이기는 곳과 지는 곳
Google의 차트는 Gemini를 Gemini와만 비교합니다. 이것은 2026년 중반 공개 결과를 사용한 교차 업체 그림입니다[5].
| 벤치마크 | Gemini 3.6 Flash | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
|---|---|---|---|---|
| DeepSWE v1.1 | 49% | 67% | n/a | n/a |
| Terminal-Bench 2.1 | 78.0% | 84.7% | n/a | n/a |
| SWE-Bench Pro | 58.7% | n/a | 64.7% | n/a |
| MLE-Bench | 63.9% | n/a | n/a | 66.9% |
| GDPVal-AA v2 (Elo) | 1421 | n/a | n/a | 1607 |
| OSWorld-Verified | 83.0% | n/a | n/a | n/a |
어떤 모델도 모든 항목을 제패하지 못하며 3.6 Flash가 시도하지도 않습니다. OSWorld-Verified 컴퓨터 사용, 두 CharXiv 차트 추론 변형, 그리고 두 GDM-MRCR 장기 맥락 테스트에서 리드합니다[5]. 이것들은 Google이 지속적으로 소유해 온 다중 모달 및 장기 맥락 레인입니다.
GPT-5.6 Luna는 에이전트식 코딩, DeepSWE와 Terminal-Bench 둘 다에서 명확히 뒤집니다. Claude Sonnet 5는 ML 엔지니어링과 지식 작업에서 뒤떨어지며 Sonnet 5의 GDPVal-AA 1607 Elo는 3.6 Flash의 1421과는 다른 무게급[5].
독립 평가도 동의합니다. Artificial Analysis는 3.6 Flash를 지능 지수에서 50, 추적된 187개 모델 중 21위로 점수 매깁니다. 그것은 한계 인텔리전스가 아니며 Google은 그것을 주장하지 않습니다. 동일한 평가는 그 클래스에서 출력 속도 첫 번째 303.6 토큰/초로 순위 매기며 토큰 사용을 충분히 간결하다 설명하면서 높은 사고 노력에서 첫 토큰까지의 시간은 11.54초이고 그 층의 느린 끝에 앉아 있음을 유의[4].
교차 업체 표를 인용하기 전 하나의 방법론 주의: 업체 점수는 일반적으로 각 모델의 최대 사고 설정에서 보고되며 에이전트 하니스는 업체 간 다릅니다. 작은 간격을 노이즈로 취급하고 큰 것만 신호로 취급하세요.
실제 읽이. 작업이 원시 코드 에이전트 마력인 경우 GPT-5.6 Luna와 Claude Sonnet 5는 여전히 몇 배 가격에 보드 상단을 보유합니다. 작업이 컴퓨터 사용, 문서 중심 다중 모달 작업, 또는 대규모 장기 맥락 검색인 경우 3.6 Flash는 해당 괄호 내 달러당 최고 점수를 제공합니다.
Gemini 3.5 Flash-Lite
두 번째 릴리스는 곡선의 반대 끝을 대상으로 합니다. Flash-Lite는 Artificial Analysis에서 측정된 초당 350 출력 토큰에서 실행, 100만 입력당 $0.30, 100만 출력당 $2.50로 가격 책정. 이는 3.6 Flash 요율의 5분의 1과 3분의 1[1][4].

세대 간 도약은 릴리스의 다른 어디보다 여기서 더 큽니다[1]:
- Terminal-Bench 2.1: 3.1 Flash-Lite의 31.0% 대비 54.0%, 에이전트식 터미널 코딩에서 23포인트 이동.
- GDPVal-AA v2: 642 대비 1140 Elo, 실제 지식 작업에서 거의 2배.
- GDM-MRCR v2 장기 맥락: 60.1% 대비 72.2%.
일시정지할 가치 있는 비교는 더 크고 구식인 3 Flash 대비 비교입니다: Flash-Lite는 SWE-Bench Pro를 49.6% 대비 54.2%, OSWorld-Verified를 65.1% 대비 74.0%에서 이겨냅니다[1]. 가장 저렴한 현재 모델이 코딩과 컴퓨터 사용에서 이전 세대 중급을 이깁니다.
Google은 높은 처리량 작업을 위해 위치시킵니다: 에이전트식 검색, 대량 문서 처리, 분류, 서브에이전트 팬아웃, 최소부터 기본, 높음까지 설정 가능한 사고 수준[1].
Gemini 3.5 Flash Cyber
세 번째 모델은 Google이 팔지 않는 모델입니다. Flash Cyber는 보안 취약점을 발견, 검증, 패치하도록 미세 조정된 3.5 Flash 버전이며 CodeMender DeepMind의 코드 보안 에이전트 내부에서만 제한된 파일럿에서 정부 및 신뢰할 수 있는 파트너에게 공개[3].
미세 조정은 몇몇 실험실이 가지고 있는 자산에 기댑니다: 700,000개 이상의 오픈 소스 취약점의 OSV.dev 데이터베이스, 10년 이상의 OSS-Fuzz 결과, Chromium을 포함한 Google 규모 코드베이스의 보안 워크플로 데이터[3]. CodeMender 내에서 다중 Flash Cyber 서브에이전트가 다양한 코드 경로를 분석하고 결과를 하나의 보고서로 병합합니다. 이것이 건축 베팅입니다: 저렴한 모델은 최대 5번 호출되어 훨씬 더 큰 모델에 대한 단일 호출을 경쟁시킵니다.

| 시스템 | CyberGym 점수 |
|---|---|
| OpenAI 에이전트의 GPT-5.5-Cyber | 85.6% |
| Anthropic 에이전트의 Claude Mythos 5 | 83.8% |
| OpenAI 에이전트의 GPT-5.6 Sol | 83.6% |
| CodeMender의 Gemini 3.5 Flash Cyber (최대 5 호출) | 83.2% |
| Anthropic 에이전트의 Claude Mythos Preview | 83.1% |
정직하게 읽으세요: Flash Cyber는 차트 맨 위에 있지 않습니다. OpenAI의 전담 GPT-5.5-Cyber는 2.4포인트 앞서고 Mythos 5는 0.6으로 연결입니다. Google의 주장은 Flash 크기 모델에서의 경쟁력 있는 성능인데, 이것은 왕관보다는 비용 주장[3].
이기는 곳은 Google 자신의 더 깊은 평가입니다. V8 JavaScript 엔진 테스트에서는 스톡 3.5 Flash의 47과 Claude Opus 4.6의 36 대비 55개 고유 실제 문제를 확인했습니다. 다른 모델이 발견한 10 포함[3]. Google의 Cloud Vulnerability Research 팀은 이를 사용해 프로덕션 서비스의 메모리 손상 취약점을 찾고 ASLR과 W^X를 우회하면서 2시간 내 작동하는 익스플로잇 체인을 구축했다 보고합니다[3].
이것이 단속을 설명합니다. Google은 기능이 이중용도라 명시하고, 검증된 수호자에게 접근을 제한하고, CodeMender의 보고 워크플로 내에서만 배포하고, 패치가 배포되기 전에 인간의 승인이 필요합니다[3].
Gemini 3.6 Flash 사용법: 구식 코드를 깨뜨리는 4가지 API 변경
모델 카드는 3.6 Flash를 3.5 Flash에 기반한 것으로 설명하며, 동일한 기본적으로 다중 모달 스파스 추론 기초와 동일한 1M/64K 경계로, 이득은 기본 모델이 아닌 사후 훈련에서 옵니다[2]. 요청 표면이 일이 있는 곳입니다.
- 모델 ID는
gemini-3.6-flash및gemini-3.5-flash-lite[1]. thinking_budget은thinking_level문자열 열거로 대체됨. 3.6 Flash는medium기본, Flash-Lite는minimal기본[1].- 클래식 샘플링 노브가 사라짐.
temperature,top_p,top_k는 제거되었으며 요청 페이로드에서 삭제되어야 함[1]. candidate_count는 미지원, 미리 채워진 모델 차례, 빈이 아닌 모델 역할에서 끝나는 대화는 거부됨을 의미[1].
양쪽 공개 모델은 컴퓨터 사용, 검색 그라운딩, 코드 실행을 포함한 전체 내장 도구 모음을 공개합니다[1]. 3.5 Flash에서 오면 마이그레이션은 모델 문자열 변경 및 부작용 매개변수 삭제입니다. 학습할 새 SDK 표면이 없습니다.
어느 모델을 선택해야 할까요
공개된 숫자에서 바로 라우팅 휴리스틱:
- 3.6 Flash로 기본 설정 하세요. 코딩, 컴퓨터 사용, 문서 해석, 또는 모든 다단계 관련 에이전트 루프. 토큰 효율 이득이 에이전트 비용이 폭발하는 바로 그 곳에서 정확히 복합됩니다.
- 대량, 지연 시간이 중요한 작업을 Flash-Lite로 라우팅 하세요: 추출, 분류, 검색 요약, 서브에이전트 팬아웃. 샘플 품질 검사가 필수라 할 때만
thinking_level높입니다. - 한계 코딩을 한계 모델에 보관하세요. DeepSWE 클래스 자율성이 작업이면 정직한 수는 GPT-5.6 Luna와 Claude Sonnet 5가 여전히 3.6 Flash가 할 수 없는 작업을 마치고 저 볼륨 높은 베팅 런에서 프리미엄이 보상받을 수 있다는 것입니다.
- Flash Cyber는 선택이 아닙니다. 정부 기관 또는 파일럿에 초대된 파트너가 아닌 한.
다른 모델과 함께 Gemini 3.6 Flash 호출
해당 라우팅 목록이 실제로 무엇을 말하는지 주목하세요. 4개 항목 중 3개는 Gemini 이외의 곳으로 작업을 보냅니다. Google 자신의 벤치마크 테이블에서 정직한 결론은 3.6 Flash가 트래픽의 일부를 이기고 나머지를 잃어야 하며 분할은 업체가 배송할 때마다 이동한다는 것입니다.
reAPI는 OpenAI 호환 /v1/chat/completions 엔드포인트를 통해 Gemini 3.6 Flash를 노출하므로 클라이언트가 이미 GPT 및 Claude를 호출하면 여기서도 호출합니다. 와이어 모델 ID가 Google의 점을 유지함을 주목하세요:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="gemini-3.6-flash",
messages=[{"role": "user", "content": "이 보고서를 요약하고 숫자를 뽑아내세요."}],
max_tokens=16000,
stream=True,
)게이트웨이 요율은 100만 입력 토큰당 $1.20, 100만 출력 토큰당 $6.00으로 Google의 공개 $1.50 / $7.50의 80%입니다. 게이트웨이는 이 모델에 대한 기본 Gemini 엔드포인트 타입도 노출하므로 Google 자신의 형식에 대해 작성된 SDK는 다시 작성 없이 작동합니다. 현재 요율 및 요청 표면은 reapi.ai/models/gemini-3-6-flash 및 reapi.ai/docs/gemini-3-6-flash에 있습니다.
명확히: Flash-Lite와 Flash Cyber는 게이트웨이에 없습니다. Flash Cyber는 Google 파일럿 외부의 누구도 사용할 수 없습니다. 호출 방법에 관계없이.
FAQ
Gemini 3.6 Flash가 실제로 3.5 Flash보다 저렴합니까?
예, 출력: 100만 토큰당 $9 대비 $7.50, 약 17% 삭감. 모델도 동일한 작업을 위해 약 17% 적은 토큰을 출력하므로 완료된 작업당 유효 비용이 정가보다 더 떨어집니다. 캐시된 입력은 100만당 $0.15[1][4].
Gemini 3.6 Flash의 컨텍스트 윈도우는 무엇입니까?
100만 입력 토큰과 64K 출력 토큰, 텍스트, 이미지, 오디오, 비디오 기본적으로 수용[2].
3.5 Flash에서 업그레이드하려면 코드를 변경해야 합니까?
최소한으로. 모델 문자열을 gemini-3.6-flash로 교환, thinking_budget을 thinking_level로 대체, 요청에서 temperature, top_p, top_k, candidate_count 제거[1].
Gemini 3.6 Flash가 GPT-5.6 Luna 또는 Claude Sonnet 5보다 낫습니까?
에이전트식 코딩에서는 아닙니다. Luna는 DeepSWE 67% 대 49% 및 Terminal-Bench 84.7% 대 78.0% 이끌고 Sonnet 5 리드 MLE-Bench 및 GDPVal-AA[5]. Gemini 3.6 Flash는 컴퓨터 사용, 차트 추론, 장기 맥락 검색에서 이기고 가격의 일부입니다.
Gemini 3.5 Flash Cyber에 접근할 수 있습니까?
정부 기관 또는 파일럿 CodeMender에 초대된 파트너가 아닌 한 아니오[3].
Gemini 3.5 Pro는 어떻게 되었습니까?
파트너 테스트에 남아 공표된 날짜 없으면서 Google은 Gemini 4 사전 훈련이 이미 진행 중임을 확인했습니다[1].
Gemini 3.6 Flash는 얼마나 빠릅니까?
Artificial Analysis는 그 클래스에서 출력 속도 첫 번째 303.6 토큰/초로 순위 매기지만 높은 사고 노력에서 첫 토큰까지의 시간은 11.54초로 그 층의 느린 끝입니다[4]. 사람이 보는 어떤 것이든 스트림하세요.
OpenAI SDK로 Gemini 3.6 Flash를 호출하려면 어떻게 합니까?
OpenAI 클라이언트를 https://api.reapi.ai/v1로 지정하고 model을 ID의 점을 유지하면서 gemini-3.6-flash로 설정하세요. 엔드포인트는 OpenAI 호환이므로 SDK 다시 작성이 필요하지 않습니다.
단위 경제학에서 경쟁하는 릴리스 읽기
이 론칭은 기능 이동이 아닌 가격 이동으로서 이해할 가치가 있습니다. Google은 Pro 층을 배송하지 않았고 한계 청구를 만들지 않았고 엔지니어링을 대리인 비용을 결정하는 2개 숫자에 집어 넣었습니다: 토큰당 가격 및 작업당 토큰. 둘 다 약 17% 내려가고 곱합니다. 이에 대한 교차 업체 표는 3.6 Flash가 GPT-5.6 Luna에 에이전트식 코딩을 잃고 Claude Sonnet 5에 지식 작업을 잃는 것을 보여주는데 이것은 이 괄호의 모델의 결함보다는 올바른 거래입니다.
실제 버전: 에이전트 루프를 그것으로 기본 설정, 대량 추출을 낮게 라우팅, 한계 모델에 한계 코딩 보관, 토큰 효율 이득이 표시되는 유일한 숫자이므로 완료된 작업당 유효 비용 측정. 그것이 Gemini 3.6 Flash를 한계 가격으로 이미 충분히 잘 하는 작업을 하는 것을 알지 못하고 및 명백히 잃는 행을 이기기를 기대하지 않고 사용하는 방법입니다.
참고 자료
- Google. Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 소개. 2026년 7월에 blog.google/technology/google-deepmind에서 검색됨.
- Google DeepMind. Gemini 3.6 Flash 모델 카드. 2026년 7월에 deepmind.google/models/gemini에서 검색됨.
- Google DeepMind. Gemini 3.5 Flash Cyber 및 CodeMender 소개. 2026년 7월에 deepmind.google/discover/blog에서 검색됨.
- Artificial Analysis. Gemini 3.6 Flash — 인텔리전스, 성능, 가격 분석. 2026년 7월에 artificialanalysis.ai/models에서 검색됨.
- OfficeChai. Gemini 3.6 Flash는 대부분의 벤치마크에서 Gemini 3.5 Flash 및 Gemini 3.1 Pro를 이깁니다. 2026년 7월에 officechai.com에서 검색됨.
추가 읽을거리
- reAPI. Claude Opus 5 사용법. reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. Gemini 3.6 Flash 엔드포인트 참고. reapi.ai/docs/gemini-3-6-flash
- reAPI. 모델 카탈로그. reapi.ai/models
작성자

카테고리
더 많은 게시물

Seedance 2.0이란? 사용 방법까지 정리한 2026 가이드
Seedance 2.0의 개념, 진짜 공식 사이트, 현재 이용 가능한 모든 플랫폼과 API 호출 방법을 설명합니다. 2026년 7월 검증 완료.


n8n 상품 광고 이미지: 20센트 이하로 5개 후보
검증된 $0.075 배치로 5개의 상품 광고 후보를 생성하는 n8n 워크플로우입니다. 폴링 제어, 재시도 예산, 실용적인 검토 체크리스트를 포함합니다.


MiniMax H3 Max와 H3: 속도, 제어, API 경로 비교
속도, 해상도, 참조 입력, API 경로, 공개 가중치로 MiniMax H3 Max와 H3를 비교하고 각 모델에 적합한 워크플로를 설명합니다.
