
Как использовать Gemini 3.6 Flash: цена, скорость, лимиты
Как использовать Gemini 3.6 Flash: результаты тестов, где проигрывает GPT-5.6 Luna и Sonnet 5, четыре ломающих API изменения и модели Flash-Lite с Cyber.
21 июля 2026 года Google выпустил три модели Gemini в одном анонсе: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite и специализированный на безопасности Gemini 3.5 Flash Cyber с ограниченным доступом[1]. Никакой Pro-версии, без презентации, без претензий на новую границу интеллекта. Весь анонс доказывает одно: команды, запускающие агентов в боевых условиях, нужны меньше токенов и ниже задержки на каждый запрос, а не более большая модель.
Эта концепция говорит, кому она предназначена. Научиться хорошо использовать Gemini 3.6 Flash — это прежде всего вопрос составного эффекта, потому что Google снизил цену вывода и модель генерирует меньше токенов на ту же работу. Эти два эффекта перемножаются. Этот гайд рассказывает об официальных результатах тестов, где 3.6 Flash честно проигрывает GPT-5.6 Luna и Claude Sonnet 5, четырех изменениях API, которые ломают старый код, и том, какая из трёх моделей подходит именно твоему случаю.
TL;DR: линейка Gemini Flash июля 2026 года
| Модель | Цена за 1M токенов | Позиционирование |
|---|---|---|
| Gemini 3.6 Flash | $1.50 вход / $7.50 выход | Рабочая лошадка для кода, агентов и работы с данными. Примерно на 17% меньше токенов вывода, чем 3.5 Flash[4] |
| Gemini 3.5 Flash-Lite | $0.30 вход / $2.50 выход | Самая быстрая модель в серии 3.5 на 350 токенов вывода в секунду[4]. Для конвейеров с большим объёмом |
| Gemini 3.5 Flash Cyber | Цена не опубликована | Искатель уязвимостей внутри агента CodeMender от DeepMind. Только для государств и утверждённых партнёров[3] |
В том же посте спрятаны две новости о планах: Gemini 3.5 Pro всё ещё тестируется, даты нет, и Google подтвердил, что начал самый амбициозный цикл предварительного обучения, для Gemini 4[1].
На reAPI Gemini 3.6 Flash работает по $1.20 за вход и $6.00 за выход на миллион токенов, то есть 80% от официальной цены Google. Flash-Lite и Flash Cyber на шлюзе недоступны.
Эффективность как стратегия

Gemini 3.6 Flash стоит $1.50 за миллион входящих токенов и $7.50 за миллион выходящих, кешированный вход стоит $0.15 за миллион[1]. Её предшественник брал $9 за миллион выходящих, поэтому Google снизил цену вывода примерно на 17% и одновременно улучшил результаты тестов по всем показателям.
Официальная цена — это только половина истории. Artificial Analysis измерила, что 3.6 Flash потребляет примерно на 17% меньше токенов вывода, чем 3.5 Flash на одинаковых задачах[4], а Google сообщил о снижении токенов на 65% в тесте DeepSWE от Datacurve[1]. Модель также требует меньше шагов рассуждения и меньше вызовов инструментов для завершения многошаговой работы.
Для агента, который прогоняет десятки итераций за задачу, эти эффекты складываются: дешевле токены, меньше токенов, меньше итераций. Сравнение по цене за токен недооценивает разницу.
Официальные тесты против собственных предшественников

График запуска Google сравнивает 3.6 Flash с 3.5 Flash и старшей 3.1 Pro по четырём тестам для агентов[1].
| Тест | Gemini 3.1 Pro | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|---|
| DeepSWE v1.1 (дальнее планирование в инженерии ПО) | 12% | 37% | 49% |
| MLE-Bench (инженерия машинного обучения) | 42.6% | 49.7% | 63.9% |
| GDPVal-AA v2 (работа с данными, Elo) | 965 | 1349 | 1421 |
| OSWorld-Verified (использование компьютера) | 76.2% | 78.4% | 83.0% |
Три дополнительных успеха над предыдущим поколением спрятаны в методологии тестирования Google: SWE-Bench Pro на 58.7% против 55.1%, Terminal-Bench 2.1 на 78.0% против 76.2%, и тест долгоконтекстного поиска GDM-MRCR v2 на полной глубине 1M токенов, где 3.6 Flash примерно удвоил обоих предшественников на 54.0% против менее 27%[5].
По карточке модели: знания обновлены до марта 2026 с января 2025, контекстное окно остаётся 1M вход и 64K токенов выхода, модель принимает текст, изображения, аудио и видео в нативном виде[2].
Где 3.6 Flash выигрывает, а где проигрывает
График Google сравнивает только Gemini с Gemini. Вот кроссплатформенная картина на основе результатов середины 2026 года[5].
| Тест | Gemini 3.6 Flash | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
|---|---|---|---|---|
| DeepSWE v1.1 | 49% | 67% | n/a | n/a |
| Terminal-Bench 2.1 | 78.0% | 84.7% | n/a | n/a |
| SWE-Bench Pro | 58.7% | n/a | 64.7% | n/a |
| MLE-Bench | 63.9% | n/a | n/a | 66.9% |
| GDPVal-AA v2 (Elo) | 1421 | n/a | n/a | 1607 |
| OSWorld-Verified | 83.0% | n/a | n/a | n/a |
Ни одна модель не побеждает везде, и 3.6 Flash не к этому стремится. Она лидирует в использовании компьютера OSWorld-Verified, в обоих вариантах reasoning с графиками CharXiv, и в обоих тестах долгоконтекстного поиска GDM-MRCR[5]. Это мультимодальные и долгоконтекстные маршруты, которыми Google всегда владел.
Она явно отстаёт от GPT-5.6 Luna по кодированию агентов, по обоим DeepSWE и Terminal-Bench. Она отстаёт от Claude Sonnet 5 по инженерии машинного обучения и работе с данными, а Elo 1607 Sonnet 5 в GDPVal-AA — это совсем другой уровень, чем 1421 у 3.6 Flash[5].
Независимое мнение согласно. Artificial Analysis оценивает 3.6 Flash в 50 баллов по своему Индексу Интеллекта, ранг 21 из 187 отслеживаемых моделей. Это не фронтальный интеллект, и Google не претендует на это. Та же оценка ставит её на первое место по скорости вывода в своём классе на 303.6 токенов в секунду и описывает потребление токенов как довольно скромное, но отмечает, что время до первого токена при высоком уровне мышления составляет 11.54 секунды, что находится на медленном конце для её класса[4].
Одно методологическое замечание перед цитированием кроссплатформенной таблицы: результаты обычно показывают при максимальной конфигурации мышления каждой модели, и архитектуры агентов отличаются. Небольшие разницы считай шумом, большие — сигналом.
Практический взгляд. Если нужна чистая мощь агента-программиста, GPT-5.6 Luna и Claude Sonnet 5 всё ещё держат вершину, но в несколько раз дороже. Если это использование компьютера, мультимодальная работа с документами или поиск в долгом контексте в масштабах, 3.6 Flash даёт лучший результат за доллар в своём диапазоне.
Gemini 3.5 Flash-Lite
Второй выпуск нацелен на противоположный конец кривой. Flash-Lite работает на 350 токенов вывода в секунду по измерениям Artificial Analysis, по цене $0.30 за миллион входящих и $2.50 за миллион выходящих, то есть одна пятая и одна треть цен 3.6 Flash[1][4].

Скачок поколения здесь больше, чем где-либо в других выпусках[1]:
- Terminal-Bench 2.1: 54.0% против 31.0% для 3.1 Flash-Lite, скачок на 23 пункта в кодировании терминала для агентов.
- GDPVal-AA v2: 1140 Elo против 642, почти вдвое на реальной работе с данными.
- GDM-MRCR v2 долгий контекст: 72.2% против 60.1%.
Сравнение, на котором стоит остановиться, это с более старшей и большей 3 Flash: Flash-Lite теперь выигрывает SWE-Bench Pro на 54.2% против 49.6% и OSWorld-Verified на 74.0% против 65.1%[1]. Самая дешёвая текущая модель побеждает предыдущее поколение на среднем уровне в кодировании и использовании компьютера.
Google позиционирует её для высокопроизводительной работы: поиск от агентов, массовая обработка документов, классификация, ветвление на подагентов, с уровнями мышления от минимального по умолчанию до высокого[1].
Gemini 3.5 Flash Cyber
Третья модель — это та, которую Google не будет продавать. Flash Cyber — версия 3.5 Flash, дотренированная для поиска, проверки и исправления уязвимостей безопасности, и она доступна только внутри CodeMender, агента по безопасности кода от DeepMind, в ограниченном пилоте для государств и доверенных партнёров[3].
Дотренировка опирается на активы, которыми мало кто владеет: базу OSV.dev с более чем 700,000 уязвимостями open-source, более десять лет результатов OSS-Fuzz и данные о рабочих процессах безопасности из кодовых баз Google, включая Chromium[3]. Внутри CodeMender несколько подагентов Flash Cyber анализируют разные пути кода и объединяют находки в один отчёт — вот архитектурная идея: дешёвая модель, вызванная до пяти раз, конкурирует с одиночными вызовами намного более больших.

| Система | Результат CyberGym |
|---|---|
| GPT-5.5-Cyber в агенте OpenAI | 85.6% |
| Claude Mythos 5 в агенте Anthropic | 83.8% |
| GPT-5.6 Sol в агенте OpenAI | 83.6% |
| Gemini 3.5 Flash Cyber в CodeMender (макс 5 вызовов) | 83.2% |
| Claude Mythos Preview в агенте Anthropic | 83.1% |
Читай честно: Flash Cyber не на вершине. Специализированная GPT-5.5-Cyber от OpenAI лидирует на 2.4 пункта, Mythos 5 даёт ей фору 0.6. Претензия Google — конкурентный результат от модели размером Flash, что скорее утверждение о цене, чем корона[3].
Где она по-настоящему выигрывает, так в более глубоких оценках самого Google. На тесте V8 JavaScript она подтвердила 55 уникальных реальных проблем против 47 у стандартной 3.5 Flash и 36 у Claude Opus 4.6, включая 10, которые другие модели не нашли[3]. Команда Cloud Vulnerability Research от Google сообщила, что использовала её для поиска уязвимости повреждения памяти в боевом сервисе и построения рабочей цепочки эксплойтов, обходя ASLR и W^X, за два часа[3].
Это объясняет ограничения. Google заявляет, что способность имеет двойное применение, ограничивает доступ проверенными защитниками, разворачивает только внутри рабочего процесса отчётности CodeMender и требует одобрения человека перед развёртыванием патчей[3].
Как использовать Gemini 3.6 Flash: четыре API-изменения, которые ломают старый код
Карточка модели описывает 3.6 Flash как прямое развитие 3.5 Flash с той же нативной мультимодальной базой разреженного мышления и тем же окном 1M/64K, улучшения идут от постобучения, а не из новой базовой модели[2]. Вся работа в поверхности запроса.
- IDs моделей:
gemini-3.6-flashиgemini-3.5-flash-lite[1]. thinking_budgetзаменён строковым enumthinking_level. 3.6 Flash по умолчаниюmedium, Flash-Lite по умолчаниюminimal[1].- Классические регуляторы семплирования ушли.
temperature,top_pиtop_kудалены и должны быть убраны из зарядов запроса[1]. candidate_countне поддерживается, и заполненные заранее повороты модели, то есть разговоры, заканчивающиеся ненулевой ролью модели, отклоняются[1].
Обе публичные модели раскрывают полный встроенный набор инструментов, включая использование компьютера, привязку к поиску и выполнение кода[1]. Переходя от 3.5 Flash, миграция — это смена строки модели плюс удаление устаревших параметров. Никакой новой поверхности SDK для изучения.
Какую модель выбрать
Эвристика маршрутизации прямо из опубликованных цифр:
- По умолчанию используй 3.6 Flash для циклов агента, которые включают кодирование, использование компьютера, анализ документов или любую многошаговую работу. Прибыль от эффективности токенов множится ровно там, где затраты агента взрываются.
- Маршрутизируй массовую работу, чувствительную к задержке, на Flash-Lite: извлечение, классификация, поиск резюме, ветвление на подагентов. Поднимай
thinking_levelтолько если проверка качества выборки скажет, что нужно. - Держи кодирование фронтира на фронтирных моделях. Если работа требует автономии класса DeepSWE, честные цифры говорят, что GPT-5.6 Luna и Claude Sonnet 5 всё ещё делают задачи, которые 3.6 Flash не может, и премиум может быть оправдан на низкообъёмных высокорисковых прогонах.
- Flash Cyber не вариант, который ты можешь выбрать, если ты не государство или приглашённый партнёр.
Вызов Gemini 3.6 Flash рядом с другими моделями
Обрати внимание на то, что реально говорит этот список маршрутизации. Три из четырёх пунктов отправляют работу куда-то не в Gemini. Честный вывод из собственной таблицы тестов Google — что 3.6 Flash должна выигрывать часть твоего трафика и проигрывать остальное, и разделение сдвигается каждый раз, когда вендор что-то выпускает.
reAPI выставляет Gemini 3.6 Flash через точку /v1/chat/completions, совместимую с OpenAI, так что клиент, который уже вызывает GPT и Claude, вызовет и её. Заметь, что ID модели по проводу сохраняет точку Google:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="gemini-3.6-flash",
messages=[{"role": "user", "content": "Summarize this report and pull out the numbers."}],
max_tokens=16000,
stream=True,
)Цены на шлюзе — $1.20 за миллион входящих токенов и $6.00 за миллион выходящих, то есть 80% от опубликованных Google $1.50 / $7.50. Шлюз также раскрывает тип родной точки Gemini для этой модели, так что SDKи, написанные на собственном формате Google, работают без переписывания. Текущие цены и поверхность запроса живут на reapi.ai/models/gemini-3-6-flash и reapi.ai/docs/gemini-3-6-flash.
Чтобы было ясно о покрытии: Flash-Lite и Flash Cyber не на шлюзе. Flash Cyber не доступна никому вне пилота Google, как бы ты её ни вызывал.
FAQ
Gemini 3.6 Flash действительно дешевле, чем 3.5 Flash?
Да, на выходе: $7.50 против $9 за миллион токенов, примерно 17% снижение. Потому что модель также выпускает примерно на 17% меньше токенов на ту же работу, эффективная стоимость за завершённую задачу падает больше, чем предлагает официальная цена. Кешированный вход $0.15 за миллион[1][4].
Какой контекст у Gemini 3.6 Flash?
1M входящих токенов и 64K выходящих, текст, изображения, аудио и видео принимаются в нативном виде[2].
Нужно менять код, чтобы обновиться с 3.5 Flash?
Минимально. Замени строку модели на gemini-3.6-flash, замени thinking_budget на thinking_level и удали temperature, top_p, top_k и candidate_count из запросов[1].
Gemini 3.6 Flash лучше GPT-5.6 Luna или Claude Sonnet 5?
Не в кодировании агентов. Luna лидирует DeepSWE 67% к 49% и Terminal-Bench 84.7% к 78.0%, Sonnet 5 лидирует MLE-Bench и GDPVal-AA[5]. Gemini 3.6 Flash выигрывает в использовании компьютера, reasoning с графиками и поиске в долгом контексте, за дробь цены.
Могу ли я получить доступ к Gemini 3.5 Flash Cyber?
Нет, если ты не государственное агентство или приглашённый партнёр в пилоте CodeMender[3].
Что случилось с Gemini 3.5 Pro?
Она остаётся в тестировании у партнёров без объявленной даты, тогда как Google подтвердил, что предварительное обучение Gemini 4 уже идёт[1].
Насколько быстра Gemini 3.6 Flash?
Artificial Analysis ставит её первой по скорости вывода в своём классе на 303.6 токенов в секунду, но время до первого токена при высоком уровне мышления 11.54 секунды медленно для своего уровня[4]. Стримь всё, что человек смотрит.
Как вызывать Gemini 3.6 Flash с SDK OpenAI?
Направь клиент OpenAI на https://api.reapi.ai/v1 и установи model на gemini-3.6-flash, сохраняя точку в ID. Точка совместима с OpenAI, переписывание SDK не нужно.
Прочитать выпуск, который конкурирует на экономике единицы
Этот запуск стоит понимать как движение цены, а не способности. Google не выпустил Pro-уровень, не сделал рекламу фронтира, и вложил инженерию в два числа, которые решают, сколько стоит агент: цена за токен и токены за задачу. Оба упали примерно на 17%, и они перемножаются. Против этого таблица между вендорами показывает, что 3.6 Flash проигрывает кодированию агентов GPT-5.6 Luna и работе с данными Claude Sonnet 5 — что правильный компромисс для модели в этом диапазоне, а не дефект.
Практическая версия: делай циклы агента по умолчанию на ней, отправляй массовое извлечение ниже, держи кодирование фронтира на фронтирных моделях и меряй эффективную стоимость на завершённую задачу вместо цен за токен, потому что это единственное число, где прибыль эффективности токенов появляется. Вот как использовать Gemini 3.6 Flash без оплаты фронтирных цен за работу, которую она уже делает хорошо, и без ожидания, что она выиграет строки, которые она явно проигрывает.
References
- Google. Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber. Retrieved July 2026 from blog.google/technology/google-deepmind
- Google DeepMind. Gemini 3.6 Flash model card. Retrieved July 2026 from deepmind.google/models/gemini
- Google DeepMind. Introducing Gemini 3.5 Flash Cyber and CodeMender. Retrieved July 2026 from deepmind.google/discover/blog
- Artificial Analysis. Gemini 3.6 Flash — intelligence, performance, and price analysis. Retrieved July 2026 from artificialanalysis.ai/models
- OfficeChai. Gemini 3.6 Flash beats Gemini 3.5 Flash and Gemini 3.1 Pro on most benchmarks. Retrieved July 2026 from officechai.com
Further reading
- reAPI. How to use Claude Opus 5. reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. Gemini 3.6 Flash endpoint reference. reapi.ai/docs/gemini-3-6-flash
- reAPI. Model catalog. reapi.ai/models
Автор

Категории
Ещё статьи

Фильтры контента Seedream 5 Pro: что они блокируют
Seedream 5 Pro фильтрует контент в несколько слоёв, отказ редко указывает на слой. Что блокирует каждый слой и какие ограничения везде действуют.


Seedance 2.5 на Higgsfield? Доступность и альтернативы
Доступна ли Seedance 2.5 на Higgsfield? Проверьте текущий статус модели, что на самом деле предлагает платформа, ожидаемые цены и рабочие альтернативы.


Альтернативы Mammouth.ai в 2026: сравнение 5 сервисов
Ищете альтернативы Mammouth.ai в 2026 году? Сравниваем Poe, Perplexity, OpenRouter, HuggingChat и reAPI по моделям, возможностям и способу работы.
