
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: бенчмарки
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: все 18 бенчмарков из таблицы Google, лимиты вывода, цены и какую модель выбрать под каждую задачу.
Gemini 4 Argon лидирует в собственной таблице бенчмарков Google, но не везде. В таблице из 19 строк, которую Google опубликовала вместе с запуском 30 сентября 2026 года, среди Argon, GPT-6 Astra и Claude Opus 5.5 у Argon лучший результат в 13 строках, ничья в одной и пять проигрышей: три Astra и два Opus 5.5[1]. Проигрыши сосредоточены в работе в терминале, более сложных бенчмарках по разработке и управлении компьютером, а именно по ним многие разработчики и будут судить о модели.
В этом сравнении все числа из таблицы Google стоят рядом, к ним добавлены характеристики и цены, которые публикует каждый провайдер, и объяснены оговорки методологии Google. Поисковые запросы после запуска были о том же: "gemini 4 argon benchmarks", "gemini 4 argon performance relative to other models", "gemini 4 vs gpt 6 astra", "gemini 4 vs claude". Над всеми цифрами стоит одно практическое различие: Astra и Opus 5.5 общедоступны, а Argon нет[1].
Коротко
- В целом: из трёх моделей у Gemini 4 Argon лучший результат в 13 из 19 строк таблицы Google, у GPT-6 Astra в 3, у Claude Opus 5.5 в 2, одна ничья[1].
- Самые явные преимущества Argon: Harvey's Legal Agent Benchmark (19,6% против 5,4% и 3,8%), длинный контекст GraphWalks 256K–1M (84,2% против 71,8% и 66,8%) и длинные видео в LVBench (91,7%)[1].
- Где Argon отстаёт: Opus 5.5 лидирует в Terminal-bench 4.0 (66,4% против 57,4%) и PostTrainBench; Astra лидирует в FrontierSWE v2, Terminal-Bench Science и OSWorld-2.0[1].
- Вывод: Argon может вернуть 1M токенов в одном ответе. Astra и Opus 5.5 останавливаются на 128K в своих стандартных API[1][2][4].
- Цена за 1M токенов: Argon $2/$10 по вводному тарифу, затем $4/$20; Opus 5.5 $4/$20; Astra $10/$50[1][2][3].
Бенчмарки Gemini 4 Argon: полная таблица
Это числа из таблицы бенчмарков в анонсе Google. В таблице Google есть и Claude Fable 5.1, здесь она вынесена в отдельный столбец, чтобы у вопроса «а против Fable?» тоже был ответ. Лучший результат среди Argon, Astra и Opus 5.5 выделен жирным; прочерк означает, что Google не привела результат[1].
| Область | Бенчмарк | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 |
|---|---|---|---|---|---|
| Интеллектуальная работа | Vals Index | 68,9% | 63,1% | 67,0% | 65,8% |
| Интеллектуальная работа | AutomationBench | 51,3% | 41,4% | 42,5% | 31,4% |
| Интеллектуальная работа | Vals Finance Agent v2 | 65,4% | 53,5% | 58,6% | 58,9% |
| Интеллектуальная работа | Harvey's Legal Agent Benchmark | 19,6% | 5,4% | 3,8% | 6,7% |
| Агентное программирование | DeepSWE v1.1 | 77,9% | 74,1% | 74,2% | 67,4% |
| Агентное программирование | FrontierSWE v2 | 55,0% | 65,5% | 62,3% | 56,3% |
| Агентное программирование | Vibe Code Bench | 91,9% | 89,6% | 90,3% | 90,3% |
| Агентное программирование | Terminal-bench 4.0 | 57,4% | 58,2% | 66,4% | 57,9% |
| ML-инжиниринг | PostTrainBench | 45,3% | 44,3% | 49,3% | 40,2% |
| Наука и математика | Terminal-Bench Science 0.1 | 57,6% | 68,1% | 63,3% | 52,6% |
| Наука и математика | LABBench 2 | 88,8% | 85,4% | 73,1% | 68,6% |
| Наука и математика | RiemannBench | 76,0% | 72,0% | 69,6% | 65,6% |
| Длинный контекст | GraphWalks, до 128K | 99,7% | 98,7% | 90,6% | 91,4% |
| Длинный контекст | GraphWalks, от 256K до 1M | 84,2% | 71,8% | 66,8% | 65,0% |
| Управление компьютером | Agent's Last Exam | 39,5% | 34,2% | 38,2% | — |
| Управление компьютером | OSWorld-2.0 (офлайн-подмножество) | 69,2% | 72,6% | — | — |
| Мультимодальность | Chartography | 71,6% | 71,0% | 66,3% | 46,2% |
| Мультимодальность | LVBench | 91,7% | 87,5% | 83,7% | 79,7% |
| Кибербезопасность | CWE-bench v1 | 68,0% | 68,0% | 67,0% | 58,0% |
Если сравнивать только с Claude Opus 5.5, Gemini 4 Argon впереди в 14 из 18 строк, где есть результаты обеих моделей, и позади в четырёх: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench и Terminal-Bench Science[1].
Читайте таблицу вместе с методологией Google
Каждый результат в таблице взят из анонса Google, а на странице методологии Google объясняет, откуда взялось каждое число. Три детали меняют то, какой вес стоит придавать разрывам[5]:
- Большинство результатов конкурентов заявлены ими самими. Google пишет, что результаты моделей не Gemini «взяты из собственных данных провайдеров, если не указано иное», с максимальной доступной настройкой рассуждений каждого конкурента, где она указана.
- Часть результатов Argon Google посчитала сама. Результаты Argon в DeepSWE v1.1 и Terminal-bench 4.0 получены Google, а цифры Astra, Fable и Opus взяты из публичных лидербордов или system cards. Это обычная практика, но значит, что тестовая среда не всегда одинакова.
- Входные данные не всегда были равными. В LVBench Google использовала 1 кадр в секунду для Gemini, но 800 кадров для Astra, 600 для Opus 5.5 и 300 для Fable 5.1 «из-за ограничений API». Модели видели разный бюджет кадров, поэтому к разрыву на длинных видео стоит относиться осторожно.
Это не делает таблицу ошибочной. Но преимущество в 1 пункт, как в Vals Index или CWE-bench, на практике равно ничьей, а разрывы в 12–17 пунктов, как в Harvey's Legal Agent Benchmark или GraphWalks от 256K до 1M, — реальный сигнал.
Характеристики и цены рядом
Бенчмарки — только половина решения. Вот что каждый провайдер публикует о лимитах и цене.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | |
|---|---|---|---|
| Доступность | Только партнёры Fairwind Program; разработчики «как можно скорее»[1] | Общедоступна[2] | Общедоступна[4] |
| Контекстное окно | Не опубликовано | 1 050 000 токенов[2] | 1M токенов[4] |
| Максимальный вывод на ответ | 1M токенов[1] | 128 000 токенов[2] | 128K (300K через бету Batch API)[4] |
| Типы ввода | Текст, а также графики, документы и длинные видео, по данным Google[1] | Текст, изображения[2] | Текст, изображения[4] |
| Ввод / вывод за 1M токенов | $2 / $10 по вводному тарифу, затем $4 / $20[1] | $10 / $50, дороже выше 272K на входе[2] | $4 / $20[3] |
| Кэшированный ввод за 1M токенов | $0.10 в вводный период[1] | $1[2] | $0.20 при попадании в кэш[3] |
Цена за токен и цена за задачу — разные вещи; в разборе цены Gemini 4 Argon посчитаны четыре типа задач на всех трёх моделях.
Gemini 4 Argon vs GPT-6 Astra
Против Astra Argon выигрывает большинство строк по интеллектуальной работе и длинному контексту, а в юридических и финансовых агентных тестах с большим отрывом: 19,6% против 5,4% в бенчмарке Harvey и 65,4% против 53,5% в Vals Finance Agent v2[1]. Кроме того, в вводный период Argon стоит пятую часть прайса Astra, а после него две пятых[1][2].
Astra сильнее в управлении компьютером и более сложных бенчмарках по разработке. Она лидирует в OSWorld-2.0 (72,6% против 69,2%), FrontierSWE v2 (65,5% против 55,0%) и Terminal-Bench Science (68,1% против 57,6%)[1]. Разрывы в 10,5 пункта в FrontierSWE v2 и Terminal-Bench Science — самые крупные проигрыши Argon в его же таблице на запуске, поэтому командам, чья работа похожа на эти бенчмарки, стоит протестировать модель до перехода. Ещё Astra немного опережает Argon в Terminal-bench 4.0, 58,2% против 57,4%.
Gemini 4 Argon vs Claude Opus 5.5
Это самая близкая пара в программировании. Argon немного опережает Opus 5.5 в DeepSWE v1.1 (77,9% против 74,2%) и Vibe Code Bench (91,9% против 90,3%), а Opus 5.5 выигрывает Terminal-bench 4.0 на 9 пунктов (66,4% против 57,4%) и PostTrainBench на 4 (49,3% против 45,3%)[1]. Если ваши агенты живут в командной строке, Opus 5.5 хорошо держится против более новой модели.
За пределами программирования Argon уходит в отрыв. Разрыв в юридическом бенчмарке составляет 15,8 пункта, в длинном контексте GraphWalks от 256K до 1M — 17,4 пункта, в LABBench 2 — 15,7 пункта[1]. После окончания вводного периода Argon у обеих моделей одинаковый прайс, $4 и $20 за миллион токенов[1][3], так что выбор определяет работа, а не цена.
Какую модель выбрать под какую задачу
- Юридические и финансовые исследования, большие наборы документов, длинные видео: Gemini 4 Argon, когда он станет доступен. Здесь у него самые большие преимущества.
- Очень длинные ответы, например полные миграции или отчёты больше 128K токенов: Gemini 4 Argon — единственная из трёх моделей, которая справится в одном ответе.
- Агенты для программирования с упором на терминал: Claude Opus 5.5, которая заметно лидирует в Terminal-bench 4.0.
- Управление компьютером и самые сложные SWE-задачи: GPT-6 Astra, которая лидирует в OSWorld-2.0 и FrontierSWE v2.
- Всё, что нужно выпустить в этом месяце: Astra или Opus 5.5, потому что у Gemini 4 Argon пока нет публичного API[1].
На reAPI Claude Opus 5.5 и GPT-6 Astra уже работают через один API-ключ и один эндпоинт chat completions, поэтому вы можете прогнать одну и ту же оценку на обеих моделях уже сегодня и добавить Gemini 4 Argon, когда он появится. Доступность модели отслеживается на странице модели Gemini 4 Argon.
FAQ
Gemini 4 Argon лучше GPT-6 Astra?
По большей части таблицы Google да: у Argon выше результат в 14 из 19 строк против Astra, одна ничья. Astra лидирует в FrontierSWE v2, Terminal-Bench Science, OSWorld-2.0 и с минимальным отрывом в Terminal-bench 4.0[1].
Gemini 4 Argon лучше Claude Opus 5.5?
В 14 из 18 сопоставимых строк таблицы Google. Opus 5.5 лидирует в Terminal-bench 4.0, PostTrainBench, FrontierSWE v2 и Terminal-Bench Science[1].
Как Gemini 4 Argon выглядит против Claude Fable 5.1?
Argon набирает больше Fable 5.1 в 15 из 17 строк, где Google приводит результаты обеих моделей. Fable 5.1 немного впереди в FrontierSWE v2 (56,3% против 55,0%) и Terminal-bench 4.0 (57,9% против 57,4%)[1].
Какой лучший результат у Gemini 4 Argon в бенчмарках?
GraphWalks до 128K с 99,7%. Самые значимые победы — с большим отрывом: Harvey's Legal Agent Benchmark с 19,6% против 5,4% у Astra и 3,8% у Opus 5.5 и GraphWalks от 256K до 1M с 84,2%[1].
Это независимые результаты бенчмарков?
Не полностью. Они взяты из анонса Google; Google пишет, что большинство результатов конкурентов предоставлены самими провайдерами, а часть тестов Argon компания провела сама[5].
Что дешевле: Gemini 4 Argon, GPT-6 Astra или Claude Opus 5.5?
Gemini 4 Argon по вводному тарифу $2/$10. После него у Argon и Opus 5.5 прайс $4/$20, а у Astra $10/$50 за 1M токенов[1][2][3].
Как выбрать между Argon, Astra и Opus 5.5
Таблица Google убедительно показывает Gemini 4 Argon как лучшую универсальную модель из трёх: с самыми большими преимуществами в юридических задачах, финансах, длинном контексте и длинных видео и с выводом 1M токенов, которого нет ни у кого больше. Она же показывает, где аргументы слабее всего: агенты для терминала и управления компьютером, где Opus 5.5 и Astra по-прежнему выигрывают.
Две оговорки не дают считать это окончательным вердиктом. Результаты опубликовал разработчик модели, которая выигрывает большинство из них, и Argon — единственная модель в сравнении, которую пока нельзя вызвать. Стройте оценку на Astra и Opus 5.5 сейчас и прогоните её заново, когда Gemini 4 Argon откроется для разработчиков.
Источники
- Google. Gemini 4 Argon: our next era of frontier intelligence (including benchmark table). Получено в октябре 2026 г. с blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon
- OpenAI. GPT-6 Astra model page. Получено в октябре 2026 г. с developers.openai.com/api/docs/models/gpt-6-astra
- Anthropic. Pricing. Получено в октябре 2026 г. с platform.claude.com/docs/en/about-claude/pricing
- Anthropic. Models overview. Получено в октябре 2026 г. с platform.claude.com/docs/en/about-claude/models/overview
- Google DeepMind. Gemini 4 Argon model evaluation: approach, methodology and results. Получено в октябре 2026 г. с deepmind.google/models/evals-methodology/gemini-4-argon
Автор

Категории
Ещё статьи

Какой длины видео Seedance? 2.0 — 15 секунд, 2.5 — 30
Seedance 2.0 генерирует 4–15 секунд за запрос, Seedance 2.5 — 4–30 секунд. Разбираем настройку длины, актуальную стоимость и соединение сцен.


Сравнение DeepSeek Harness, OpenCode и Claude Code
Сравниваем DeepSeek Harness, OpenCode и Claude Code по контролю среды выполнения, выбору моделей, плагинам, доступу, установке и стоимости агентов.


API музыкального видео: полные песни, фото и субтитры
Преобразуйте MP3 длительностью 10–300 секунд и 1–7 референс-фотографий в полноценный клип с примерами API, опциями субтитров и таблицами точных расходов.
