GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: бенчмарки
2026/10/01

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: бенчмарки

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: все 18 бенчмарков из таблицы Google, лимиты вывода, цены и какую модель выбрать под каждую задачу.

Gemini 4 Argon лидирует в собственной таблице бенчмарков Google, но не везде. В таблице из 19 строк, которую Google опубликовала вместе с запуском 30 сентября 2026 года, среди Argon, GPT-6 Astra и Claude Opus 5.5 у Argon лучший результат в 13 строках, ничья в одной и пять проигрышей: три Astra и два Opus 5.5[1]. Проигрыши сосредоточены в работе в терминале, более сложных бенчмарках по разработке и управлении компьютером, а именно по ним многие разработчики и будут судить о модели.

В этом сравнении все числа из таблицы Google стоят рядом, к ним добавлены характеристики и цены, которые публикует каждый провайдер, и объяснены оговорки методологии Google. Поисковые запросы после запуска были о том же: "gemini 4 argon benchmarks", "gemini 4 argon performance relative to other models", "gemini 4 vs gpt 6 astra", "gemini 4 vs claude". Над всеми цифрами стоит одно практическое различие: Astra и Opus 5.5 общедоступны, а Argon нет[1].

Коротко

  • В целом: из трёх моделей у Gemini 4 Argon лучший результат в 13 из 19 строк таблицы Google, у GPT-6 Astra в 3, у Claude Opus 5.5 в 2, одна ничья[1].
  • Самые явные преимущества Argon: Harvey's Legal Agent Benchmark (19,6% против 5,4% и 3,8%), длинный контекст GraphWalks 256K–1M (84,2% против 71,8% и 66,8%) и длинные видео в LVBench (91,7%)[1].
  • Где Argon отстаёт: Opus 5.5 лидирует в Terminal-bench 4.0 (66,4% против 57,4%) и PostTrainBench; Astra лидирует в FrontierSWE v2, Terminal-Bench Science и OSWorld-2.0[1].
  • Вывод: Argon может вернуть 1M токенов в одном ответе. Astra и Opus 5.5 останавливаются на 128K в своих стандартных API[1][2][4].
  • Цена за 1M токенов: Argon $2/$10 по вводному тарифу, затем $4/$20; Opus 5.5 $4/$20; Astra $10/$50[1][2][3].

Бенчмарки Gemini 4 Argon: полная таблица

Это числа из таблицы бенчмарков в анонсе Google. В таблице Google есть и Claude Fable 5.1, здесь она вынесена в отдельный столбец, чтобы у вопроса «а против Fable?» тоже был ответ. Лучший результат среди Argon, Astra и Opus 5.5 выделен жирным; прочерк означает, что Google не привела результат[1].

ОбластьБенчмаркGemini 4 ArgonGPT-6 AstraClaude Opus 5.5Claude Fable 5.1
Интеллектуальная работаVals Index68,9%63,1%67,0%65,8%
Интеллектуальная работаAutomationBench51,3%41,4%42,5%31,4%
Интеллектуальная работаVals Finance Agent v265,4%53,5%58,6%58,9%
Интеллектуальная работаHarvey's Legal Agent Benchmark19,6%5,4%3,8%6,7%
Агентное программированиеDeepSWE v1.177,9%74,1%74,2%67,4%
Агентное программированиеFrontierSWE v255,0%65,5%62,3%56,3%
Агентное программированиеVibe Code Bench91,9%89,6%90,3%90,3%
Агентное программированиеTerminal-bench 4.057,4%58,2%66,4%57,9%
ML-инжинирингPostTrainBench45,3%44,3%49,3%40,2%
Наука и математикаTerminal-Bench Science 0.157,6%68,1%63,3%52,6%
Наука и математикаLABBench 288,8%85,4%73,1%68,6%
Наука и математикаRiemannBench76,0%72,0%69,6%65,6%
Длинный контекстGraphWalks, до 128K99,7%98,7%90,6%91,4%
Длинный контекстGraphWalks, от 256K до 1M84,2%71,8%66,8%65,0%
Управление компьютеромAgent's Last Exam39,5%34,2%38,2%—
Управление компьютеромOSWorld-2.0 (офлайн-подмножество)69,2%72,6%——
МультимодальностьChartography71,6%71,0%66,3%46,2%
МультимодальностьLVBench91,7%87,5%83,7%79,7%
КибербезопасностьCWE-bench v168,0%68,0%67,0%58,0%

Если сравнивать только с Claude Opus 5.5, Gemini 4 Argon впереди в 14 из 18 строк, где есть результаты обеих моделей, и позади в четырёх: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench и Terminal-Bench Science[1].

Читайте таблицу вместе с методологией Google

Каждый результат в таблице взят из анонса Google, а на странице методологии Google объясняет, откуда взялось каждое число. Три детали меняют то, какой вес стоит придавать разрывам[5]:

  1. Большинство результатов конкурентов заявлены ими самими. Google пишет, что результаты моделей не Gemini «взяты из собственных данных провайдеров, если не указано иное», с максимальной доступной настройкой рассуждений каждого конкурента, где она указана.
  2. Часть результатов Argon Google посчитала сама. Результаты Argon в DeepSWE v1.1 и Terminal-bench 4.0 получены Google, а цифры Astra, Fable и Opus взяты из публичных лидербордов или system cards. Это обычная практика, но значит, что тестовая среда не всегда одинакова.
  3. Входные данные не всегда были равными. В LVBench Google использовала 1 кадр в секунду для Gemini, но 800 кадров для Astra, 600 для Opus 5.5 и 300 для Fable 5.1 «из-за ограничений API». Модели видели разный бюджет кадров, поэтому к разрыву на длинных видео стоит относиться осторожно.

Это не делает таблицу ошибочной. Но преимущество в 1 пункт, как в Vals Index или CWE-bench, на практике равно ничьей, а разрывы в 12–17 пунктов, как в Harvey's Legal Agent Benchmark или GraphWalks от 256K до 1M, — реальный сигнал.

Характеристики и цены рядом

Бенчмарки — только половина решения. Вот что каждый провайдер публикует о лимитах и цене.

Gemini 4 ArgonGPT-6 AstraClaude Opus 5.5
ДоступностьТолько партнёры Fairwind Program; разработчики «как можно скорее»[1]Общедоступна[2]Общедоступна[4]
Контекстное окноНе опубликовано1 050 000 токенов[2]1M токенов[4]
Максимальный вывод на ответ1M токенов[1]128 000 токенов[2]128K (300K через бету Batch API)[4]
Типы вводаТекст, а также графики, документы и длинные видео, по данным Google[1]Текст, изображения[2]Текст, изображения[4]
Ввод / вывод за 1M токенов$2 / $10 по вводному тарифу, затем $4 / $20[1]$10 / $50, дороже выше 272K на входе[2]$4 / $20[3]
Кэшированный ввод за 1M токенов$0.10 в вводный период[1]$1[2]$0.20 при попадании в кэш[3]

Цена за токен и цена за задачу — разные вещи; в разборе цены Gemini 4 Argon посчитаны четыре типа задач на всех трёх моделях.

Gemini 4 Argon vs GPT-6 Astra

Против Astra Argon выигрывает большинство строк по интеллектуальной работе и длинному контексту, а в юридических и финансовых агентных тестах с большим отрывом: 19,6% против 5,4% в бенчмарке Harvey и 65,4% против 53,5% в Vals Finance Agent v2[1]. Кроме того, в вводный период Argon стоит пятую часть прайса Astra, а после него две пятых[1][2].

Astra сильнее в управлении компьютером и более сложных бенчмарках по разработке. Она лидирует в OSWorld-2.0 (72,6% против 69,2%), FrontierSWE v2 (65,5% против 55,0%) и Terminal-Bench Science (68,1% против 57,6%)[1]. Разрывы в 10,5 пункта в FrontierSWE v2 и Terminal-Bench Science — самые крупные проигрыши Argon в его же таблице на запуске, поэтому командам, чья работа похожа на эти бенчмарки, стоит протестировать модель до перехода. Ещё Astra немного опережает Argon в Terminal-bench 4.0, 58,2% против 57,4%.

Gemini 4 Argon vs Claude Opus 5.5

Это самая близкая пара в программировании. Argon немного опережает Opus 5.5 в DeepSWE v1.1 (77,9% против 74,2%) и Vibe Code Bench (91,9% против 90,3%), а Opus 5.5 выигрывает Terminal-bench 4.0 на 9 пунктов (66,4% против 57,4%) и PostTrainBench на 4 (49,3% против 45,3%)[1]. Если ваши агенты живут в командной строке, Opus 5.5 хорошо держится против более новой модели.

За пределами программирования Argon уходит в отрыв. Разрыв в юридическом бенчмарке составляет 15,8 пункта, в длинном контексте GraphWalks от 256K до 1M — 17,4 пункта, в LABBench 2 — 15,7 пункта[1]. После окончания вводного периода Argon у обеих моделей одинаковый прайс, $4 и $20 за миллион токенов[1][3], так что выбор определяет работа, а не цена.

Какую модель выбрать под какую задачу

  • Юридические и финансовые исследования, большие наборы документов, длинные видео: Gemini 4 Argon, когда он станет доступен. Здесь у него самые большие преимущества.
  • Очень длинные ответы, например полные миграции или отчёты больше 128K токенов: Gemini 4 Argon — единственная из трёх моделей, которая справится в одном ответе.
  • Агенты для программирования с упором на терминал: Claude Opus 5.5, которая заметно лидирует в Terminal-bench 4.0.
  • Управление компьютером и самые сложные SWE-задачи: GPT-6 Astra, которая лидирует в OSWorld-2.0 и FrontierSWE v2.
  • Всё, что нужно выпустить в этом месяце: Astra или Opus 5.5, потому что у Gemini 4 Argon пока нет публичного API[1].

На reAPI Claude Opus 5.5 и GPT-6 Astra уже работают через один API-ключ и один эндпоинт chat completions, поэтому вы можете прогнать одну и ту же оценку на обеих моделях уже сегодня и добавить Gemini 4 Argon, когда он появится. Доступность модели отслеживается на странице модели Gemini 4 Argon.

FAQ

Gemini 4 Argon лучше GPT-6 Astra?

По большей части таблицы Google да: у Argon выше результат в 14 из 19 строк против Astra, одна ничья. Astra лидирует в FrontierSWE v2, Terminal-Bench Science, OSWorld-2.0 и с минимальным отрывом в Terminal-bench 4.0[1].

Gemini 4 Argon лучше Claude Opus 5.5?

В 14 из 18 сопоставимых строк таблицы Google. Opus 5.5 лидирует в Terminal-bench 4.0, PostTrainBench, FrontierSWE v2 и Terminal-Bench Science[1].

Как Gemini 4 Argon выглядит против Claude Fable 5.1?

Argon набирает больше Fable 5.1 в 15 из 17 строк, где Google приводит результаты обеих моделей. Fable 5.1 немного впереди в FrontierSWE v2 (56,3% против 55,0%) и Terminal-bench 4.0 (57,9% против 57,4%)[1].

Какой лучший результат у Gemini 4 Argon в бенчмарках?

GraphWalks до 128K с 99,7%. Самые значимые победы — с большим отрывом: Harvey's Legal Agent Benchmark с 19,6% против 5,4% у Astra и 3,8% у Opus 5.5 и GraphWalks от 256K до 1M с 84,2%[1].

Это независимые результаты бенчмарков?

Не полностью. Они взяты из анонса Google; Google пишет, что большинство результатов конкурентов предоставлены самими провайдерами, а часть тестов Argon компания провела сама[5].

Что дешевле: Gemini 4 Argon, GPT-6 Astra или Claude Opus 5.5?

Gemini 4 Argon по вводному тарифу $2/$10. После него у Argon и Opus 5.5 прайс $4/$20, а у Astra $10/$50 за 1M токенов[1][2][3].

Как выбрать между Argon, Astra и Opus 5.5

Таблица Google убедительно показывает Gemini 4 Argon как лучшую универсальную модель из трёх: с самыми большими преимуществами в юридических задачах, финансах, длинном контексте и длинных видео и с выводом 1M токенов, которого нет ни у кого больше. Она же показывает, где аргументы слабее всего: агенты для терминала и управления компьютером, где Opus 5.5 и Astra по-прежнему выигрывают.

Две оговорки не дают считать это окончательным вердиктом. Результаты опубликовал разработчик модели, которая выигрывает большинство из них, и Argon — единственная модель в сравнении, которую пока нельзя вызвать. Стройте оценку на Astra и Opus 5.5 сейчас и прогоните её заново, когда Gemini 4 Argon откроется для разработчиков.

Источники

  1. Google. Gemini 4 Argon: our next era of frontier intelligence (including benchmark table). Получено в октябре 2026 г. с blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon
  2. OpenAI. GPT-6 Astra model page. Получено в октябре 2026 г. с developers.openai.com/api/docs/models/gpt-6-astra
  3. Anthropic. Pricing. Получено в октябре 2026 г. с platform.claude.com/docs/en/about-claude/pricing
  4. Anthropic. Models overview. Получено в октябре 2026 г. с platform.claude.com/docs/en/about-claude/models/overview
  5. Google DeepMind. Gemini 4 Argon model evaluation: approach, methodology and results. Получено в октябре 2026 г. с deepmind.google/models/evals-methodology/gemini-4-argon