
Claude Opus 5: бенчмарки, производительность и цена
Как использовать Claude Opus 5: полная таблица бенчмарков, система уровней обработки, два критических изменения API, пошаговая миграция и оптимизация затрат.
Компания Anthropic запустила Claude Opus 5 24 июля 2026 года, описав её как значительный прорыв в сравнении с Claude Opus 4.8[6]. Цена на модель остаётся абсолютно той же: $5 за миллион входящих токенов и $25 за миллион исходящих[3]. Поэтому вопрос о том, как эффективно использовать Claude Opus 5, практически не связан с листинговой ценой, которая не изменилась, а в основном сводится к одному параметру, который большинство команд никогда не трогают.
Этот параметр — effort (уровень обработки). Вместо публикации одного числа для каждого бенчмарка, Anthropic опубликовала кривые производительности по сравнению с затратами на всех пяти уровнях обработки[1]. Разброс между самым дешёвым и самым дорогим уровнем этих кривых шире, чем любое улучшение переписывания промпта, и официальная рекомендация — протестировать всю лестницу на своих тестах, а не просто повышать всё до максимума[2].
Краткое резюме
- Та же листинговая цена, но другая модель. $5 / $25 за миллион токенов, без изменений по сравнению с Opus 4.8[2]. На reAPI эта же модель работает по $2.40 / $12.00, что составляет 48% от опубликованной Anthropic цены.
- Thinking включён по умолчанию. На Opus 4.8 при отсутствии поля
thinkingмодель не использовала процесс размышления. На Opus 5 такой же запрос активирует размышление[2]. Так какmax_tokensограничивает как процесс размышления, так и текст ответа вместе, ограничиваемые бюджеты могут привести к усечению. - Отключение thinking ограничено уровнем
high. Если отправитьthinking: {"type": "disabled"}сxhighилиmax, то вернётся ошибка 400, проверка выполняется для каждого запроса[2]. - Opus 5 не побеждает везде. В таблице самой Anthropic модель проигрывает в агентном программировании на DeepSWE v1.1 компании GPT-5.6 Sol: 68.8% против 72.7%[1].
- Не наследуйте настройки effort. Anthropic говорит, что
lowиmediumтеперь дают отличное качество при значительно меньшем количестве токенов и задержке, и рекомендует начинать с используемого по умолчаниюhighи двигаться в обе стороны на основе своих тестов[2]. - Priority Tier на неё не распространяется, и она находится в отдельном bucket ограничений частоты запросов, а не в общем пуле Opus[5][4].
Что такое Claude Opus 5
Anthropic позиционирует Claude Opus 5 для сложной агентной разработки и корпоративной работы[2]. Идентификатор API — claude-opus-5, без суффикса даты.
| Свойство | Claude Opus 5 |
|---|---|
| ID модели в API | claude-opus-5 |
| Размер контекста | 1 млн токенов, как по умолчанию, так и максимум |
| Макс выход | 128k токенов |
| Листинговая цена | $5 / $25 за миллион входящих / исходящих токенов |
| Быстрый режим | $10 / $50, только API Claude |
| Thinking | Включён по умолчанию, адаптивный |
| Уровни обработки | low, medium, high, xhigh, max, по умолчанию high |
| Минимум кэша промпта | 512 токенов, вместо 1024 |
Нет варианта с меньшим размером контекста[2]. Окно в 1 млн токенов — это всё, что вы получаете. За пределами Claude API модель доступна на Amazon Bedrock как anthropic.claude-opus-5, на Google Cloud как claude-opus-5 и на Microsoft Foundry[2]. Быстрый режим — исключение: он работает только на Claude API, а не на трёх облачных платформах[2].
Полная официальная таблица бенчмарков

Это опубликованное Anthropic сравнение, полностью переписанное, включая строки, где Opus 5 не побеждает[1]. Где в колонке Fable 5 указано другое имя модели, это собственная аннотация Anthropic.
| Бенчмарк | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Агентное терминальное программирование (Frontier-Bench v0.1) | 43.3% | 33.7% | 21.1% | 34.4% |
| Работа со знаниями (GDPval-AA v2, Elo) | 1861 | 1747 | 1593 | 1736 |
| Решение новых задач (ARC-AGI-3) | 30.2% | — | 1.5% | 7.8% |
| Агентный поиск (BrowseComp) | 90.8% | 87.4% | 84.3% | 90.4% |
| Мультидисциплинарное рассуждение (HLE, без инструментов) | 56.3% | 56.5% | 49.8% | — |
| Мультидисциплинарное рассуждение (HLE, с инструментами) | 64.7% | 63.9% | 57.9% | — |
| Использование компьютера (OSWorld 2.0) | 70.6% | 66.1% | 55.7% | 62.6% |
| Агентное программирование (DeepSWE v1.1) | 68.8% | 69.7% | 59.0% | 72.7% |
| Агентное программирование (FrontierCode v1.1, Main) | 53.4% | 53.5% | 46.5% | 47.5% |
| Бизнес-процессы (AutomationBench) | 26.0% | 17.4% | 17.0% | 18.1% |
| Юридический (Legal Agent Benchmark, held-out) | 11.7% | 13.3% | 10.4% | 2.5% |
| Здравоохранение (HealthBench Professional) | 59.8% | 66.0% (Mythos 5) | 57.4% | 60.5% |
| Биология (BioMysteryBench, hard) | 49.4% | 46.5% | 42.4% | — |
| Биология (BioMysteryBench, human-solved) | 90.1% | 89.0% (Mythos 5) | 88.5% | — |
Одна методологическая заметка перед тем, как кто-то будет цитировать эти числа. В сопроводительной таблице, которая разбирает Frontier-Bench по уровням обработки, Anthropic указывает, что результаты получены из внутреннего прогона на harness mini-SWE-agent с бэкендом GKE, усредняя результат на пять попыток за задачу, и что Opus 4.8 использовался как fallback, когда классификаторы безопасности отклоняли запрос от Opus 5 или Fable 5[1]. Это оценки, проведённые самим поставщиком. Воспринимайте их как сигнал направления, а не как независимую проверку.
Где она побеждает и где проигрывает
Opus 5 берёт девять из четырнадцати строк. Разница в победах неуловима. Frontier-Bench прыгает с 21.1% на Opus 4.8 на 43.3%, чуть более чем в два раза. ARC-AGI-3 прыгает с 1.5% на 30.2%, и ближайший конкурент в этой строке — GPT-5.6 Sol с 7.8%. AutomationBench находится на уровне 26.0% против кластера 17-18%[1].
Она проигрывает остальные пять, и они более полезны для выбора модели, чем победы.
- DeepSWE v1.1, агентное программирование: 68.8% против 72.7% GPT-5.6 Sol. Это самый явный проигрыш на доске, и он падает на нагрузку, для которой Opus 5 продаётся. Anthropic оставила эту строку.
- HealthBench Professional: 59.8%, позади Mythos 5 с 66.0% и GPT-5.6 Sol с 60.5%.
- Legal Agent Benchmark: 11.7% против 13.3% Fable 5. Оба числа достаточно низкие, чтобы бенчмарк в основном измерял расстояние от цели.
- HLE без инструментов (56.3% против 56.5%) и FrontierCode Main (53.4% против 53.5%) находятся в пределах погрешности, но они исключают утверждение, что Opus 5 доминирует над Fable 5 везде.
Закономерность: Opus 5 побеждает там, где задача длительная, использует инструменты и требует сохранения состояния на протяжении многих шагов. Она равна или проигрывает на сложных одиночных вопросах.
Лестница уровней определяет ваш счёт
Anthropic опубликовала полную лестницу производительности по сравнению с затратами, а не одно число для каждого бенчмарка, и чтение этого меняет то, как вы настраиваете модель[1].

Из этого следуют три вещи.
Верхний уровень — не рекомендуемая начальная точка. Инструкция Anthropic — начать со стандартного high и настраивать в любом направлении на основе своих тестов: снизиться вниз, если качество держится, чтобы сохранить токены и задержку, подняться вверх для самой требовательной работы[2]. Обратите внимание на то, с чего начинается это предложение. Рекомендуемая точка входа — середина лестницы, а не её верх, и effort теперь имеет большую важность, потому что Opus 5 конвертирует дополнительный effort в лучшие результаты более надёжно, чем любая ранняя модель Opus[2].
Low и medium сильнее, чем раньше. Anthropic явно указывает на эффективность при более низком effort, говоря, что low и medium дают отличное качество при небольшой доле токенов и задержки более высоких настроек[2]. Наследуемые из Opus 4.8 настройки effort — неправильная начальная точка.
Effort — это рычаг затрат, а не промпт. Официальная рекомендация — начать со стандартного high, затем двигаться в любом направлении на основе своих тестов: снизиться вниз, если качество держится, чтобы сохранить токены и задержку, подняться вверх для самой требовательной работы[2]. На xhigh или max установите большой max_tokens, чтобы модель имела место для размышления и действий по подагентам и вызовам инструментов[2].
Два критических изменения под капотом
Поверхность запроса в основном унаследована от Opus 4.8. Параметры sampling всё ещё отклоняются, фиксированные бюджеты thinking всё ещё отклоняются, и prefill последнего хода assistant всё ещё выходит из строя. Два вещи действительно изменились, и обе нарушают код, перенесённый без изменений.
Thinking запускается, когда вы опускаете параметр. На Opus 4.8 запрос без поля thinking выполнялся без thinking. На Opus 5 тот же запрос думает, с моделью решая когда и сколько на каждом ходу[2]. Значение провода не изменилось; thinking: {"type": "adaptive"} всё ещё действительно и эквивалентно стандартному. То, что изменилось, это то, что происходит, когда вы ничего не говорите. Так как max_tokens — жёсткий лимит на thinking плюс текст ответа вместе, Anthropic говорит вам пересмотреть это для любой нагрузки, которая ранее работала без thinking[2]. Бюджет, настроенный только для видимого выхода, теперь будет усечен середине ответа.
Отключение thinking требует effort high или ниже. thinking: {"type": "disabled"} в сочетании с xhigh или max возвращает 400. Проверка выполняется на каждом запросе, поэтому сеанс, который был успешным на high, начинает выходить из строя в тот момент, когда более поздний вызов повышает effort, пока thinking всё ещё отключён[2].
Anthropic также документирует, что идёт не так с отключённым thinking: модель может записать вызов инструмента в свой текстовый выход вместо выпуска блока tool_use, или утечку внутренних XML-тегов в видимый ответ[2]. Первый режим отказа — опасный в цикле агента, потому что ход заканчивается чисто и вызов никогда не выполняется. Официальная рекомендация — держать thinking включённым и контролировать затраты с более низким уровнем effort.
Три дополнения стоят того, чтобы знать о них:
- Изменения инструментов в середине разговора (заголовок beta
mid-conversation-tool-changes-2026-07-01) позволяют добавлять или удалять инструменты между ходами, сохраняя кэш промпта, вместо того чтобы закреплять список инструментов на время сеанса[2]. - Режим fallback
"default"(заголовок betaserver-side-fallback-2026-07-01) применяет рекомендуемые Anthropic fallback модели по категории отказа, вместо списка, который вы ведёте[2]. - Минимум кэша промпта упал на 512 токенов с 1024, поэтому промпты, ранее слишком короткие для кэширования, теперь создают записи кэша без изменений кода[2].
Что на самом деле движет счётом
Вот полная официальная карта тарифов[3]:
| Позиция | Цена за млн токенов |
|---|---|
| Входящие | $5 |
| Исходящие | $25 |
| Попадания кэша и обновления | $0.50 |
| Запись кэша (5-минутная) | $6.25 |
| Запись кэша (1-часовая) | $10 |
| Batch входящие | $2.50 |
| Batch исходящие | $12.50 |
| Быстрый режим входящие | $10 |
| Быстрый режим исходящие | $50 |
Batch API работает по половине стандартной цены на обе стороны, а быстрый режим удваивает обе[3]. Anthropic описывает Opus 5 как доставляющую frontier-уровневую интеллектуальность по половине цены Claude Fable 5[2], что соответствует карте тарифов: Fable 5 указана по $10 / $50[3].
Три рычага имеют большее значение, чем цена за токен.
Effort. Опубликованный разброс cost-per-attempt на всей лестнице достаточно широк, что перемещение одного маршрута с xhigh вниз на medium сохраняет больше, чем любое переписывание промпта[1].
Многословие. Anthropic указывает, что стандартные ответы и письменные deliverables работают длиннее на Opus 5[2]. Токены thinking считаются выходом, как и дополнительная проза. Снижение effort снижает thinking, но не надёжно сокращает видимый выход, поэтому напишите явную инструкцию по краткости.
Verification scaffolding, которые вы теперь можете удалить. Opus 5 проверяет свою работу без указания, и Anthropic говорит, что инструкции, перенесённые из более ранних моделей, например "включить финальный этап проверки" или "использовать подагента для проверки", вызывают избыточную проверку[2]. Удаление их снижает расходы токенов без компромисса качества, что редкий вид оптимизации.
Ограничения частоты запросов и Priority Tier
Два оперативных факта, которые ловят команды во время развёртывания.
Priority Tier не охватывает Claude Opus 5. Документация по service-tier Anthropic указывает, что Priority Tier поддерживается на всех доступных моделях Claude, кроме Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 и Claude Sonnet 5[5]. Если ваше планирование ёмкости предполагало охват Priority Tier, это не применяется здесь.
Opus 5 также имеет свой собственный bucket ограничения частоты. Объединённое ограничение Opus применяется к трафику между Opus 4.8, 4.7, 4.6 и 4.5; Opus 5 не является частью этого пула[4]. Это хорошая новость во время миграции, так как трафик Opus 5 не съедает бюджет, который ваши существующие маршруты Opus 4.8 зависит. Быстрый режим имеет выделенные ограничения снова отдельно от стандартных ограничений Opus и возвращает 429 с заголовком retry-after при превышении[4].
Как использовать Claude Opus 5: контрольный список миграции
Рекомендации Anthropic по миграции сводятся к изменению строки модели и проверке двух поведенческих изменений[2]. На практике список немного длиннее.
- Измените строку модели на
claude-opus-5. - Проверьте каждый маршрут, который отключает thinking. Либо держите thinking отключённым и опустите effort на
highили ниже, либо держите уровень effort и удалите полеthinking. - Повысьте
max_tokensна маршрутах, которые никогда не устанавливали полеthinking. Они теперь думают, и бюджет охватывает оба. - Повторно запустите sweep effort на ваших собственных тестах. Начните со стандартного
highи двигайтесь в обе стороны, вместо того чтобы наследовать настройки Opus 4.8. - Удалите инструкции по проверке из промптов и этапы проверки из harnesses.
- Добавьте явную инструкцию по краткости к маршрутам, обращённым к пользователям.
- Перепроверьте короткие промпты, которые вы написали как не кэшируемые, против нового минимума 512 токенов.
- Обрабатывайте отказы как ответы, а не ошибки. Классификаторы безопасности могут отклонить запрос и вернуть причину остановки вместо ошибки HTTP, поэтому код, который безусловно читает первый блок контента, выйдет из строя.
Вызов Claude Opus 5 вместе с вашими другими моделями
Всё выше указывает на ту же оперативную проблему. Эта модель имеет пять уровней effort, свой bucket ограничения частоты, нет Priority Tier и таблицу бенчмарков, где она проигрывает агентному программированию GPT-5.6 Sol и здравоохранению Mythos 5. Правильная конфигурация — это не одна настройка. Это решение маршрутизации на нагрузку, и оно меняется каждый раз, когда поставщик отправляет что-то новое.
Это слой, который стоит строить намеренно. Проход проверки кода и массовая извлекательная работа не должны работать на одном effort, и маршрут, который Opus 5 проигрывает, не должны оставаться на Opus 5 по привычке. Обработка этого одним SDK клиентом на поставщика, одним ключом на поставщика и одной биллинг-поверхностью на поставщика — вот где накапливаются затраты многомодельной работы.
reAPI раскрывает Claude Opus 5 через OpenAI-совместимую конечную точку /v1/chat/completions, поэтому клиент, который вы уже используете для GPT и Gemini вызовов, его вызывает:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)Тарифы на шлюзе составляют $2.40 за миллион входящих токенов и $12.00 за миллион исходящих, что составляет 48% от опубликованной Anthropic $5 / $25. Полная поверхность запроса, включая output_config.effort и правила thinking выше, задокументирована на странице reapi.ai/docs/claude-opus-5, и текущие тарифы находятся на reapi.ai/models/claude-opus-5.
Ничего из этого не снимает решение маршрутизации. Это снимает налог на интеграцию при его принятии.
FAQ
Лучше ли Claude Opus 5, чем Claude Fable 5?
В девяти из четырнадцати строк в опубликованной таблице Anthropic — да, и по половине цены Fable 5[3]. Но Fable 5 всё ещё берёт HLE без инструментов, FrontierCode Main и Legal Agent Benchmark, и строка HealthBench Professional идёт на Mythos 5[1].
Claude Opus 5 стоит дороже, чем Opus 4.8?
Нет. Обе указаны по $5 за миллион входящих токенов и $25 за миллион исходящих[3]. Anthropic отправила скачок способности без изменения цены[2].
Какое самое большое критическое изменение от Opus 4.8?
Thinking включён по умолчанию. Запрос, который опустил поле thinking, работал без thinking на Opus 4.8 и думает на Opus 5, что меняет как затраты, так и поведение max_tokens. Второе — что thinking: {"type": "disabled"} теперь возвращает 400 на effort xhigh или max[2].
Какой уровень effort мне следует использовать?
Начните со стандартного high, затем sweep в обе стороны на основе своих тестов[2]. Anthropic показывает max как топ-уровень для самого глубокого возможного рассуждения, а не как лучший стандарт, и отдельно отмечает, что low и medium держат на этой модели при небольшой доле токенов и задержки[2].
Какое окно контекста Claude Opus 5?
1 млн токенов, что является как стандартом, так и максимумом. Нет варианта с меньшим контекстом. Максимальный выход — 128k токенов[2].
Охватывается ли Claude Opus 5 Priority Tier?
Нет. Priority Tier охватывает все доступные модели Claude, кроме Mythos 5, Mythos Preview, Opus 5 и Sonnet 5[5]. Opus 5 также находится в собственном bucket ограничения частоты, вместо объединённого пула Opus 4.x[4].
Могу ли я всё ещё отключить thinking?
Да, на effort high или ниже. Anthropic рекомендует против этого, документируя, что модель может написать вызовы инструмента в видимый текст или утечку внутренних тегов при отключённом thinking, и рекомендует вместо этого снизить effort[2].
Как мне вызвать Claude Opus 5 с OpenAI SDK?
Направьте OpenAI клиент на https://api.reapi.ai/v1, установите model на claude-opus-5 и отправьте обычный chat запрос. Конечная точка OpenAI-совместима, поэтому переписывание SDK не требуется.
Выбор уровня effort и переход дальше
Интересное в этом выпуске то, что страница цены — наименее информативная часть. Листинговая цена не изменилась, поэтому весь дельта находится в поведении: thinking по умолчанию, 400, которые не существовали раньше, пол кэша, сокращённый вдвое, и лестница effort, рекомендуемая точка входа которой — средний рунг, а не верхний. Anthropic также опубликовала пять строк бенчмарков, где его новый флагман проигрывает, что стоит больше, чем девять, где он побеждает.
Если вы мигрируете, работа маленькая и конкретная. Измените строку модели, проверьте маршруты, которые отключают thinking, повысьте max_tokens, где thinking теперь неявное, удалите инструкции по проверке, которые вы написали для более старой модели, и sweep effort на своих собственных тестах вместо наследования настройки. Вот как использовать Claude Opus 5 без оплаты верхнего рунга лестницы, которая перестаёт подниматься.
Ссылки
- Anthropic. Introducing Claude Opus 5 — benchmark comparison table and effort-level cost curves. Retrieved July 2026 from anthropic.com/news/claude-opus-5
- Anthropic. What's new in Claude Opus 5 — behavior changes, new features, availability, and migration. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- Anthropic. Pricing — token, cache, batch, and fast-mode rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
- Anthropic. Rate limits — per-model buckets and fast-mode limits. Retrieved July 2026 from platform.claude.com/docs/en/api/rate-limits
- Anthropic. Service tiers — Priority Tier model coverage. Retrieved July 2026 from platform.claude.com/docs/en/api/service-tiers
- Anthropic. Release notes — Claude Opus 5 launch entry dated July 24, 2026. Retrieved July 2026 from platform.claude.com/docs/en/release-notes/overview
Дополнительное чтение
- reAPI. What is Claude Opus 4.8? reapi.ai/blog/what-is-claude-opus-4-8
- reAPI. Claude Opus 5 endpoint reference. reapi.ai/docs/claude-opus-5
- reAPI. Model catalog. reapi.ai/models
Автор

Категории
Ещё статьи

API Qwen Image 2: цены, создание и редактирование
Используйте API Qwen Image 2 для генерации и редактирования изображений. Цены, поддерживаемые соотношения, лимиты промптов, параметры безопасности и код.


Управление камерой Seedance 2.5: числа вместо прилагательных
Управление камерой требует чисел и временных отметок. Используй явные скорости, механические ригги и кадры вместо описаний настроения или эмоций.


API фотографии товаров: одно фото — изображения для маркетплейса
API для фотографии товаров: сохраняет идентичность продукта, начинается с 1K, проверяет каждый результат, отслеживает стоимость одобренного изображения.
