Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Claude Opus 5: бенчмарки, производительность и цена
2026/07/27

Claude Opus 5: бенчмарки, производительность и цена

Как использовать Claude Opus 5: полная таблица бенчмарков, система уровней обработки, два критических изменения API, пошаговая миграция и оптимизация затрат.

Компания Anthropic запустила Claude Opus 5 24 июля 2026 года, описав её как значительный прорыв в сравнении с Claude Opus 4.8[6]. Цена на модель остаётся абсолютно той же: $5 за миллион входящих токенов и $25 за миллион исходящих[3]. Поэтому вопрос о том, как эффективно использовать Claude Opus 5, практически не связан с листинговой ценой, которая не изменилась, а в основном сводится к одному параметру, который большинство команд никогда не трогают.

Этот параметр — effort (уровень обработки). Вместо публикации одного числа для каждого бенчмарка, Anthropic опубликовала кривые производительности по сравнению с затратами на всех пяти уровнях обработки[1]. Разброс между самым дешёвым и самым дорогим уровнем этих кривых шире, чем любое улучшение переписывания промпта, и официальная рекомендация — протестировать всю лестницу на своих тестах, а не просто повышать всё до максимума[2].

Краткое резюме

  • Та же листинговая цена, но другая модель. $5 / $25 за миллион токенов, без изменений по сравнению с Opus 4.8[2]. На reAPI эта же модель работает по $2.40 / $12.00, что составляет 48% от опубликованной Anthropic цены.
  • Thinking включён по умолчанию. На Opus 4.8 при отсутствии поля thinking модель не использовала процесс размышления. На Opus 5 такой же запрос активирует размышление[2]. Так как max_tokens ограничивает как процесс размышления, так и текст ответа вместе, ограничиваемые бюджеты могут привести к усечению.
  • Отключение thinking ограничено уровнем high. Если отправить thinking: {"type": "disabled"} с xhigh или max, то вернётся ошибка 400, проверка выполняется для каждого запроса[2].
  • Opus 5 не побеждает везде. В таблице самой Anthropic модель проигрывает в агентном программировании на DeepSWE v1.1 компании GPT-5.6 Sol: 68.8% против 72.7%[1].
  • Не наследуйте настройки effort. Anthropic говорит, что low и medium теперь дают отличное качество при значительно меньшем количестве токенов и задержке, и рекомендует начинать с используемого по умолчанию high и двигаться в обе стороны на основе своих тестов[2].
  • Priority Tier на неё не распространяется, и она находится в отдельном bucket ограничений частоты запросов, а не в общем пуле Opus[5][4].

Что такое Claude Opus 5

Anthropic позиционирует Claude Opus 5 для сложной агентной разработки и корпоративной работы[2]. Идентификатор API — claude-opus-5, без суффикса даты.

СвойствоClaude Opus 5
ID модели в APIclaude-opus-5
Размер контекста1 млн токенов, как по умолчанию, так и максимум
Макс выход128k токенов
Листинговая цена$5 / $25 за миллион входящих / исходящих токенов
Быстрый режим$10 / $50, только API Claude
ThinkingВключён по умолчанию, адаптивный
Уровни обработкиlow, medium, high, xhigh, max, по умолчанию high
Минимум кэша промпта512 токенов, вместо 1024

Нет варианта с меньшим размером контекста[2]. Окно в 1 млн токенов — это всё, что вы получаете. За пределами Claude API модель доступна на Amazon Bedrock как anthropic.claude-opus-5, на Google Cloud как claude-opus-5 и на Microsoft Foundry[2]. Быстрый режим — исключение: он работает только на Claude API, а не на трёх облачных платформах[2].

Полная официальная таблица бенчмарков

Опубликованная Anthropic таблица сравнения Claude Opus 5, Fable 5, Opus 4.8 и GPT-5.6 Sol по агентному терминальному программированию, работе со знаниями, решению новых задач, агентному поиску, рассуждениям, использованию компьютера, агентному кодированию, бизнес-процессам, юридическим, медицинским и биологическим оценкам

Это опубликованное Anthropic сравнение, полностью переписанное, включая строки, где Opus 5 не побеждает[1]. Где в колонке Fable 5 указано другое имя модели, это собственная аннотация Anthropic.

БенчмаркOpus 5Fable 5Opus 4.8GPT-5.6 Sol
Агентное терминальное программирование (Frontier-Bench v0.1)43.3%33.7%21.1%34.4%
Работа со знаниями (GDPval-AA v2, Elo)1861174715931736
Решение новых задач (ARC-AGI-3)30.2%1.5%7.8%
Агентный поиск (BrowseComp)90.8%87.4%84.3%90.4%
Мультидисциплинарное рассуждение (HLE, без инструментов)56.3%56.5%49.8%
Мультидисциплинарное рассуждение (HLE, с инструментами)64.7%63.9%57.9%
Использование компьютера (OSWorld 2.0)70.6%66.1%55.7%62.6%
Агентное программирование (DeepSWE v1.1)68.8%69.7%59.0%72.7%
Агентное программирование (FrontierCode v1.1, Main)53.4%53.5%46.5%47.5%
Бизнес-процессы (AutomationBench)26.0%17.4%17.0%18.1%
Юридический (Legal Agent Benchmark, held-out)11.7%13.3%10.4%2.5%
Здравоохранение (HealthBench Professional)59.8%66.0% (Mythos 5)57.4%60.5%
Биология (BioMysteryBench, hard)49.4%46.5%42.4%
Биология (BioMysteryBench, human-solved)90.1%89.0% (Mythos 5)88.5%

Одна методологическая заметка перед тем, как кто-то будет цитировать эти числа. В сопроводительной таблице, которая разбирает Frontier-Bench по уровням обработки, Anthropic указывает, что результаты получены из внутреннего прогона на harness mini-SWE-agent с бэкендом GKE, усредняя результат на пять попыток за задачу, и что Opus 4.8 использовался как fallback, когда классификаторы безопасности отклоняли запрос от Opus 5 или Fable 5[1]. Это оценки, проведённые самим поставщиком. Воспринимайте их как сигнал направления, а не как независимую проверку.

Где она побеждает и где проигрывает

Opus 5 берёт девять из четырнадцати строк. Разница в победах неуловима. Frontier-Bench прыгает с 21.1% на Opus 4.8 на 43.3%, чуть более чем в два раза. ARC-AGI-3 прыгает с 1.5% на 30.2%, и ближайший конкурент в этой строке — GPT-5.6 Sol с 7.8%. AutomationBench находится на уровне 26.0% против кластера 17-18%[1].

Она проигрывает остальные пять, и они более полезны для выбора модели, чем победы.

  • DeepSWE v1.1, агентное программирование: 68.8% против 72.7% GPT-5.6 Sol. Это самый явный проигрыш на доске, и он падает на нагрузку, для которой Opus 5 продаётся. Anthropic оставила эту строку.
  • HealthBench Professional: 59.8%, позади Mythos 5 с 66.0% и GPT-5.6 Sol с 60.5%.
  • Legal Agent Benchmark: 11.7% против 13.3% Fable 5. Оба числа достаточно низкие, чтобы бенчмарк в основном измерял расстояние от цели.
  • HLE без инструментов (56.3% против 56.5%) и FrontierCode Main (53.4% против 53.5%) находятся в пределах погрешности, но они исключают утверждение, что Opus 5 доминирует над Fable 5 везде.

Закономерность: Opus 5 побеждает там, где задача длительная, использует инструменты и требует сохранения состояния на протяжении многих шагов. Она равна или проигрывает на сложных одиночных вопросах.

Лестница уровней определяет ваш счёт

Anthropic опубликовала полную лестницу производительности по сравнению с затратами, а не одно число для каждого бенчмарка, и чтение этого меняет то, как вы настраиваете модель[1].

График агентного программирования score vs cost за попытку на Frontier-Bench v0.1, отображающий лестницу уровней обработки для Claude Opus 5, Fable 5, Opus 4.8 и GPT-5.6 Sol на логарифмической шкале затрат

Из этого следуют три вещи.

Верхний уровень — не рекомендуемая начальная точка. Инструкция Anthropic — начать со стандартного high и настраивать в любом направлении на основе своих тестов: снизиться вниз, если качество держится, чтобы сохранить токены и задержку, подняться вверх для самой требовательной работы[2]. Обратите внимание на то, с чего начинается это предложение. Рекомендуемая точка входа — середина лестницы, а не её верх, и effort теперь имеет большую важность, потому что Opus 5 конвертирует дополнительный effort в лучшие результаты более надёжно, чем любая ранняя модель Opus[2].

Low и medium сильнее, чем раньше. Anthropic явно указывает на эффективность при более низком effort, говоря, что low и medium дают отличное качество при небольшой доле токенов и задержки более высоких настроек[2]. Наследуемые из Opus 4.8 настройки effort — неправильная начальная точка.

Effort — это рычаг затрат, а не промпт. Официальная рекомендация — начать со стандартного high, затем двигаться в любом направлении на основе своих тестов: снизиться вниз, если качество держится, чтобы сохранить токены и задержку, подняться вверх для самой требовательной работы[2]. На xhigh или max установите большой max_tokens, чтобы модель имела место для размышления и действий по подагентам и вызовам инструментов[2].

Два критических изменения под капотом

Поверхность запроса в основном унаследована от Opus 4.8. Параметры sampling всё ещё отклоняются, фиксированные бюджеты thinking всё ещё отклоняются, и prefill последнего хода assistant всё ещё выходит из строя. Два вещи действительно изменились, и обе нарушают код, перенесённый без изменений.

Thinking запускается, когда вы опускаете параметр. На Opus 4.8 запрос без поля thinking выполнялся без thinking. На Opus 5 тот же запрос думает, с моделью решая когда и сколько на каждом ходу[2]. Значение провода не изменилось; thinking: {"type": "adaptive"} всё ещё действительно и эквивалентно стандартному. То, что изменилось, это то, что происходит, когда вы ничего не говорите. Так как max_tokens — жёсткий лимит на thinking плюс текст ответа вместе, Anthropic говорит вам пересмотреть это для любой нагрузки, которая ранее работала без thinking[2]. Бюджет, настроенный только для видимого выхода, теперь будет усечен середине ответа.

Отключение thinking требует effort high или ниже. thinking: {"type": "disabled"} в сочетании с xhigh или max возвращает 400. Проверка выполняется на каждом запросе, поэтому сеанс, который был успешным на high, начинает выходить из строя в тот момент, когда более поздний вызов повышает effort, пока thinking всё ещё отключён[2].

Anthropic также документирует, что идёт не так с отключённым thinking: модель может записать вызов инструмента в свой текстовый выход вместо выпуска блока tool_use, или утечку внутренних XML-тегов в видимый ответ[2]. Первый режим отказа — опасный в цикле агента, потому что ход заканчивается чисто и вызов никогда не выполняется. Официальная рекомендация — держать thinking включённым и контролировать затраты с более низким уровнем effort.

Три дополнения стоят того, чтобы знать о них:

  • Изменения инструментов в середине разговора (заголовок beta mid-conversation-tool-changes-2026-07-01) позволяют добавлять или удалять инструменты между ходами, сохраняя кэш промпта, вместо того чтобы закреплять список инструментов на время сеанса[2].
  • Режим fallback "default" (заголовок beta server-side-fallback-2026-07-01) применяет рекомендуемые Anthropic fallback модели по категории отказа, вместо списка, который вы ведёте[2].
  • Минимум кэша промпта упал на 512 токенов с 1024, поэтому промпты, ранее слишком короткие для кэширования, теперь создают записи кэша без изменений кода[2].

Что на самом деле движет счётом

Вот полная официальная карта тарифов[3]:

ПозицияЦена за млн токенов
Входящие$5
Исходящие$25
Попадания кэша и обновления$0.50
Запись кэша (5-минутная)$6.25
Запись кэша (1-часовая)$10
Batch входящие$2.50
Batch исходящие$12.50
Быстрый режим входящие$10
Быстрый режим исходящие$50

Batch API работает по половине стандартной цены на обе стороны, а быстрый режим удваивает обе[3]. Anthropic описывает Opus 5 как доставляющую frontier-уровневую интеллектуальность по половине цены Claude Fable 5[2], что соответствует карте тарифов: Fable 5 указана по $10 / $50[3].

Три рычага имеют большее значение, чем цена за токен.

Effort. Опубликованный разброс cost-per-attempt на всей лестнице достаточно широк, что перемещение одного маршрута с xhigh вниз на medium сохраняет больше, чем любое переписывание промпта[1].

Многословие. Anthropic указывает, что стандартные ответы и письменные deliverables работают длиннее на Opus 5[2]. Токены thinking считаются выходом, как и дополнительная проза. Снижение effort снижает thinking, но не надёжно сокращает видимый выход, поэтому напишите явную инструкцию по краткости.

Verification scaffolding, которые вы теперь можете удалить. Opus 5 проверяет свою работу без указания, и Anthropic говорит, что инструкции, перенесённые из более ранних моделей, например "включить финальный этап проверки" или "использовать подагента для проверки", вызывают избыточную проверку[2]. Удаление их снижает расходы токенов без компромисса качества, что редкий вид оптимизации.

Ограничения частоты запросов и Priority Tier

Два оперативных факта, которые ловят команды во время развёртывания.

Priority Tier не охватывает Claude Opus 5. Документация по service-tier Anthropic указывает, что Priority Tier поддерживается на всех доступных моделях Claude, кроме Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 и Claude Sonnet 5[5]. Если ваше планирование ёмкости предполагало охват Priority Tier, это не применяется здесь.

Opus 5 также имеет свой собственный bucket ограничения частоты. Объединённое ограничение Opus применяется к трафику между Opus 4.8, 4.7, 4.6 и 4.5; Opus 5 не является частью этого пула[4]. Это хорошая новость во время миграции, так как трафик Opus 5 не съедает бюджет, который ваши существующие маршруты Opus 4.8 зависит. Быстрый режим имеет выделенные ограничения снова отдельно от стандартных ограничений Opus и возвращает 429 с заголовком retry-after при превышении[4].

Как использовать Claude Opus 5: контрольный список миграции

Рекомендации Anthropic по миграции сводятся к изменению строки модели и проверке двух поведенческих изменений[2]. На практике список немного длиннее.

  1. Измените строку модели на claude-opus-5.
  2. Проверьте каждый маршрут, который отключает thinking. Либо держите thinking отключённым и опустите effort на high или ниже, либо держите уровень effort и удалите поле thinking.
  3. Повысьте max_tokens на маршрутах, которые никогда не устанавливали поле thinking. Они теперь думают, и бюджет охватывает оба.
  4. Повторно запустите sweep effort на ваших собственных тестах. Начните со стандартного high и двигайтесь в обе стороны, вместо того чтобы наследовать настройки Opus 4.8.
  5. Удалите инструкции по проверке из промптов и этапы проверки из harnesses.
  6. Добавьте явную инструкцию по краткости к маршрутам, обращённым к пользователям.
  7. Перепроверьте короткие промпты, которые вы написали как не кэшируемые, против нового минимума 512 токенов.
  8. Обрабатывайте отказы как ответы, а не ошибки. Классификаторы безопасности могут отклонить запрос и вернуть причину остановки вместо ошибки HTTP, поэтому код, который безусловно читает первый блок контента, выйдет из строя.

Вызов Claude Opus 5 вместе с вашими другими моделями

Всё выше указывает на ту же оперативную проблему. Эта модель имеет пять уровней effort, свой bucket ограничения частоты, нет Priority Tier и таблицу бенчмарков, где она проигрывает агентному программированию GPT-5.6 Sol и здравоохранению Mythos 5. Правильная конфигурация — это не одна настройка. Это решение маршрутизации на нагрузку, и оно меняется каждый раз, когда поставщик отправляет что-то новое.

Это слой, который стоит строить намеренно. Проход проверки кода и массовая извлекательная работа не должны работать на одном effort, и маршрут, который Opus 5 проигрывает, не должны оставаться на Opus 5 по привычке. Обработка этого одним SDK клиентом на поставщика, одним ключом на поставщика и одной биллинг-поверхностью на поставщика — вот где накапливаются затраты многомодельной работы.

reAPI раскрывает Claude Opus 5 через OpenAI-совместимую конечную точку /v1/chat/completions, поэтому клиент, который вы уже используете для GPT и Gemini вызовов, его вызывает:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

Тарифы на шлюзе составляют $2.40 за миллион входящих токенов и $12.00 за миллион исходящих, что составляет 48% от опубликованной Anthropic $5 / $25. Полная поверхность запроса, включая output_config.effort и правила thinking выше, задокументирована на странице reapi.ai/docs/claude-opus-5, и текущие тарифы находятся на reapi.ai/models/claude-opus-5.

Ничего из этого не снимает решение маршрутизации. Это снимает налог на интеграцию при его принятии.

FAQ

Лучше ли Claude Opus 5, чем Claude Fable 5?

В девяти из четырнадцати строк в опубликованной таблице Anthropic — да, и по половине цены Fable 5[3]. Но Fable 5 всё ещё берёт HLE без инструментов, FrontierCode Main и Legal Agent Benchmark, и строка HealthBench Professional идёт на Mythos 5[1].

Claude Opus 5 стоит дороже, чем Opus 4.8?

Нет. Обе указаны по $5 за миллион входящих токенов и $25 за миллион исходящих[3]. Anthropic отправила скачок способности без изменения цены[2].

Какое самое большое критическое изменение от Opus 4.8?

Thinking включён по умолчанию. Запрос, который опустил поле thinking, работал без thinking на Opus 4.8 и думает на Opus 5, что меняет как затраты, так и поведение max_tokens. Второе — что thinking: {"type": "disabled"} теперь возвращает 400 на effort xhigh или max[2].

Какой уровень effort мне следует использовать?

Начните со стандартного high, затем sweep в обе стороны на основе своих тестов[2]. Anthropic показывает max как топ-уровень для самого глубокого возможного рассуждения, а не как лучший стандарт, и отдельно отмечает, что low и medium держат на этой модели при небольшой доле токенов и задержки[2].

Какое окно контекста Claude Opus 5?

1 млн токенов, что является как стандартом, так и максимумом. Нет варианта с меньшим контекстом. Максимальный выход — 128k токенов[2].

Охватывается ли Claude Opus 5 Priority Tier?

Нет. Priority Tier охватывает все доступные модели Claude, кроме Mythos 5, Mythos Preview, Opus 5 и Sonnet 5[5]. Opus 5 также находится в собственном bucket ограничения частоты, вместо объединённого пула Opus 4.x[4].

Могу ли я всё ещё отключить thinking?

Да, на effort high или ниже. Anthropic рекомендует против этого, документируя, что модель может написать вызовы инструмента в видимый текст или утечку внутренних тегов при отключённом thinking, и рекомендует вместо этого снизить effort[2].

Как мне вызвать Claude Opus 5 с OpenAI SDK?

Направьте OpenAI клиент на https://api.reapi.ai/v1, установите model на claude-opus-5 и отправьте обычный chat запрос. Конечная точка OpenAI-совместима, поэтому переписывание SDK не требуется.

Выбор уровня effort и переход дальше

Интересное в этом выпуске то, что страница цены — наименее информативная часть. Листинговая цена не изменилась, поэтому весь дельта находится в поведении: thinking по умолчанию, 400, которые не существовали раньше, пол кэша, сокращённый вдвое, и лестница effort, рекомендуемая точка входа которой — средний рунг, а не верхний. Anthropic также опубликовала пять строк бенчмарков, где его новый флагман проигрывает, что стоит больше, чем девять, где он побеждает.

Если вы мигрируете, работа маленькая и конкретная. Измените строку модели, проверьте маршруты, которые отключают thinking, повысьте max_tokens, где thinking теперь неявное, удалите инструкции по проверке, которые вы написали для более старой модели, и sweep effort на своих собственных тестах вместо наследования настройки. Вот как использовать Claude Opus 5 без оплаты верхнего рунга лестницы, которая перестаёт подниматься.

Ссылки

  1. Anthropic. Introducing Claude Opus 5 — benchmark comparison table and effort-level cost curves. Retrieved July 2026 from anthropic.com/news/claude-opus-5
  2. Anthropic. What's new in Claude Opus 5 — behavior changes, new features, availability, and migration. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  3. Anthropic. Pricing — token, cache, batch, and fast-mode rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
  4. Anthropic. Rate limits — per-model buckets and fast-mode limits. Retrieved July 2026 from platform.claude.com/docs/en/api/rate-limits
  5. Anthropic. Service tiers — Priority Tier model coverage. Retrieved July 2026 from platform.claude.com/docs/en/api/service-tiers
  6. Anthropic. Release notes — Claude Opus 5 launch entry dated July 24, 2026. Retrieved July 2026 from platform.claude.com/docs/en/release-notes/overview

Дополнительное чтение