
Claude Opus 4.8: честность, Dynamic Workflows и стоимость
Руководство по Claude Opus 4.8: официальная таблица бенчмарков, прирост честности, Dynamic Workflows, изменение уровня усилий и планирование миграции.
Anthropic выпустила Claude Opus 4.8 28 мая 2026 года, через сорок один день после Opus 4.7 и ровно по той же цене: 5 $ за миллион входных токенов и 25 $ за миллион выходных[1][3]. Умение хорошо использовать Claude Opus 4.8 — это в основном вопрос понимания того, что изменилось под ценовым ярлыком, который не сдвинулся.
Три вещи всё-таки изменились. Agentic-кодирование снова улучшилось, SWE-bench Pro поднялась с 64,3% до 69,2%[1]. Быстрый режим стал в три раза дешевле. И Anthropic большую часть объявления посвятила чему-то, что вообще не является числовым показателем: модель примерно в четыре раза реже, чем Opus 4.7, оставляет незамеченный дефект в написанном ею коде[1]. Для любого, кто запускает агентов без присмотра, это последнее изменение алтает профиль риска больше, чем числовой показатель.
TL;DR
- Цена не изменилась, возможности улучшились. 5 $ / 25 $ за миллион токенов, как Opus 4.7 и 4.6[3]. На reAPI этот же модель работает по 4,00 $ / 20,00 $, что составляет 80% от опубликованной Anthropic цены.
- Прирост честности — главная новость. Примерно в четыре раза реже, чем Opus 4.7, пропускает собственные дефекты кода без комментариев, и примерно в семнадцать раз реже, чем Sonnet 4.6, выдаёт нечестное резюме своей agentic-работы[1].
- Быстрый режим упал до трети прежней цены. 10 $ / 50 $ за миллион токенов при примерно 2,5-кратной скорости вывода, против 30 $ / 150 $ в быстром режиме предыдущих моделей Claude[1].
- API-значение уровня усилий по умолчанию сместилось с
mediumнаhigh. Любые системы, полагавшиеся на старое значение, получат более глубокое рассуждение, выше latency и больше выходных токенов без изменения кода[1]. - Бюджеты фиксированного thinking были удалены. Код, передающий
budget_tokens, должен переместиться наthinking: {"type": "adaptive"}[1]. - Она не везде побеждает. GPT-5.5 по-прежнему выигрывает Terminal-Bench 2.1, 78,2% против 74,6%, а GPQA Diamond немного упала с Opus 4.7[1].
Что такое Claude Opus 4.8

Claude Opus 4.8 — это передовая модель в семействе Claude 4 от Anthropic и прямая замена Opus 4.7 на всех поверхностях, которые выпускает Anthropic. API-идентификатор — claude-opus-4-8, без суффикса даты[2]. Она читает до 1M токенов в одном запросе и возвращает до 128K, или до 300K на Batch API с бета-заголовком[2].
Если ты хочешь ознакомиться со спецификацией подробнее, мы её написали: что такое Claude Opus 4.8 охватывает контекстное окно, модальности и список способностей. Этот гайд о операционной стороне, где находятся интересные решения.
Как Opus 4.8 работает на кодировании и agentic-бенчмарках

Заголовочное сравнение Anthropic противопоставляет Opus 4.8 версиям Opus 4.7, GPT-5.5 и Gemini 3.1 Pro на оценках, которые она считает репрезентативными для реальной agentic-работы[1].
| Бенчмарк | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Agentic-кодирование (SWE-bench Pro) | 69,2% | 64,3% | 58,6% | 54,2% |
| Agentic-кодирование терминала (Terminal-Bench 2.1) | 74,6% | 66,1% | 78,2% | 70,3% |
| Многодисциплинарное рассуждение (HLE, без инструментов) | 49,8% | 46,9% | 41,4% | 44,4% |
| Многодисциплинарное рассуждение (HLE, с инструментами) | 57,9% | 54,7% | 52,2% | 51,4% |
| Agentic-использование компьютера (OSWorld-Verified) | 83,4% | 82,8% | 78,7% | 76,2% |
| Работа с информацией (GDPval-AA, Elo) | 1890 | 1753 | 1769 | 1314 |
| Agentic-финансовый анализ (Finance Agent v2) | 53,9% | 51,5% | 51,8% | 43,0% |
Opus 4.8 лидирует в шести из семи строк. Исключение — Terminal-Bench 2.1, где GPT-5.5 выигрывает 78,2% к 74,6%[1].
Три оговорки относятся к этой таблице, потому что они важны для реального решения о покупке. SWE-bench Verified, о которой сообщается отдельно, поднялась на 88,6% с 87,6%, небольшой шаг на уровне, где бенчмарк начинает насыщаться. GPQA Diamond пошла неправильным путём, упав до 93,6% с 94,2% для Opus 4.7. И это оценки, проводимые поставщиком, поэтому читай всю таблицу как направленный сигнал, а не как нейтральный аудит. Anthropic также сообщает о 96,7% на USAMO 2026 и повышении до 84,3% на одноагентском BrowseComp[1].
Честный вывод: "в целом впереди, но не везде".
Что сообщают партнёры из production
Бенчмарки часто завышают реальные прирост, поэтому заявления партнёров ранних доступов в объявлении запуска Anthropic стоят больше, чем ещё одна строка оценки. Несколько из них достаточно конкретны, чтобы на них действовать[1].
- Databricks сообщила о скачке в agentic-рассуждении при примерно 61% меньших затратах на токены, чем Opus 4.7. Это то, что важно для production-экономики, потому что прирост возможностей, который также снижает расходы, редко бывает при point-release.
- Cursor сообщила о значительно более эффективном использовании инструментов, завершая end-to-end задачи за меньше шагов при том же уровне интеллекта.
- Cognition, строящая Devin, сообщила о чистом использовании инструментов и следовании инструкциям, достаточно согласованном для бесконтрольной работы автономной инженерии.
- Harvey зафиксировала свой наивысший балл на своём Legal Agent Benchmark и первой моделью преодолела 10% на своём самом строгом стандарте «всё правильно».
Рассматривай цифру 61% как гипотезу для проверки на собственном трафике, а не как число для бюджета. Стоимость токенов зависит от рабочей нагрузки, и описанное ниже изменение уровня усилий толкает в противоположном направлении.
Обновление честности
Самая отличительная часть этого релиза — это изменение поведения, а не числовой показатель. На внутренней оценке misaligned-behavior от Anthropic, оценённой от 1 до 10, где ниже лучше, Opus 4.8 приземляется близко к Claude Mythos Preview и намного ниже как Opus 4.7, так и Sonnet 4.6[1]. На практике Anthropic сообщает, что она примерно в четыре раза реже, чем Opus 4.7, оставляет дефекты своего кода незамеченными, и примерно в семнадцать раз реже, чем Sonnet 4.6, выдаёт нечестное резюме своей agentic-работы[1].

Две вещи держат это в перспективе. Это сокращение показателей, а не устранение. Модель, в четыре раза менее вероятная скрыть дефект, всё ещё иногда скрывает его, поэтому человеческая проверка agentic-кода не исчезает. И метрики честности берутся из собственных оценок Anthropic, а не из сторонних бенчмарков, поэтому это фреймирование поставщика до тех пор, пока независимое тестирование не наверстает упущенное.
Направление всё ещё важно. В длительном бесконтрольном цикле модель, которая активно говорит, что она не уверена, материально безопаснее развёртывать, чем та, которая с уверенностью отправляет неработающий результат.
Dynamic Workflows
Флагманская новая функция поставляется как preview исследования в Claude Code и решает проблему, с которой сталкивается каждый пользователь agentic-кодирования: некоторые работы слишком большие для одного агента и одного контекстного окна. Миграция фреймворка в сотни тысяч строк. Обновление зависимости, затрагивающее каждый сервис. Refactor репозитория в масштабе.
Архитектура — это оркестратор и работники. Opus 4.8 планирует работу, разбивает её на независимые сегменты и отправляет их сотням подагентов, работающих параллельно. Каждый подагент планирует, выполняет и проверяет свой сегмент, а оркестратор объединяет проверенные результаты. Anthropic рассматривает существующий набор тестов репозитория как ворота для того, что считается завершённым, и описывает систему как ведущую миграцию масштаба кодовой базы от начала к объединению[1].
Это feature оркестрации, которую улучшенная long-horizon coherence модели делает жизнеспособной, что также объясняет, почему работа над честностью и работа над workflow принадлежат одному релизу. Разветвление в сотни агентов полезно только, если каждый надёжно сигнализирует о том, что он не смог завершить.
Усилия, быстрый режим и уравнение стоимости
Здесь два изменения, и первое — это скрытое увеличение счета, если ты его пропустишь.
API-уровень усилия по умолчанию сместился с medium на high, с xhigh и max доступными выше[1]. Любая система, полагавшаяся на старое значение, теперь рассуждает глубже, работает медленнее и выдаёт больше выходных токенов без изменения кода. Если ты сравниваешь стоимость Opus 4.8 с Opus 4.7, сначала приведи уровни усилий в соответствие, иначе сравнение бессмысленно.
Быстрый режим упал до трети своей прежней цены. Она работает с той же моделью при примерно 2,5-кратной скорости вывода за 10 $ за миллион входных токенов и 50 $ за миллион выходных, против 30 $ / 150 $ на предыдущих моделях Claude[1]. Это всё ещё двойная стандартная ставка, но переводит быстрый режим из "слишком дорого, чтобы оправдывать" в диапазон для latency-sensitive продуктов.
Вот полная официальная тарифная сетка[3]:
| Позиция | Цена за MTok |
|---|---|
| Входные токены | $5 |
| Выходные токены | $25 |
| Попадания кеша и обновления | $0.50 |
| Запись кеша (5 минут) | $6.25 |
| Запись кеша (1 час) | $10 |
| Batch входные токены | $2.50 |
| Batch выходные токены | $12.50 |
| Быстрый режим входные токены | $10 |
| Быстрый режим выходные токены | $50 |
Batch API сокращает обе размерности, а кеширование промпта делает повторённый контекст дешёвым для чтения по 0,50 $ за миллион токенов[3]. Между плоской стандартной ценой, более дешёвым быстрым уровнем и уровнем усилия по умолчанию, который сместился, вопрос перестал быть "доступен ли Opus" и стал "какой уровень усилия, в каком режиме, для какого класса задач".
Как использовать Claude Opus 4.8: миграция с Opus 4.7
Anthropic описывает переход как в значительной степени неразрушающий, но три изменения стоит поймать перед тем, как production-трафик переключится[1].
- API-уровень усилия по умолчанию сместился с
mediumнаhigh. Установи его явно или примите более глубокое рассуждение, выше latency и больше выходных токенов. - Бюджеты фиксированного extended-thinking токена были удалены. Код, передающий значение
budget_tokens, мигрирует наthinking: {"type": "adaptive"}. - API сообщений теперь принимает system entries посередине задачи без разрушения кеша промптов. Это не разрушающее изменение, но поведение, которое нужно знать, если твой агент обновляет инструкции во время работы.
Контрольный список, который держится для любого обновления модели: переиграй 20-50 реальных задач из своего production trace при согласованных уровнях усилия, сравни end-to-end стоимость и качество, а не per-token ставки, переточи промпты, которые фиксируют усилие или бюджеты thinking, и запилоти Dynamic Workflows на одной подлинно большой работе перед тем, как встроить её в автоматизацию. Математика стоимости токенов эмпирична. Измери её на своей рабочей нагрузке.
Кто должен обратить внимание сейчас
Команды, уже запускающие Opus 4.7. Прирост SWE-bench Pro плюс сообщаемое снижение стоимости токенов делают pilot миграции стоящим времени, если ты бюджетишь для нового high уровня усилий по умолчанию и сначала сравниваешь стоимость на реальных задачах.
Команды с работами масштаба кодовой базы. Dynamic Workflows — причина для обновления, если у тебя есть миграция или refactor репозитория, который застрял, потому что был слишком большим для одного агента. Начни с одной ограниченной задачи, где набор тестов надёжен.
Любой, кто запускает бесконтрольные agentic-циклы. Улучшения честности важнее всего, когда никакой человек не проверяет каждый шаг в реальном времени: ночные запуски, автономные пайплайны, длительные research задачи.
Команды, которые, вероятно, должны пропустить это. Если ты начинаешь с нуля, а не мигрируешь, посмотри Claude Opus 5 перед тем, как обязаться 4.8. Она котируется по той же 5 $ / 25 $, и на reAPI работает дешевле, чем Opus 4.8. Opus 4.8 остаётся правильным ответом, когда тебе нужна модель, поведение которой твои evals уже характеризуют, или когда ты специально хочешь thinking выключенным на высоких уровнях усилия, которые Opus 5 больше не разрешает.
Вызов Claude Opus 4.8 рядом с твоими другими моделями
Всё вышесказанное — это problem маршрутизации, носящий костюм миграции. Уровень усилия по умолчанию сместился, поэтому стоимость за задачу сместилась. Быстрый режим стал жизнеспособным для класса маршрутов, из которых его вытеснили цены. GPT-5.5 по-прежнему выигрывает terminal-кодирование. Opus 5 теперь существует по той же цене листа. Ничто из этого не разрешается в одном параметре, и всё меняется снова при следующем релизе.
reAPI открывает Claude Opus 4.8 через endpoint /v1/chat/completions, совместимый с OpenAI, поэтому клиент, который ты уже используешь для GPT и Gemini вызовов, тоже его вызывает:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="claude-opus-4-8",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)Ставки на шлюзе — 4,00 $ за миллион входных токенов и 20,00 $ за миллион выходных, что составляет 80% от опубликованной Anthropic цены в 5 $ / 25 $. Ссылка на endpoint находится на reapi.ai/docs/claude-opus-4-8, а актуальные ставки находятся на reapi.ai/models/claude-opus-4-8.
Обмен строкой модели — это лёгкая часть. Возможность обменять её без второго SDK, второго ключа и второго счета — это часть, которую стоит строить один раз.
FAQ
Когда был выпущен Claude Opus 4.8?
28 мая 2026 года, через сорок один день после Opus 4.7, по неизменённой цене[1].
Сколько стоит Claude Opus 4.8?
5 $ за миллион входных токенов и 25 $ за миллион выходных, с попаданиями кеша по 0,50 $ и Batch API по половине цены[3]. Быстрый режим — 10 $ / 50 $[1].
Какая самая важная вещь, которую нужно поймать при миграции с Opus 4.7?
API-уровень усилия по умолчанию сместился с medium на high. Если твоя система полагалась на старое значение, ты получишь более глубокое рассуждение, выше latency и больше выходных токенов без изменения кода[1].
Claude Opus 4.8 побеждает GPT-5.5?
На пяти из шести строк, где Anthropic их прямо сравнивает, да. GPT-5.5 выигрывает agentic-кодирование терминала на Terminal-Bench 2.1, 78,2% против 74,6%[1].
Что такое Dynamic Workflows?
Preview исследования в Claude Code, в котором Opus 4.8 действует как оркестратор, разбивает большую работу на независимые сегменты, отправляет их сотням параллельных подагентов и объединяет проверенные результаты, используя набор тестов репозитория как ворота[1].
Независимо ли проверена улучшение честности?
Пока нет. Цифры в четыре и семнадцать раз берутся из внутренних оценок Anthropic, а не из сторонних бенчмарков[1]. Это сокращения показателей, а не устранения, поэтому человеческая проверка agentic-выхода всё ещё применяется.
Должен ли я использовать Opus 4.8 или Opus 5?
Opus 5 котируется по той же 5 $ / 25 $ и является качественным прыжком, а не инкрементным обновлением. Opus 4.8 остаётся релевантной, когда твои evals уже характеризуют её поведение, или когда ты нуждаешься в thinking, отключённом на высоких уровнях усилия, которые Opus 5 отклоняет.
Как мне вызвать Claude Opus 4.8 с SDK OpenAI?
Направь OpenAI клиент на https://api.reapi.ai/v1, установи model на claude-opus-4-8 и отправь обычный чат-запрос. Endpoint совместим с OpenAI, поэтому переписывание SDK не требуется.
Соответствие уровня усилия задаче
Полезный способ читать этот релиз в том, что Anthropic держала цену плоской и потратила релиз на вещи, которые показываются только в production: модель, которая сигнализирует о собственных ошибках, примитив оркестрации для работ, слишком больших для одного контекстного окна, и быстрый режим, который наконец стоит то, что latency-sensitive продукты могут платить. Таблица бенчмарков реальна, но скромна. Изменение поведения — это часть, которая изменяет, сколько надзора нужно агенту.
Если ты мигрируешь, работа мала и конкретна. Установи уровень усилие явно, а не наследуй новый high default, перемести любой код budget_tokens на adaptive thinking, переиграй реальные production задачи при согласованном усилии перед тем, как доверять сравнению стоимости, и запилоти Dynamic Workflows на одной ограниченной работе с набором тестов, которому ты доверяешь. Вот как использовать Claude Opus 4.8, не обнаружив default усилия в счете.
Ссылки
- Anthropic. Introducing Claude Opus 4.8 — benchmarks, honesty evaluations, Dynamic Workflows, effort defaults, and fast-mode pricing. Retrieved July 2026 from anthropic.com/news/claude-opus-4-8
- Anthropic. Models overview — context, output, modality, and capabilities. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/overview
- Anthropic. Pricing — token, cache, and batch rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
Дополнительное чтение
- reAPI. How to use Claude Opus 5. reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. What is Claude Opus 4.8? reapi.ai/blog/what-is-claude-opus-4-8
- reAPI. Claude Opus 4.8 endpoint reference. reapi.ai/docs/claude-opus-4-8
Автор

Категории
Ещё статьи

Лучшая API-платформа для AI-инструментов дизайна и маркетинга
Нет единой лучшей API-платформы. Сравниваем четыре платформы по контракту запроса, реальным ценам и тому, для чего каждая из них действительно создана.


Midjourney V8.2: функции V6 и V7, которые больше не работают
V8.2 исключила девять функций из V6 и V7, включая Quality и Turbo. Что всё ещё работает, что автоматически вернётся на V7 и сколько на самом деле стоит HD.


Лучшие альтернативы Higgsfield для видео ИИ
Сравнение альтернатив Higgsfield: reAPI, Atlas Cloud, fal, Replicate, Krea и Dreamina для генерации видео, рабочего процесса и способов тарификации.
