
Лучшая модель Claude для кодирования: Fable 5 или Opus 5
Какая модель Claude лучше для кодирования, зависит от метрики оценки: Fable 5 лидирует в SWE-Bench Pro, Opus 5 выигрывает в агентском коде и дешевле втрое.
Ответ на вопрос «Какая модель Claude лучше всего подходит для кодирования» зависит от того, что вы понимаете под словом «лучше»: самый высокий результат на бенчмарке, лучший результат на доллар или модель, которая не разочарует вас в 2 часа ночи. Это три разные модели.
Опубликованные цифры решают больше, чем принято думать, включая одну строку таблицы Anthropic, где их флагманская модель проигрывает.
TL;DR
- Самый высокий результат в агентском кодировании: Claude Fable 5 с 80.3% на SWE-Bench Pro[1].
- Стандартный выбор для большинства команд: Claude Opus 5, которую Anthropic позиционирует для сложного агентского кодирования и корпоративной работы[2].
- Opus 5 проигрывает в одной строке. GPT-5.6 Sol берёт DeepSWE v1.1, 72.7% против 68.8%, в собственной таблице Anthropic[3].
- Для письма рейтинг переворачивается к знаниевой работе, где Opus 5 лидирует в GDPval-AA v2 с 1861[3].
- Уровень усилий имеет большее значение, чем выбор модели ниже фронтира:
lowиmediumна Opus 5 держатся необычно хорошо[2]. - На reAPI Opus 5 дешевле Fable 5 со значительным отрывом, что меняет расчёты.
Цифры по кодированию

Три модели — в серьёзной конкуренции. Вот что опубликовала Anthropic для каждой.
| Бенчмарк | Fable 5 | Opus 5 | Opus 4.8 |
|---|---|---|---|
| SWE-Bench Pro (агентское кодирование) | 80.3% | n/a | 69.2% |
| FrontierCode Diamond (самое сложное кодирование) | 29.3% | 53.4%† | 13.4% |
| Terminal-Bench 2.1 | 88.0%* | n/a | 82.7% |
| Frontier-Bench v0.1 (агентский терминал) | 33.7% | 43.3% | 21.1% |
| DeepSWE v1.1 (агентское кодирование) | 69.7% | 68.8% | 59.0% |
* Звёздочка отмечает строку, где Anthropic указывает, что публичная Fable 5 отличается от неограниченного собрата, потому что срабатывают классификаторы безопасности; модель, которую вы можете реально вызвать, приземлится ближе к Opus 4.8[1]. † FrontierCode v1.1 Main — другой срез бенчмарка, чем подмножество Diamond в колонке Fable 5, поэтому читайте колонку сверху вниз, а не строку слева направо.
Из этой таблицы вытекают два вывода.
Fable 5 занимает вершину доски кодирования там, где бенчмарки прямо сопоставимы, и с реальным отрывом на SWE-Bench Pro[1].
Opus 5 убедительно побеждает на новом бенчмарке агентского терминала, более чем удваивая результат Opus 4.8 на Frontier-Bench[3].
Строка, которую оставила Anthropic
На DeepSWE v1.1 таблица сравнения Anthropic ставит GPT-5.6 Sol на 72.7% против 68.8% Opus 5[3]. Это самый явный проигрыш кодирования на доске, и он падает ровно на рабочую нагрузку, на которую нацелена Opus 5.
Это стоит воспринимать серьёзно, а не объяснять. Если ваша оценка похожа на DeepSWE, конкурент набирает больше баллов на цифрах самого вендора. Если похожа на долгоперспективную терминальную работу, Opus 5 выигрывает ту же таблицу на девять пунктов над этим конкурентом.
Урок не в том, что одна модель лучше. Урок в том, что «лучшая для кодирования» разрешается по-разному в зависимости от того, какой бенчмарк кодирования соответствует вашей работе.
Какая для письма
Спросите о письме — и рейтинг перестраивается, потому что письмо живёт ближе к знаниевой работе, чем к коду.
| Бенчмарк | Opus 5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| GDPval-AA v2 (знаниевая работа, Elo) | 1861 | 1747 | 1593 |
| Humanity's Last Exam, без инструментов | 56.3% | 56.5% | 49.8% |
| Humanity's Last Exam, с инструментами | 64.7% | 63.9% | 57.9% |
Opus 5 лидирует в знаниевой работе на 114 пунктов Elo над Fable 5[3]. В рассуждениях без инструментов эти две находятся в пределах статистической погрешности.
Для черновиков, редактирования и синтеза этот разрыв в GDPval — это релевантный сигнал, и он указывает на Opus 5, а не на модель, которая возглавляет доску кодирования.
Переменная, которая побеждает выбор модели
Ниже фронтира уровень усилий сдвигает результаты больше, чем переключение моделей.
Anthropic описывает Opus 5 как преобразующую дополнительные усилия в более хорошие результаты надёжнее, чем любой более ранний Opus, и отдельно отмечает, что low и medium дают сильное качество за долю токенов и задержки[2]. Официальное руководство — начните с дефолтного high и проверяйте в обе стороны на собственных оценках.
Это имеет практический результат для всего этого вопроса. Команда, которая выбирает «лучшую» модель и оставляет усилия на унаследованном дефолте, часто получает худшие результаты, медленнее, чем команда на уровень ниже, которая поворотила циферблат.
Стоимость на reAPI
Выбор модели — это решение по стоимости столько же, сколько по возможностям.
| Модель | Ввод / вывод на 1М токенов |
|---|---|
| Claude Fable 5 | $8.00 / $40.00 |
| Claude Opus 5 | $2.40 / $12.00 |
| Claude Opus 4.8 | $4.00 / $20.00 |
| Claude Sonnet 4.6 | $2.40 / $12.00 |
Fable 5 дорожает более чем в три раза больше, чем Opus 5 на том же шлюзе. Это переформулирует вопрос кодирования: преимущество Fable 5 в SWE-Bench Pro реально, и вы платите более чем в 3 раза за это, на модели, которая также несёт обязательное 30-дневное хранение и слой отказа[1].
Для большинства команд эта сделка не прибыльна. Для миграции масштаба репо, где неудачный прогон стоит больше, чем токены, она может быть.
Выбор
По умолчанию выбирайте Opus 5. Лучший результат в знаниевой работе, решающее преимущество на новом бенчмарке агентского терминала, и самая дешевая из трёх на этом шлюзе.
Добирайтесь до Fable 5, когда задача долгоперспективна и действительно сложна и вы измерили, что она выигрывает на вашей работе. Кривая FrontierCode — это честный аргумент: на самых сложных проблемах дополнительные усилия продолжают покупать точность, где другие модели плато[1].
Оставайтесь на Opus 4.8, когда ваши оценки уже к ней калиброваны, или когда вам нужно отключить думание на высоких уровнях усилий, что Opus 5 отклоняет[2].
Рассмотрите модель не-Claude, если ваша рабочая нагрузка похожа на DeepSWE. Таблица самого вендора это говорит.
from openai import OpenAI
client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)Переключение между ними — это изменение строки модели на одном ключе. Тарифы на reapi.ai/models.
FAQ
Какая модель Claude лучше всего для кодирования?
Fable 5 возглавляет прямо сопоставимые бенчмарки кодирования, особенно SWE-Bench Pro с 80.3%[1]. Opus 5 выигрывает новый бенчмарк агентского терминала и дорожает намного дешевле, что делает её лучшим дефолтом для большинства команд[3].
Какая модель Claude лучше всего для письма?
Opus 5. Она лидирует в знаниевой работе на GDPval-AA v2 с 1861 Elo, 114 впереди Fable 5[3].
Claude побеждает GPT в кодировании?
Не на каждом бенчмарке. Таблица самой Anthropic показывает GPT-5.6 Sol берущий DeepSWE v1.1 с 72.7% против 68.8% Opus 5, в то время как Opus 5 лидирует ту же таблицу в агентской терминальной работе[3].
Стоит ли Fable 5 в три раза больше цены?
Только когда задача достаточно сложная, чтобы её кривая усилий окупила себя. Она также несёт обязательное 30-дневное хранение данных и слой отказа классификатора, который Opus 5 не имеет[1].
Имеет ли уровень усилий больше значения, чем выбор модели?
Ниже фронтира часто да. Opus 5 преобразует дополнительные усилия в результаты надёжнее, чем ранние Opus модели, и её настройки low и medium держатся необычно хорошо[2].
Какую модель использовать специально для review кода?
Opus 5, с одной оговоркой из руководства Anthropic: она следует фильтрам серьёзности буквально, поэтому просьба только о проблемах высокой серьёзности угнетает то, что она докладывает. Попросите всё с метками уверенности и фильтруйте дальше по потоку[2].
Sonnet достаточно хорошая для кодирования?
Для высокообъёмной работы, где стоимость за ход доминирует, часто да. На reAPI Sonnet 4.6 дорожает столько же, сколько Opus 5, что удаляет аргумент цены за выбор её.
Как я переключаюсь между ними?
Одна строка модели на одном ключе, если вы вызываете их через шлюз, а не через счета вендоров.
Согласование модели с бенчмарком, который соответствует вашей работе
Честный ответ на вопрос, какая модель Claude лучше для кодирования, — это вопрос недоуказанный. Fable 5 возглавляет классические бенчмарки кодирования. Opus 5 возглавляет новый бенчмарк агентского терминала, лидирует в знаниевой работе прямо, и дорожает в три раза дешевле. Конкурент бьёт обоих на одной строке, которую Anthropic опубликовала в любом случае.
Поэтому выберите бенчмарк, который похож на вашу фактическую работу, потом прочитайте эту строку. И прежде чем переключать модели вообще, поворотите циферблат усилий на той, которую у вас уже есть, потому что ниже фронтира это сдвигает результаты больше, чем имя модели.
References
- reAPI. How to use Claude Fable 5 — benchmark table, effort curve, refusal layer, and retention. reapi.ai/blog/how-to-use-claude-fable-5
- Anthropic. What's new in Claude Opus 5 — effort guidance, behavior changes, and capability improvements. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- reAPI. How to use Claude Opus 5 — the full published benchmark table. reapi.ai/blog/how-to-use-claude-opus-5
Further reading
- reAPI. How to use Claude Opus 4.8. reapi.ai/blog/how-to-use-claude-opus-4-8
- reAPI. How to use GPT-5.6. reapi.ai/blog/how-to-use-gpt-5-6
- reAPI. Model catalog. reapi.ai/models
Автор

Категории
Ещё статьи

Кто получит доступ к GPT-6 Astra? ChatGPT, Work, Codex и API
Узнай, кто может использовать GPT-6 Astra в ChatGPT, Work, Codex и API на 7 сентября 2026, плюс полный список проверки причин блокировки доступа.


Гайд по промптам Wan 3.0: связные скрипты видео на 30 сек
Практическая структура промпта для Wan 3.0: синхронизация времени, направление камеры, референсные роли, звуковое оформление, примеры и исправления ошибок.


Seedance 2.5 запущена: подтверждены 30 секунд, 4K не проверены
Seedance 2.5 показывает 30-секундное видео, мультимодальные ссылки, управление временем и редактирование. Проверяем утверждения о 4K, API и ограничениях входа.
