Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Как использовать GPT-5.5: возможности и уязвимость
2026/07/27

Как использовать GPT-5.5: возможности и уязвимость

Как использовать GPT-5.5: лидер по Terminal-Bench, почему рост цены меньше, чем кажется, скрытая статистика 86% халлюцинаций и нужный ей цикл проверки.

OpenAI выпустила GPT-5.5 23 апреля 2026 года, назвав её своей первой полностью переобученной базовой моделью со времён GPT-4.5[1]. В течение суток она заняла первое место в индексе Artificial Analysis Intelligence Index.

Знание о том, как правильно использовать GPT-5.5, начинается с неудобной цифры, которая отсутствует в пресс-релизе. В бенчмарке AA-Omniscience она показывает самую высокую точность из всех протестированных моделей — 57%, и 86% галлюцинаций на вопросах, в которых ошибается[2]. Claude Opus 4.7 галлюцинирует на 36% той же меры. Когда GPT-5.5 ошибается, она ошибается уверенно.

Этот один факт определяет, как вы должны её развёртывать, и эта статья организована вокруг него.

Краткое резюме

  • Обучена от начала до конца как агент, а не как чат-модель с приставленными инструментами. OpenAI сосредоточила обучение на агентном кодировании, компьютерном взаимодействии, работе со знаниями и ранних научных исследованиях[1].
  • Terminal-Bench 2.0 на 82,7%, примерно на 13 пунктов впереди Claude Opus 4.7 и Gemini 3.1 Pro[1].
  • Рост цены меньше, чем кажется. Ставка поднялась с $2,50/$15 на $5/$30, но примерно на 40% меньше выходных токенов на задачах Codex приводит к эффективному росту за задачу около 20%[1].
  • На reAPI стоит $4,00 / $24,00 за миллион токенов, 80% от публичной ставки.
  • Профиль галлюцинаций — вот в чём загвоздка. Самая высокая точность, но и самая высокая уверенность при ошибке[2].
  • Кодирование остаётся ничьей. SWE-bench Pro выигрывает Opus 4.7, 64,3% против 58,6%[1].

Что такое GPT-5.5

GPT-5.5 — это сначала модель-агент, а потом чат-модель. Она поставляется в двух вариантах, делящих окно контекста в 1M токенов и ввод текста плюс видение[1]:

  • GPT-5.5 с уровнями усилия рассуждения xhigh, high, medium, low и без рассуждения.
  • GPT-5.5 Pro — вариант с большей мощностью, подталкивающий задачи на дальний горизонт.

Где она впереди

Сравнение бенчмарков GPT-5.5 OpenAI против GPT-5.4, Claude Opus 4.7 и Gemini 3.1 Pro по Terminal-Bench, GDPval, OSWorld-Verified, BrowseComp, FrontierMath и CyberGym

БенчмаркGPT-5.5GPT-5.4Claude Opus 4.7Gemini 3.1 Pro
Terminal-Bench 2.082,7%75,1%69,4%68,5%
Expert-SWE (внутренний)73,1%68,5%n/an/a
GDPval (победы или ничьи)84,9%83,0%80,3%67,3%
OSWorld-Verified78,7%75,0%78,0%n/a
BrowseComp84,4%82,7%79,3%85,9%
FrontierMath Уровень 1–351,7%47,6%43,8%36,9%
CyberGym81,8%79,0%73,1%n/a

Три вещи, на которые стоит обратить внимание[1].

Terminal-Bench 2.0 — решающая победа. Это ближайший публичный прокси для завершения реальной инженерной задачи от начала до конца без помощи, и 13-пунктовое лидерство в этом конце кривой необычно.

GDPval важнее, чем кажется. Она проверяет качество вывода в 44 профессиях против экспертов отрасли, и выигрывать или играть вничью в 84,9% случаев — это реальный коммерческий аргумент: паритет работы со знаниями с доменным экспертом.

SWE-bench Pro — это поражение, и сообщество оспаривает бенчмарк. GPT-5.5 набирает 58,6% против 64,3% Opus 4.7, с открытыми вопросами о запоминании тренировочного набора в этом конкретном тесте. Относитесь к лидерству Opus со здоровым скептицизмом, но не предполагайте, что брешь в кодировании закрылась.

Индекс интеллекта Artificial Analysis показывает GPT-5.5 на вершине рейтинга вскоре после запуска

Что действительно ново

Архитектурный деталь, которая имеет значение, не в таблице бенчмарков: GPT-5.5 обучена от начала до конца как агент с нативным ожиданием многошагового использования инструментов, чтения экрана и верификации[1].

Многошаговые вызовы инструментов без надзора. OpenAI продемонстрировала, что модель выполняет более 1000 последовательных вызовов инструментов без вмешательства. Отсюда берутся цифры Terminal-Bench и OSWorld.

Результаты Tau-squared bench Telecom показывают GPT-5.5, достигающую 98% точности многооборотного использования инструментов в симуляции обслуживания клиентов

Самопроверка перед отправкой. Модель проверяет свой результат перед возвратом. CodeRabbit сообщил об ожидаемом обнаружении проблем, прыгнувшем с 58,3% на 79,2% в своём бенчмарке рецензирования, с более короткими ответами и более сильным предубеждением в пользу малых работоспособных изменений[1].

Компьютерное взаимодействие в Codex. Чтение экрана предоставляется через Codex, позволяя модели видеть и взаимодействовать с произвольными приложениями рабочего стола.

Проблема галлюцинаций

Это раздел, который пресс-релиз похоронил, и он должен определить вашу стратегию развёртывания.

В AA-Omniscience GPT-5.5 показывает самую высокую точность из всех протестированных моделей на 57%, с 86% галлюцинаций на вопросах, в которых ошибается. Claude Opus 4.7 показывает 36%, а Gemini 3.1 Pro Preview — 50%[2].

На практике: когда GPT-5.5 ошибается, она не сигнализирует неопределённость. Для агентных рабочих процессов, где модель принимает реальные действия на реальных системах, это нетривиальный режим отказа.

Вероятное объяснение — что OpenAI оптимизировала агентную уверенность, обучив модель действовать, а не отступать. Этот компромисс рационален для инструмент-ориентированных рабочих процессов и дорог для чистого ответа на вопросы.

Есть два смягчения, которые действительно работают:

Повысьте уровень усилия рассуждения. Используйте xhigh для всего, где качество вывода важнее задержки. Более высокое усилие заметно уменьшает галлюцинации на протестированных задачах.

Закрепите её в инструментах. Чтение файлов, запуск тестов, результаты поиска. Сила GPT-5.5 — использование инструментов, так что используйте инструменты, чтобы проверить её. Утверждение, которое модель проверила против файла, — это другой вид утверждения, чем то, которое она создала из памяти.

Это также то место, где Opus 4.7 по-прежнему выигрывает для production. Если стоимость уверенно неправильного ответа велика, более низкий уровень галлюцинаций важнее пяти пунктов на бенчмарке.

Цены

МодельВход на 1MВыход на 1M
GPT-5.5$5$30
GPT-5.5 Pro$30$180
GPT-5.4 (предыдущая)$2,50$15

Наивное прочтение — GPT-5.5 удвоила цену. Честное прочтение — она значительно более эффективна по токенам, используя примерно на 40% меньше выходных токенов на задачах Codex для эквивалентной работы, что приводит к эффективному росту за задачу ближе к 20%, чем к 100%[1]. При более низкой ставке повтора и агентные рабочие процессы выходят вперёд.

GPT-5.5 Pro по $30 / $180 — для узко определённого случая: задача на дальний горизонт, высокие ставки, где пятёрка-десятка пунктов бенчмарка оправдывает премию стоимости в шесть раз. Это маленький срез реального трафика.

На reAPI GPT-5.5 работает по $4,00 вход и $24,00 выход за миллион токенов, что составляет 80% опубликованной ставки.

Одна вещь, которую стоит знать, прежде чем выбрать: на том же шлюзе GPT-5.6 Sol стоит точно так же $4,00 / $24,00. GPT-5.6 вышла в июле с режимами рассуждения max и ultra и более высокой оценкой Terminal-Bench. Если ваши оценки не уже калиброваны для поведения GPT-5.5, цены не дают причины оставаться.

Как использовать GPT-5.5: где она подходит и где нет

Используйте её для дальнегоризонтного агентного кодирования, задач компьютерного взаимодействия в Codex, рабочих процессов исследования, которые просматривают и синтезируют, математического рассуждения и многопрофессиональной работы со знаниями, где результат GDPval 84,9% — достоверный сигнал[1].

Не используйте её для задач, где стоимость галлюцинации высока и вы не можете обернуть вызов в верификацию, чистого кодирования, где Opus по-прежнему впереди по SWE-bench Pro, или чувствительного к цене высокообъёмного трафика, где дешёвые модели обогнали её в пять-десять раз за токен.

Вызов GPT-5.5 на reAPI

Конечная точка совместима с OpenAI, так что строка модели — единственное изменение. Обратите внимание, что wire id сохраняет точку:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="gpt-5.5",
    messages=[{"role": "user", "content": "Прочитай падающий тест, найди баг и исправь его."}],
    max_tokens=16000,
    stream=True,
)

Учитывая профиль галлюцинаций, деталь интеграции, которая имеет значение, — не форма запроса. Это то, даёт ли окружающий harness модели что-то, над чем проверить себя. Ставки есть на reapi.ai/models/gpt-5-5, и переключение на gpt-5.6-sol или gpt-5.6-terra — это изменение одной строки на том же ключе.

Часто задаваемые вопросы

Стоит ли повышение цены GPT-5.5 над GPT-5.4?

Для агентных и работа-со-знаниями задач — да. Стоимость за задачу примерно на 20% выше, а не на 100%, из-за выигрыша эффективности токенов, и скачок качества реален. Для простого чата или низкостав генерации, старая модель имела лучшую стоимость[1].

Как GPT-5.5 сравнивается с Claude Opus 4.7 для кодирования?

Opus 4.7 впереди SWE-bench Pro примерно на шесть пунктов с значительно более низкими галлюцинациями. GPT-5.5 впереди по Terminal-Bench, агентному использованию инструментов и дальнегоризонтным задачам. Для рецензирования кода и рефакторинга Opus безопаснее. Для агентных циклов с инструментами выигрывает GPT-5.5[1].

Почему GPT-5.5 галлюцинирует больше, чем Opus 4.7?

Вероятное объяснение — оптимизация агентной уверенности: модель обучена действовать, а не отступать. Смягчайте с xhigh рассуждением плюс верификация на основе инструментов[2].

Может ли GPT-5.5 надёжно обработать 1M токенов?

Да для поиска. Для сложного рассуждения по полному окну ожидайте деградации прим 200K, как и другие 1M-контекстные модели. Разбивайте или используйте поиск для высокостав долго-контекстной работы.

Должен ли я использовать GPT-5.5 или GPT-5.6?

На reAPI они стоят одинаково, и GPT-5.6 добавила режимы рассуждения max и ultra с более высокой оценкой Terminal-Bench. Оставайтесь на GPT-5.5 только если ваши оценки уже калиброваны для её поведения.

Генерирует ли GPT-5.5 изображения?

Нет. Это только текстовый и визуальный ввод. Генерация изображений в стеке OpenAI — это GPT Image 2.

Для чего GPT-5.5 Pro?

Дальнегоризонтные, высокоставочные задачи, где прибыль бенчмарка в пять-десять пунктов оправдывает премию стоимости в шесть раз при $30 / $180 за миллион токенов[1].

Как я устанавливаю уровень усилия рассуждения?

Через параметр reasoning-effort с уровнями xhigh, high, medium, low и без рассуждения. Повышайте его, когда корректность важнее задержки[1].

Развёртывание уверенной модели осторожно

Метрика-заголовок этого выпуска, лидерство индекса, — это наименее полезная вещь в нём. Реальная история — модель, обученная с нуля как агент, чьи доминирующие бенчмарки все отображаются на многошаговое, инструмент-использующее, реальное завершение задач. Это другой центр тяжести от точного инструмента для высокоставочной одношаговой работы.

Правило развёртывания вытекает непосредственно из числа галлюцинаций. Дайте ей инструменты и позвольте ей проверить себя, повысьте усилие рассуждения, когда корректность важнее задержки, и никогда не позволяйте уверенно сформулированному ответу дойти до пользователя или системы production без чего-то, над чем модель может быть проверена. Вот как правильно использовать GPT-5.5: не как оракул, но как очень способного агента, которому нужен цикл верификации вокруг.

Ссылки

  1. OpenAI. Models — GPT-5.5 specifications, benchmarks, and reasoning-effort levels. Retrieved July 2026 from platform.openai.com/docs/models
  2. Artificial Analysis. Intelligence Index and AA-Omniscience hallucination measurements. Retrieved July 2026 from artificialanalysis.ai/models
  3. OpenAI. Pricing — per-token rates by model and tier. Retrieved July 2026 from platform.openai.com/docs/pricing

Дополнительное чтение