Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Максимальное число выходных токенов LLM: сравнение API
2026/09/08

Максимальное число выходных токенов LLM: сравнение API

Сравниваем лимиты вывода LLM, бюджет рассуждений и параметры API. Разбираем контекст, значения по умолчанию и расширенный вывод Claude только в пакетном режиме.

Контекстное окно на миллион токенов почти ничего не говорит о том, насколько длинный ответ способна создать LLM. Для GPT-5.6 Luna указано окно в 1,050,000 токенов, но максимум вывода составляет 128,000 токенов. В собственном API MiniMax M3 опубликован предел генерации в 524,288 токенов. Это разные ограничения — даже если пока не учитывать, что часть бюджета ответа расходуется на рассуждения.[1][2]

Полезнее сравнивать, помещается ли в эти пределы сама задача: её входные данные, необходимый объём генерации и интерфейс, через который приходит результат. В этом руководстве мы сравниваем максимальное число выходных токенов LLM для длинных отчётов, извлечения структурированных данных и генерации кода. Характеристики собственных API разработчиков отделены от публичного интерфейса reAPI, а синхронные запросы — от пакетной обработки. Сведения проверены 8 сентября 2026 года. Документированный потолок не означает, что модель выдаст столько же полезных токенов.

Главное

  • Лимит вывода и размер контекстного окна — разные ограничения. Luna допускает 128,000 выходных токенов в окне на 1,050,000 токенов. Дополнительное место для входных данных не увеличивает максимум вывода.[1]
  • Рекомендация не равна значению по умолчанию. MiniMax рекомендует для M3 131,072 токена и разрешает до 524,288. На текущей странице API не сказано, что при пропуске поля будет использовано именно 131,072.[2]
  • Максимальное значение параметра может не поместиться вместе с вашим вводом. Kimi K3 разрешает задать max_completion_tokens вплоть до 1,048,576, но отклоняет запрос, если сумма входных токенов и указанного лимита превышает контекстное окно.[3]
  • Окно DeepSeek используется совместно. Для V4 Flash и Pro указаны контекст 1M и максимум вывода 384K. API ограничивает суммарное число входных и сгенерированных токенов.[4][5]

Максимальное число выходных токенов LLM по моделям и API

В таблице приведены характеристики собственных API разработчиков. «Не указано» означает, что в полученной спецификации нет числового значения по умолчанию. Это не означает неограниченный вывод.

Модель и APIКонтекстное окноМаксимальный бюджет генерацииЗначение по умолчанию или рекомендацияУправление выводом
Kimi K3, собственный Chat Completions1M в обозначениях разработчикаДиапазон параметра достигает 1,048,576; ввод и лимит должны вместе помещаться в окноПо умолчанию 131,072max_completion_tokens
DeepSeek V4 Flash / Pro, собственный Chat Completions1M384K; также ограничен доступным контекстомНа текущих страницах числовое значение по умолчанию не указаноmax_tokens
MiniMax M3, собственный OpenAI-совместимый API1M524,288Рекомендуется 131,072; числовое значение по умолчанию не указаноmax_completion_tokens
GPT-5.6 Luna / GPT-6 Astra, собственный API1,050,000128,000На страницах моделей числовое значение вывода по умолчанию не указаноChat Completions: max_completion_tokens; Responses: max_output_tokens
Claude Opus 5 / Opus 4.8, синхронный Messages1M128KНужно задать бюджет запроса; значения из примеров не являются значениями по умолчаниюmax_tokens
Claude Opus 5 / Opus 4.8, Message Batches с бета-функцией расширенного вывода1M300,000Требуются соответствующая пакетная функция и бета-заголовокmax_tokens

Источники: страницы параметров и моделей Kimi, цены и справочник API DeepSeek, справочник API MiniMax, страницы моделей Luna и Astra от OpenAI, документация Anthropic по контексту и пакетной обработке.[3][6][4][5][2][1][7][8][9]

Сохраняйте единицы, указанные в источнике. На этих страницах DeepSeek публикует 384K, не приводя точного целого числа. MiniMax явно указывает, что 512K соответствует 524,288. Если переводить «K» у всех разработчиков с одним и тем же множителем, получится точность, которой источники не подтверждают.

Строка с пакетной обработкой Claude описывает отдельную возможность. Она требует output-300k-2026-03-24 в Message Batches API, а не в синхронном Messages API. Сейчас Anthropic указывает поддержку в Claude API и Claude Platform on AWS; другие платформы размещения исключены. Поддержка пакетного режима в собственном API разработчика не доказывает, что тот же режим доступен через другой шлюз.[9]

Оставьте бюджет для работы, которую читатель не увидит

Справочник OpenAI Chat Completions определяет max_completion_tokens как ограничение, включающее и видимый вывод, и токены рассуждений. Руководство по Responses также включает в бюджет генерации невидимые токены форматирования. Claude, в свою очередь, учитывает токены размышлений в max_tokens.[10][11][8]

При планировании расчёт может выглядеть так:

Бюджет запроса:                   30,000 токенов генерации
Плановый резерв на рассуждения:   10,000 токенов
Остаток для видимого ответа:      20,000 токенов

Это пример распределения, а не результаты измерений или обещание определённой длины рассуждений. Если ответ использует на рассуждения больше токенов, чем запланировано, для его видимой части останется меньше того же общего бюджета. Повышение интенсивности рассуждений может изменить объём выполняемой работы, но не увеличивает лимит, который вы передали в запросе.

Для длинного текста зафиксируйте два требования: какие входные данные должны оставаться доступными и какой бюджет генерации нужен задаче. Учитывайте системные инструкции, сохранённые сообщения, определения инструментов и результаты их работы, если выбранная конечная точка включает их в расчёт. Затем проверьте и потолок вывода, и ограничение контекста. Запрос может соответствовать одному условию и нарушать другое.[8]

Это влияет и на выбор модели. Бюджет генерации в 150,000 токенов превышает максимум Luna и Astra в 128,000, независимо от свободного места в контексте. Пакетное расширение Claude позволяет задать такой бюджет при соблюдении документированных условий. Однако из этого не следует, что полученный документ будет полным, правильным или оправдает свою стоимость.[1][7][9]

У Kimi рассуждения всегда включены. Это ещё одна причина не представлять максимальное значение параметра как возможность получить финальный ответ на миллион токенов. Перед генерацией API проверяет сумму ввода и заданного лимита. Страница MiniMax тоже описывает ограничение длины генерации, не обещая, что весь бюджет превратится в полезный текст ответа. Задавайте лимит явно и проверяйте фактическое содержимое ответа.[3][12][2]

Используйте параметр, предусмотренный выбранной конечной точкой

Совместимость с OpenAI не делает все параметры взаимозаменяемыми. OpenAI использует max_completion_tokens для Chat Completions и max_output_tokens для Responses. Собственный Chat Completions API DeepSeek использует max_tokens. В текущем справочнике собственного OpenAI-совместимого API MiniMax параметр max_tokens помечен как устаревший; вместо него рекомендуется max_completion_tokens.[10][11][5][2]

Управление рассуждениями тоже различается. Kimi K3 принимает low, high и max; значение по умолчанию — max. DeepSeek принимает те же три значения, но по умолчанию использует high; его совместимые псевдонимы medium и xhigh также соответствуют high. Luna поддерживает none и несколько уровней рассуждений, а по умолчанию использует medium. Astra не поддерживает none; текущая страница модели не указывает интенсивность рассуждений по умолчанию.[12][13][1][7]

Claude управляет интенсивностью через output_config.effort. У Opus 5 и 4.8 повышенный уровень обозначается xhigh, а не extra. Документированное значение по умолчанию — high. В Opus 5 адаптивные размышления включены по умолчанию, а отключить их можно только при интенсивности high или ниже. В Opus 4.8 размышления изначально отключены и требуют явного включения.[14][15]

Для reAPI начните с актуального каталога моделей и документации, на которую ссылается выбранная модель. На странице Luna указаны ограничения контекста и вывода, а в справочнике API Kimi — поле запроса. Значение по умолчанию в собственном API разработчика, явно заданное число в примере и фактическое поведение шлюза следует рассматривать как отдельные факты. Явное указание нужного лимита устраняет одну из возможных неоднозначностей.

Прочитайте причину остановки, прежде чем менять модель

Разные API по-разному обрабатывают заполненное окно:

ИнтерфейсДокументированный сигналЧто проверить
Собственный Chat Completions Kimiinvalid_request_error, если ввод вместе с запрошенным лимитом превышает контекстУменьшить ввод или лимит перед повторной попыткой
Собственный Chat Completions DeepSeekfinish_reason: length может означать достижение лимита вывода или контекстаСопоставить заданный лимит, данные об использовании и сохранённый ввод
OpenAI Responsesstatus: incomplete и incomplete_details.reason: max_output_tokensПроверить расход на рассуждения, а не только видимый вывод
Claude Messages, Claude 4.5 и новееВвод, который сам по себе превышает контекст, отклоняется; генерация на границе окна может остановиться с model_context_window_exceededОтличить слишком большой исходный запрос от исчерпания окна во время генерации

Это правила конкретных конечных точек, а не набор взаимозаменяемых названий полей.[3][5][11][8]

Приложение с агентом также может остановиться раньше, чем модель достигнет своего лимита. Сохраняйте исходный ответ разработчика модели вместе с ошибкой приложения и настроенными бюджетами. Само по себе сообщение «достигнут лимит выходных токенов» не определяет, кто установил границу: разработчик модели, SDK или агент. Расчёт бюджета для DeepSeek с учётом общего окна разобран в существующем руководстве по контексту 1M.

Частые вопросы

Можно ли отправить 1M входных токенов и всё равно получить максимальный вывод?

На это нельзя рассчитывать без проверки. DeepSeek ограничивает ввод и сгенерированный вывод вместе. Kimi проверяет сумму ввода и запрошенного лимита. Окно Claude тоже включает генерацию и размышления. Прежде чем заполнять запрос до заявленной ёмкости, прочитайте правило выбранной конечной точки.[5][3][8]

Модель с самым большим лимитом вывода лучше всего подходит для длинного отчёта?

Лимит показывает, допустим ли нужный бюджет в этом интерфейсе. Он не измеряет фактическую точность, способность следовать инструкциям или объём полезного текста, необходимый задаче. Проверив ограничение, оцените модель на характерном отчёте и заранее определите критерии его готовности.

Увеличивает ли потоковая передача потолок токенов?

В этом сравнении речь идёт об ограничениях генерации. Потоковая передача меняет способ получения ответа; это не пакетное расширение, повышающее лимит Claude до 300,000. Когда оно подходит для задачи, выбирайте эту функцию явно.[9]

Можно ли считать 4096 или 8192 из примера значением модели по умолчанию?

Пример показывает запрос, который решил отправить его автор. Считайте число значением по умолчанию только тогда, когда спецификация конечной точки прямо так его называет. Значение MiniMax 131,072 является рекомендацией, а Moonshot прямо указывает 131,072 как стандартное значение Kimi в собственном API.[2][3]

Может ли ответ исчерпать выходные токены, так и не показав текст?

Да, согласно описанному здесь поведению OpenAI Responses: рассуждения могут израсходовать бюджет до появления видимого вывода. Проверяйте статус незавершённого ответа и использование токенов. Пустой ответ сам по себе не доказывает, что никакая работа не выполнялась.[11]

Что сохранять для проверки в рабочей среде?

Сохраняйте ID модели, конечную точку, запрошенный лимит вывода, интенсивность рассуждений, заявленный расход входных и выходных токенов, причину завершения или остановки, а также результат проверки готовности задачи. Записывайте эти сведения вместе. Они позволяют сопоставить максимальное число выходных токенов LLM с бюджетом, который приложение действительно использовало.

Определите бюджет до выбора модели

Сравните максимальное число выходных токенов LLM с одной характерной задачей: какие входные данные нужно сохранить, какой бюджет генерации необходим и допустим ли пакетный интерфейс. Задайте лимит явно, проведите небольшую оценку и проверьте качество завершения вместе с расходом токенов. Если одного вызова недостаточно, разделите работу по осмысленным границам документа или кода и сохраните нужное состояние для следующего запроса. Само по себе более широкое заявленное окно не устраняет ограничение вывода.

Источники

  1. OpenAI. Модель GPT-5.6 Luna. Дата обращения: 8 сентября 2026 года. developers.openai.com/api/docs/models/gpt-5.6-luna.
  2. MiniMax. Chat Completions API. Дата обращения: 8 сентября 2026 года. platform.minimax.io/docs/api-reference/text-chat-openai.
  3. Moonshot AI. Chat Completions API. Дата обращения: 8 сентября 2026 года. platform.kimi.ai/docs/api/chat.
  4. DeepSeek. Модели и цены. Дата обращения: 8 сентября 2026 года. api-docs.deepseek.com/zh-cn/quick_start/pricing.
  5. DeepSeek. Chat Completions API. Дата обращения: 8 сентября 2026 года. api-docs.deepseek.com/zh-cn/api/create-chat-completion.
  6. Moonshot AI. Список моделей. Дата обращения: 8 сентября 2026 года. platform.kimi.ai/docs/models.
  7. OpenAI. Модель GPT-6 Astra. Дата обращения: 8 сентября 2026 года. developers.openai.com/api/docs/models/gpt-6-astra.
  8. Anthropic. Контекстные окна. Дата обращения: 8 сентября 2026 года. platform.claude.com/docs/en/build-with-claude/context-windows.
  9. Anthropic. Пакетная обработка: бета-функция расширенного вывода. Дата обращения: 8 сентября 2026 года. platform.claude.com/docs/en/build-with-claude/batch-processing.
  10. OpenAI. Создание Chat Completion. Дата обращения: 8 сентября 2026 года. developers.openai.com/api/reference/resources/chat/subresources/completions/methods/create.
  11. OpenAI. Модели рассуждений. Дата обращения: 8 сентября 2026 года. developers.openai.com/api/docs/guides/reasoning.
  12. Moonshot AI. Интенсивность рассуждений. Дата обращения: 8 сентября 2026 года. platform.kimi.ai/docs/guide/use-reasoning-effort.
  13. DeepSeek. Режим размышлений. Дата обращения: 8 сентября 2026 года. api-docs.deepseek.com/zh-cn/guides/thinking_mode.
  14. Anthropic. Интенсивность рассуждений. Дата обращения: 8 сентября 2026 года. platform.claude.com/docs/en/build-with-claude/effort.
  15. Anthropic. Размышления. Дата обращения: 8 сентября 2026 года. platform.claude.com/docs/en/build-with-claude/thinking.