Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
DeepSeek V4 с контекстом 1М: max_tokens, биллинг и паралелизм
2026/07/30

DeepSeek V4 с контекстом 1М: max_tokens, биллинг и паралелизм

DeepSeek V4 делит контекст 1М между входом и выходом с максимумом 384К на выход. Разберись с max_tokens, кешированием и лимитами параллелизма.

Контекстное окно 1М токенов DeepSeek V4 — это общий бюджет для входа и выхода. Это не значит, что ты можешь отправить 1М токенов на вход, а потом получить ещё 384К на выходе. 384К — это максимум на выход, а max_tokens — это установленный тобой потолок выхода на один запрос. Реальный выход ограничен и оставшимся местом в окне 1М токенов[1][2].

В этом гайде мы разбираем практические вопросы за этой спецификацией: как рассчитать бюджет входа и выхода, как установить max_tokens, что делают токены мышления с объёмом, как работает кеширование и почему у Flash и Pro разные лимиты паралелизма.

Лимиты DeepSeek V4 в кратце

ПараметрОфициальная спецификация
ID моделиdeepseek-v4-flash, deepseek-v4-pro
Контекстное окно1М токенов, общее для входа и выхода
Максимум выхода384К токенов
max_tokensПотолок завершения на запрос; не может превышать оставшийся контекст или лимит выхода модели
Режим по умолчаниюМышление включено; обычные запросы используют reasoning_effort: high по умолчанию
КешКеш контекста на диске включен автоматически
Паралелизм Direct APIFlash 2 500; Pro 500, на аккаунт
ИнтерфейсыChat Completions совместимый с OpenAI и Anthropic

DeepSeek выпустил V4 в режиме preview 24 апреля 2026 с вариантами Flash и Pro и контекстом 1М токенов[3]. Официальная страница цен указывает тот же потолок выхода 384К для обеих моделей, а также JSON Output, вызовы инструментов, завершение с префиксом и FIM завершение[1].

1М — это только вход?

Нет. Справочник Chat Completions DeepSeek говорит, что общая длина токенов входа и сгенерированных токенов ограничена длиной контекста модели[2].

Используй такую модель мышления:

входные токены + сгенерированные токены <= 1М контекст
сгенерированные токены <= max_tokens
сгенерированные токены <= 384К лимит выхода модели

Если промпт почти заполняет окно контекста, модель не может вернуть ответ в 384К. Зарезервируй место для системных инструкций, схем инструментов, истории беседы и завершения.

Большое окно также не убирает ценность поиска и разбиения на части. Отправка меньше, но лучше организованного контекста часто улучшает задержку, стоимость и фокус ответа.

Как установить max_tokens

max_tokens — это максимальная длина завершения для одного запроса. finish_reason со значением length может означать, что запрос достиг этого потолка или исчерпал доступный контекст[2].

Разумные начальные точки:

Рабочая нагрузкаНачальный потолок
Классификация, извлечение, краткие ответы1К–4К
Ревью кода и краткие содержания документов4К–16К
Длинные отчёты и планы миграции16К–64К
Экстремальная long-form генерацияПовышай только после измерения стоимости и усечения

Это инженерные начальные точки, а не официальные требования. Измеряй finish_reason, реальные токены завершения, задержку и процент полезного выхода перед повышением потолка.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "user",
            "content": "Review this repository inventory and produce a risk-ranked migration plan.",
        }
    ],
    max_tokens=16_384,
    reasoning_effort="high",
    extra_body={
        "thinking": {"type": "enabled"},
        "group": "default",
    },
)

Смотри справочник DeepSeek V4 API для полей запроса на reAPI и страницу модели DeepSeek V4 для плейграунда и актуальных цен шлюза.

Токены мышления и объём завершения

Режим мышления включен по умолчанию. DeepSeek возвращает рассуждение в reasoning_content, а объект usage может сообщить о нём отдельно как completion_tokens_details.reasoning_tokens[4][2].

Планируй ёмкость завершения учитывая как рассуждение, так и видимый финальный ответ. В режиме мышления temperature, top_p, presence_penalty и frequency_penalty принимаются для совместимости, но не действуют[4].

Для детерминированного извлечения или low-latency работы тестируй Flash с выключенным мышлением. Держи мышление включённым для планирования, кодирования и многошагового использования инструментов, где дополнительное рассуждение полезно.

Как работает биллинг

DeepSeek Direct выставляет счёт за три бакета токенов:

  1. кешированный вход;
  2. некешированный вход;
  3. выход.

Официальные USD ставки на 30 июля 2026 были[1]:

МодельКешированный вход / 1МНекешированный вход / 1МВыход / 1М
DeepSeek V4 Flash$0.0028$0.14$0.28
DeepSeek V4 Pro$0.003625$0.435$0.87

Общая формула:

cost =
  cached_input / 1M × cached_rate
  + uncached_input / 1M × uncached_rate
  + output / 1M × output_rate

Это прямые цены DeepSeek. reAPI — отдельный шлюз с собственными актуальными USD ставками, поэтому используй карточку цен на странице reAPI DeepSeek V4 для биллинга шлюза.

Как получить ценность от кеширования контекста

Кеш на диске DeepSeek включен автоматически. Позже запрос получает попадание в кеш только когда полностью совпадает с сохранённой юнитом префикса; похожие формулировки недостаточно[5].

Положи стабильный контент первым:

стабильный системный промпт
+ стабильные схемы инструментов
+ неизменённый репозиторий или корпус документов
+ вопрос, который меняется на запрос

Используй поля ответа prompt_cache_hit_tokens и prompt_cache_miss_tokens для расчёта реального процента попаданий. Не оценивай экономию только из сходства промптов.

Паралелизм Flash и Pro

DeepSeek Direct публикует лимиты паралелизма на уровне аккаунта: 2 500 для Flash и 500 для Pro. Запрос занимает один слот паралелизма до завершения ответа. Лимит на аккаунт, а не на ключ API, и избыточные запросы получают HTTP 429[6].

Опциональный user_id может изолировать поведение безопасности, кеша и планирования, но обычные аккаунты по-прежнему делят общий паралелизм аккаунта всех user ID. Создание большего количества ключей или user ID не увеличивает ёмкость.

Эти цифры применяются к DeepSeek Direct. Паралелизм шлюза и очереди могут отличаться; при использовании reAPI следуй лимитам и ответам, опубликованным reAPI.

Чеклист production для запросов с контекстом 1М

  • Считай токены вместо того, чтобы рассматривать символы как токены.
  • Зарезервируй контекст для выхода, схем инструментов и следующих ходов.
  • Установи max_tokens под задачу, а не автоматически в 384К.
  • Записывай finish_reason и различай усечение от естественного завершения.
  • Держи переиспользуемые префиксы стабильными и отслеживай токены попаданий в кеш.
  • Измеряй использование рассуждений отдельно от длины видимого ответа.
  • Повторяй 429 ответы с экспоненциальной задержкой и разбросом.
  • Маршрутизируй высокий объём рутинной работы на Flash и зарезервируй Pro для сложных задач.
  • Используй текущие ID модели V4; DeepSeek объявил дату прекращения поддержки deepseek-chat и deepseek-reasoner как 24 июля 2026[3].

Часто задаваемые вопросы

Поддерживает ли DeepSeek V4 Flash контекст 1М?

Да. И Flash, и Pro имеют контекстное окно 1М и максимум выхода 384К[1].

Контекст 1М — это полностью вход?

Нет. Вход и сгенерированный выход делят лимит контекста модели[2].

Я могу установить max_tokens в 384К?

384К — это потолок выхода модели, но запрос должен также иметь достаточно места в окне контекста 1М. Эта установка не гарантирует завершение 384К.

Токены рассуждений считаются в использовании завершения?

Планы ёмкости и биллинга должны их включать. DeepSeek сообщает о токенах рассуждений в деталях использования завершения[2].

Лимиты паралелизма — на ключ API?

Нет. DeepSeek Direct ограничивает паралелизм на аккаунт: 2 500 для Flash и 500 для Pro[6].

Нужно ли мне включать кеширование промпта?

Нет. Кеш контекста на диске автоматический. Держи общие префиксы стабильными и проверяй поля попаданий кеша в usage[5].

Дальнейшее чтение

References

  1. DeepSeek. Models & Pricing — V4 context, output, features, prices, and concurrency. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/pricing
  2. DeepSeek. Create Chat Completion — max_tokens, context limits, finish reasons, and usage. Retrieved July 30, 2026 from api-docs.deepseek.com/api/create-chat-completion
  3. DeepSeek. DeepSeek-V4 preview release. April 24, 2026. api-docs.deepseek.com/news/news260424
  4. DeepSeek. Thinking Mode — controls, reasoning effort, and reasoning content. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/thinking_mode
  5. DeepSeek. Context Caching — prefix matching and usage fields. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/kv_cache
  6. DeepSeek. Rate Limit & Isolation — account-level concurrency and user_id. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/rate_limit