Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Официальный DeepSeek V4 Flash: Responses API и апгрейд агентов
2026/08/02

Официальный DeepSeek V4 Flash: Responses API и апгрейд агентов

DeepSeek V4 Flash 0731 вышел в публичной бете API с усиленными возможностями агентов, встроенной поддержкой Responses API и интеграцией Codex.

DeepSeek V4 Flash 0731 теперь официальная модель Flash, которую отдаёт API DeepSeek. Обновление от 31 июля 2026 года заменило апрельский превью за тем же ID модели deepseek-v4-flash, добавило встроенную поддержку Responses API и значительно переопределило модель для кодирующих агентов и работы с инструментами. DeepSeek назвала релиз официальным, но сервис API всё ещё помечен как публичная бета.[1]

Это апдейт только для API. DeepSeek V4 Pro, приложение DeepSeek и вебчат не получили апгрейд в рамках релиза 0731. Архитектура тоже не изменилась: Flash остаётся 284-миллиардной моделью mixture-of-experts с 13 млрд активных параметров и контекстным окном в один миллион токенов.[1][2]

TL;DR

  • Официальная модель — DeepSeek-V4-Flash-0731. Существующие вызовы API продолжают использовать deepseek-v4-flash; миграция имени модели не требуется.[1]
  • Это апгрейд постобучения, а не новая архитектура. Общее количество параметров, активные параметры и контекстное окно в 1M остались неизменными.[1][2]
  • Производительность агентов — главная новость. DeepSeek сообщает 82,7 на Terminal Bench 2.1, 54,4 на DeepSWE и 70,3 на Toolathlon Verified, используя собственный неопубликованный минимальный стенд и максимальный уровень рассуждений.[1]
  • Поддержка Responses API встроена. Flash теперь может подкреплять Codex без прокси преобразования протокола, который требовал превью.[3][4]
  • Слой совместимости не полностью соответствует OpenAI. API без состояния, принимает текст вместо входных данных изображения/файла и игнорирует или отклоняет несколько полей Responses API.[3]
  • Pro и потребительский чат не изменились. DeepSeek говорит, что официальный релиз V4 Pro выйдет отдельно.[1]

Спецификации DeepSeek V4 Flash 0731

ПараметрОфициальный статус релиза
Дата релиза31 июля 2026
Статус сервисаОфициальный релиз API в публичной бете
ID модели APIdeepseek-v4-flash
Имя чекпоинтаDeepSeek-V4-Flash-0731
АрхитектураMixture of experts, без изменений от превью
Параметры284 млрд всего, 13 млрд активированных
Контекстное окно1M токенов
Максимальный выход384K токенов
Режимы рассужденийБез мышления, Think High, Think Max
Форматы APIChat Completions, совместимый с Anthropic, Responses API
Вход на Responses APIТекст; входные данные изображения и файла не поддерживаются
Открытые весаMIT-лицензированные веса модели доступны

Различие между ID модели и именем чекпоинта преднамеренно. DeepSeek-V4-Flash-0731 идентифицирует обновлённые веса, в то время как deepseek-v4-flash — это стабильное имя сервиса, которое приложения отправляют в API.[5] Это позволяет DeepSeek обновлять бэкенд без принуждения каждого разработчика менять конфигурацию продакшена.

Что изменилось с DeepSeek V4 Flash Preview

Карта обновления DeepSeek V4 Flash 0731, показывающая неизменённую архитектуру, новое постобучение, улучшенное поведение агентов и встроенную поддержку Responses API

Релиз 0731 меняет поведение и интеграцию больше, чем сырой масштаб модели.

ОбластьАпрельский превью0731 официальный Flash
Архитектура284B всего / 13B активный MoEБез изменений
Контекст1M токеновБез изменений
ID моделиdeepseek-v4-flashБез изменений
Этап обученияПостобучение превьюПереобучение для официального релиза
Способность агентаСильный общий базовый уровень агентаОсновное переопределение для кодирующих агентов и использования инструментов
Responses APIНет встроенной конечной точкиВстроенная поддержка
Интеграция CodexТребовался адаптер или другой совместимый маршрутОфициально документированная прямая конфигурация
Область развёртыванияFlash и Pro preview APIТолько Flash API

DeepSeek говорит, что 0731 "был только переобучен в постобучении".[1] Эта фраза легко недооценить. Для моделей агентов постобучение контролирует, планирует ли модель эффективно, вызывает ли правильный инструмент, читает ли результат, восстанавливается ли после отказа и продолжает ли работу до завершения задачи. Архитектура задаёт ёмкость; постобучение определяет, насколько надёжно эта ёмкость появляется внутри работающего агента.

Релиз поэтому не делает модель больше. Он делает существующую модель Flash более полезной для работы с репозиториями, задач в терминале, генерации патчей, поиска и многошаговой автоматизации.

Новые бенчмарки агентов DeepSeek — и как их читать

DeepSeek опубликовала девять оценок для официального релиза:[1]

БенчмаркDeepSeek V4 Flash 0731
Terminal Bench 2.182,7
NL2Repo54,2
CyberGym76,7
DeepSWE54,4
Toolathlon Verified70,3
Agent Last Exam25,2
Automation Bench Public25,1
DSBench FullStack68,7
DSBench Hard59,6

Эти цифры подтверждают утверждение, что работа с агентами была центром обновления. Они не устанавливают универсальный рейтинг.

DeepSeek использовала собственный "режим минимального стенда", который компания говорит будет выпущен позже, с максимальным уровнем рассуждений, top_p: 0.95 и temperature: 1.0. Два из сообщённых наборов данных — DSBench FullStack и DSBench Hard — являются внутренними.[1] Пока стенд и внутренние задачи не доступны, эти результаты не могут быть независимо воспроизведены полностью.

Для оценки продакшена держите одинаковый набор репозиториев, разрешения инструментов, таймаут, политику повтора, уровень рассуждений и бюджет токенов между моделями. Измеряйте завершённые задачи и принятые патчи, не только то, произвела ли модель правдоподобный diff.

Встроенный Responses API — самое важное изменение для разработчиков

DeepSeek V4 Flash теперь принимает формат Responses API на стандартном базовом URL DeepSeek. Это удаляет значительный разрыв интеграции для Codex и других клиентов, построенных вокруг /v1/responses вместо Chat Completions.[3]

Минимальный прямой вызов использует OpenAI SDK:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="Review code conservatively and explain every proposed edit.",
    input="Find the race condition in this queue worker.",
    reasoning={"effort": "high"},
    max_output_tokens=8_192,
)

print(response.output_text)

Потоковая передача возвращает семантические события, такие как response.output_text.delta, response.function_call_arguments.delta и response.completed. В отличие от знакомого потока Chat Completions, он не заканчивается на data: [DONE].[3]

Встроенная поддержка важна, потому что адаптер больше не должен переводить вызовы инструментов, события рассуждений и элементы выхода между двумя форматами проводов. Меньше слоёв трансляции означает меньше мест, где ID вызовов инструментов, состояние потока или история рассуждений могут сломаться.

Совместимость Responses API имеет важные ограничения

"Встроенный Responses API" не означает, что каждая функция OpenAI Responses работает. DeepSeek подробно документирует границу совместимости.[3]

Поддерживаемые функции включают:

  • текстовый вход и инструкции разработчика/системы;
  • потоковую передачу;
  • инструменты функций и поиск в вебе на стороне сервера;
  • обязательный или специфический выбор инструмента;
  • уровень рассуждений;
  • структурированные текстовые форматы;
  • пользовательский инструмент apply_patch, используемый для совместимости с Codex.

Важные ограничения включают:

  • previous_response_id и conversation не поддерживаются, поэтому API без состояния;
  • store, фоновый режим, метаданные, шаблоны подсказок и уровни обслуживания не поддерживаются;
  • элементы входных данных изображения и файла заменены текстом-заполнителем вместо обработки;
  • MCP, использование компьютера, интерпретатор кода и инструменты поиска файлов игнорируются;
  • parallel_tool_calls игнорируется, потому что параллельное использование инструментов всегда включено;
  • запросы, превышающие контекстное окно, возвращают HTTP 400 вместо автоматического усечения.

Некоторые неподдерживаемые параметры молча игнорируются. Это облегчает начальное подключение, но это также означает, что запрос может вернуться успешно без учёта каждого контроля, который отправило ваше приложение. Тесты интеграции должны проверять поведение, а не только статус HTTP.

Как использовать DeepSeek V4 Flash 0731 с Codex

DeepSeek теперь опубликовала выделенное руководство конфигурации Codex. По состоянию на 2 августа поддерживается только Flash; поддержка V4 Pro ожидается отдельно.[4]

Официальная установка создаёт провайдера DeepSeek в ~/.codex/config.toml и каталог моделей в ~/.codex/models.json. Важные значения во время выполнения:

model = "deepseek-v4-flash"
model_provider = "deepseek"

[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
wire_api = "responses"
env_key = "DEEPSEEK_API_KEY"

Каталог DeepSeek даёт Flash максимальный контекст в 1 048 576 токенов, включает параллельные вызовы инструментов и раскрывает низкие, высокие и максимальные уровни рассуждений.[4] Держите ключ API в переменной окружения вместо того, чтобы писать его в общий файл конфигурации.

Для работы с репозиториями начните с рассуждений high. Переходите на max только для задач, которые оправдывают дополнительную задержку и выходные токены, таких как кроссервисная миграция или сложная перемежающаяся ошибка.

Цены и ограничения контекста не получили новый уровень релиза

Текущий прайс-лист DeepSeek Direct указывает Flash на:[6]

Категория токенаЦена за 1M токенов
Кэшированный вход$0,0028
Некэшированный вход$0,14
Выход$0,28

Flash сохраняет общее контекстное окно в 1M, максимальный выход в 384K и ограничение параллелизма на уровне аккаунта в 2500.[6][7] Низкая цена за токен в заголовке не делает запуски агента с полным контекстом бесплатными: схемы инструментов, файлы репозитория, токены рассуждений, повторные попытки и долгие выводы — всё это способствует использованию.

Для подробного объяснения бюджетирования контекста и поведения кэша см. DeepSeek V4 1M Context: max_tokens, Billing, and Concurrency.

Это ставки DeepSeek Direct. reAPI имеет собственный контракт продукта и живую карту ставок на странице модели DeepSeek V4. Не копируйте цену вендора в калькулятор стоимости шлюза без проверки маршрута, который вы фактически используете.

Вызов DeepSeek V4 Flash через reAPI

Существующая интеграция reAPI использует то же стабильное имя модели через конечную точку Chat Completions, совместимую с OpenAI:

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "Work through the repository methodically. Return a minimal patch."
      },
      {
        "role": "user",
        "content": "Trace this authentication failure and identify the smallest safe fix."
      }
    ],
    "max_tokens": 8192,
    "reasoning_effort": "high"
  }'

См. документацию API DeepSeek V4 для текущего контракта запроса reAPI. Развёртывание шлюза и развёртывание прямого вендора — это отдельные операционные события, поэтому подтвердите активный маршрут и ответ обнаружения модели, когда приложение зависит от точной редакции 0731.

Кому следует перейти на официальный релиз Flash

Существующие пользователи DeepSeek Direct API не нужно менять ID модели; стабильное имя Flash уже выбирает последнюю версию. Им следует переоценить, потому что поведение изменилось, даже если конфигурация этого не сделала.

Релиз особенно актуален для:

  • команд кодирующих агентов, использующих инструменты терминала, поиска и патчей;
  • разработчиков, которые ранее поддерживали прокси Chat Completions-to-Responses;
  • высокообъёмных рабочих нагрузок, которым нужен меньший активный размер параметров, чем V4 Pro;
  • долгоконтекстных агентов, которые могут извлечь выгоду из автоматического кэширования префиксов;
  • пользователей Codex, готовых работать в пределах документированных ограничений совместимости DeepSeek.

Подождите перед тем, как рассматривать это как замену plug-in, когда ваш рабочий процесс требует понимания изображений, стойких Responses разговоров, фоновых задач, интерпретатора кода, MCP через API или точного соответствия функциям OpenAI. Эти функции отсутствуют или обрабатываются вне конечной точки модели сегодня.[3]

Контрольный список миграции продакшена

  1. Держите deepseek-v4-flash; не придумывайте ID API deepseek-v4-flash-0731, если провайдер явно его не раскрывает.
  2. Переоцените агенты, потому что поведение бэкенда изменилось под стабильным именем.
  3. Зафиксируйте стенд, определения инструментов, уровень рассуждений, бюджет токенов и таймаут при сравнении результатов.
  4. Протестируйте каждое поле Responses API, на которое опирается ваше приложение; несколько неподдерживаемых полей молча игнорируются.
  5. Сохраняйте историю разговора на стороне клиента, потому что previous_response_id не поддерживается.
  6. Отклоняйте или предварительно обрабатывайте входные данные изображения и файла вместо того, чтобы предполагать, что модель может их проверить.
  7. Отслеживайте кэшированный и некэшированный вход отдельно в телеметрии затрат.
  8. Развёртывайте за флагом функции и держите предыдущий маршрут продакшена доступным, пока проходят тесты принятия.

Часто задаваемые вопросы

DeepSeek V4 Flash 0731 — это официальная версия?

Да. DeepSeek называет это официальным релизом V4 Flash, поступающим из публичной беты API с 31 июля 2026 года.[1] "Официальный релиз" описывает редакцию модели; "публичная бета" описывает текущий этап обслуживания.

Нужно ли мне менять имя модели API?

Нет. DeepSeek Direct продолжает использовать deepseek-v4-flash, что теперь маршрутизируется на DeepSeek-V4-Flash-0731.[5]

DeepSeek V4 Flash 0731 — это модель большего размера?

Нет. Она сохраняет архитектуру превью и размер: 284B всего параметров и 13B активированных. Обновление приходит от дополнительного постобучения.[1]

Поддерживает ли официальный релиз Flash Responses API?

Да. DeepSeek предоставляет встроенную поверхность Responses API для Flash и документирует прямую интеграцию Codex.[3][4]

Может ли DeepSeek V4 Flash обрабатывать изображения через Responses API?

Нет. Официальная таблица совместимости говорит, что части входных данных изображения и файла заменены текстом-заполнителем. Рассматривайте конечную точку как текстовый вход.[3]

Был ли DeepSeek V4 Pro обновлён?

Нет. DeepSeek говорит, что обновление 0731 применяется только к Flash API. Pro API и модели App/Web остались неизменными, с официальным релизом Pro запланированным отдельно.[1]

Что на самом деле означает этот релиз

Официальный релиз DeepSeek V4 Flash — это целенаправленный апгрейд агента. Он сохраняет эффективную архитектуру Flash и стабильное имя API, затем меняет часть, которую разработчики ощущают больше всего: использование инструментов, работу терминала, поведение кодирования и интеграцию с клиентами на основе Responses.

Практический заголовок — это не просто рост числовых бенчмарков. deepseek-v4-flash может теперь подключаться прямо к Codex через документированный встроенный протокол. Команды всё ещё должны протестировать щели совместимости, воспроизвести производительность в своих собственных репозиториях и помнить, что сервис находится в публичной бете. Это существенный релиз, но это ещё не полный rollout продуктовой линии DeepSeek V4.

Источники

  1. DeepSeek. Change Log — DeepSeek-V4-Flash Update. July 31, 2026. api-docs.deepseek.com/updates
  2. DeepSeek. DeepSeek-V4-Flash model card — architecture, parameters, context, reasoning modes, and license. Retrieved August 2, 2026 from huggingface.co/deepseek-ai/DeepSeek-V4-Flash
  3. DeepSeek. Using the Responses API — supported fields, tools, streaming, and compatibility limits. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/responses_api
  4. DeepSeek. Integrate with Codex — official provider and model configuration. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/agent_integrations/codex
  5. DeepSeek. Your First API Call — deepseek-v4-flash now routes to the 0731 model. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/function_calling
  6. DeepSeek. Models & Pricing — Flash token rates, context, maximum output, and features. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/pricing
  7. DeepSeek. Rate Limit & Isolation — account-level Flash concurrency. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/rate_limit

Дальнейшее чтение