
Официальный DeepSeek V4 Flash: Responses API и апгрейд агентов
DeepSeek V4 Flash 0731 вышел в публичной бете API с усиленными возможностями агентов, встроенной поддержкой Responses API и интеграцией Codex.
DeepSeek V4 Flash 0731 теперь официальная модель Flash, которую отдаёт API DeepSeek. Обновление от 31 июля 2026 года заменило апрельский превью за тем же ID модели deepseek-v4-flash, добавило встроенную поддержку Responses API и значительно переопределило модель для кодирующих агентов и работы с инструментами. DeepSeek назвала релиз официальным, но сервис API всё ещё помечен как публичная бета.[1]
Это апдейт только для API. DeepSeek V4 Pro, приложение DeepSeek и вебчат не получили апгрейд в рамках релиза 0731. Архитектура тоже не изменилась: Flash остаётся 284-миллиардной моделью mixture-of-experts с 13 млрд активных параметров и контекстным окном в один миллион токенов.[1][2]
TL;DR
- Официальная модель —
DeepSeek-V4-Flash-0731. Существующие вызовы API продолжают использоватьdeepseek-v4-flash; миграция имени модели не требуется.[1] - Это апгрейд постобучения, а не новая архитектура. Общее количество параметров, активные параметры и контекстное окно в 1M остались неизменными.[1][2]
- Производительность агентов — главная новость. DeepSeek сообщает 82,7 на Terminal Bench 2.1, 54,4 на DeepSWE и 70,3 на Toolathlon Verified, используя собственный неопубликованный минимальный стенд и максимальный уровень рассуждений.[1]
- Поддержка Responses API встроена. Flash теперь может подкреплять Codex без прокси преобразования протокола, который требовал превью.[3][4]
- Слой совместимости не полностью соответствует OpenAI. API без состояния, принимает текст вместо входных данных изображения/файла и игнорирует или отклоняет несколько полей Responses API.[3]
- Pro и потребительский чат не изменились. DeepSeek говорит, что официальный релиз V4 Pro выйдет отдельно.[1]
Спецификации DeepSeek V4 Flash 0731
| Параметр | Официальный статус релиза |
|---|---|
| Дата релиза | 31 июля 2026 |
| Статус сервиса | Официальный релиз API в публичной бете |
| ID модели API | deepseek-v4-flash |
| Имя чекпоинта | DeepSeek-V4-Flash-0731 |
| Архитектура | Mixture of experts, без изменений от превью |
| Параметры | 284 млрд всего, 13 млрд активированных |
| Контекстное окно | 1M токенов |
| Максимальный выход | 384K токенов |
| Режимы рассуждений | Без мышления, Think High, Think Max |
| Форматы API | Chat Completions, совместимый с Anthropic, Responses API |
| Вход на Responses API | Текст; входные данные изображения и файла не поддерживаются |
| Открытые веса | MIT-лицензированные веса модели доступны |
Различие между ID модели и именем чекпоинта преднамеренно. DeepSeek-V4-Flash-0731 идентифицирует обновлённые веса, в то время как deepseek-v4-flash — это стабильное имя сервиса, которое приложения отправляют в API.[5] Это позволяет DeepSeek обновлять бэкенд без принуждения каждого разработчика менять конфигурацию продакшена.
Что изменилось с DeepSeek V4 Flash Preview

Релиз 0731 меняет поведение и интеграцию больше, чем сырой масштаб модели.
| Область | Апрельский превью | 0731 официальный Flash |
|---|---|---|
| Архитектура | 284B всего / 13B активный MoE | Без изменений |
| Контекст | 1M токенов | Без изменений |
| ID модели | deepseek-v4-flash | Без изменений |
| Этап обучения | Постобучение превью | Переобучение для официального релиза |
| Способность агента | Сильный общий базовый уровень агента | Основное переопределение для кодирующих агентов и использования инструментов |
| Responses API | Нет встроенной конечной точки | Встроенная поддержка |
| Интеграция Codex | Требовался адаптер или другой совместимый маршрут | Официально документированная прямая конфигурация |
| Область развёртывания | Flash и Pro preview API | Только Flash API |
DeepSeek говорит, что 0731 "был только переобучен в постобучении".[1] Эта фраза легко недооценить. Для моделей агентов постобучение контролирует, планирует ли модель эффективно, вызывает ли правильный инструмент, читает ли результат, восстанавливается ли после отказа и продолжает ли работу до завершения задачи. Архитектура задаёт ёмкость; постобучение определяет, насколько надёжно эта ёмкость появляется внутри работающего агента.
Релиз поэтому не делает модель больше. Он делает существующую модель Flash более полезной для работы с репозиториями, задач в терминале, генерации патчей, поиска и многошаговой автоматизации.
Новые бенчмарки агентов DeepSeek — и как их читать
DeepSeek опубликовала девять оценок для официального релиза:[1]
| Бенчмарк | DeepSeek V4 Flash 0731 |
|---|---|
| Terminal Bench 2.1 | 82,7 |
| NL2Repo | 54,2 |
| CyberGym | 76,7 |
| DeepSWE | 54,4 |
| Toolathlon Verified | 70,3 |
| Agent Last Exam | 25,2 |
| Automation Bench Public | 25,1 |
| DSBench FullStack | 68,7 |
| DSBench Hard | 59,6 |
Эти цифры подтверждают утверждение, что работа с агентами была центром обновления. Они не устанавливают универсальный рейтинг.
DeepSeek использовала собственный "режим минимального стенда", который компания говорит будет выпущен позже, с максимальным уровнем рассуждений, top_p: 0.95 и temperature: 1.0. Два из сообщённых наборов данных — DSBench FullStack и DSBench Hard — являются внутренними.[1] Пока стенд и внутренние задачи не доступны, эти результаты не могут быть независимо воспроизведены полностью.
Для оценки продакшена держите одинаковый набор репозиториев, разрешения инструментов, таймаут, политику повтора, уровень рассуждений и бюджет токенов между моделями. Измеряйте завершённые задачи и принятые патчи, не только то, произвела ли модель правдоподобный diff.
Встроенный Responses API — самое важное изменение для разработчиков
DeepSeek V4 Flash теперь принимает формат Responses API на стандартном базовом URL DeepSeek. Это удаляет значительный разрыв интеграции для Codex и других клиентов, построенных вокруг /v1/responses вместо Chat Completions.[3]
Минимальный прямой вызов использует OpenAI SDK:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="Review code conservatively and explain every proposed edit.",
input="Find the race condition in this queue worker.",
reasoning={"effort": "high"},
max_output_tokens=8_192,
)
print(response.output_text)Потоковая передача возвращает семантические события, такие как response.output_text.delta, response.function_call_arguments.delta и response.completed. В отличие от знакомого потока Chat Completions, он не заканчивается на data: [DONE].[3]
Встроенная поддержка важна, потому что адаптер больше не должен переводить вызовы инструментов, события рассуждений и элементы выхода между двумя форматами проводов. Меньше слоёв трансляции означает меньше мест, где ID вызовов инструментов, состояние потока или история рассуждений могут сломаться.
Совместимость Responses API имеет важные ограничения
"Встроенный Responses API" не означает, что каждая функция OpenAI Responses работает. DeepSeek подробно документирует границу совместимости.[3]
Поддерживаемые функции включают:
- текстовый вход и инструкции разработчика/системы;
- потоковую передачу;
- инструменты функций и поиск в вебе на стороне сервера;
- обязательный или специфический выбор инструмента;
- уровень рассуждений;
- структурированные текстовые форматы;
- пользовательский инструмент
apply_patch, используемый для совместимости с Codex.
Важные ограничения включают:
previous_response_idиconversationне поддерживаются, поэтому API без состояния;store, фоновый режим, метаданные, шаблоны подсказок и уровни обслуживания не поддерживаются;- элементы входных данных изображения и файла заменены текстом-заполнителем вместо обработки;
- MCP, использование компьютера, интерпретатор кода и инструменты поиска файлов игнорируются;
parallel_tool_callsигнорируется, потому что параллельное использование инструментов всегда включено;- запросы, превышающие контекстное окно, возвращают HTTP 400 вместо автоматического усечения.
Некоторые неподдерживаемые параметры молча игнорируются. Это облегчает начальное подключение, но это также означает, что запрос может вернуться успешно без учёта каждого контроля, который отправило ваше приложение. Тесты интеграции должны проверять поведение, а не только статус HTTP.
Как использовать DeepSeek V4 Flash 0731 с Codex
DeepSeek теперь опубликовала выделенное руководство конфигурации Codex. По состоянию на 2 августа поддерживается только Flash; поддержка V4 Pro ожидается отдельно.[4]
Официальная установка создаёт провайдера DeepSeek в ~/.codex/config.toml и каталог моделей в ~/.codex/models.json. Важные значения во время выполнения:
model = "deepseek-v4-flash"
model_provider = "deepseek"
[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
wire_api = "responses"
env_key = "DEEPSEEK_API_KEY"Каталог DeepSeek даёт Flash максимальный контекст в 1 048 576 токенов, включает параллельные вызовы инструментов и раскрывает низкие, высокие и максимальные уровни рассуждений.[4] Держите ключ API в переменной окружения вместо того, чтобы писать его в общий файл конфигурации.
Для работы с репозиториями начните с рассуждений high. Переходите на max только для задач, которые оправдывают дополнительную задержку и выходные токены, таких как кроссервисная миграция или сложная перемежающаяся ошибка.
Цены и ограничения контекста не получили новый уровень релиза
Текущий прайс-лист DeepSeek Direct указывает Flash на:[6]
| Категория токена | Цена за 1M токенов |
|---|---|
| Кэшированный вход | $0,0028 |
| Некэшированный вход | $0,14 |
| Выход | $0,28 |
Flash сохраняет общее контекстное окно в 1M, максимальный выход в 384K и ограничение параллелизма на уровне аккаунта в 2500.[6][7] Низкая цена за токен в заголовке не делает запуски агента с полным контекстом бесплатными: схемы инструментов, файлы репозитория, токены рассуждений, повторные попытки и долгие выводы — всё это способствует использованию.
Для подробного объяснения бюджетирования контекста и поведения кэша см. DeepSeek V4 1M Context: max_tokens, Billing, and Concurrency.
Это ставки DeepSeek Direct. reAPI имеет собственный контракт продукта и живую карту ставок на странице модели DeepSeek V4. Не копируйте цену вендора в калькулятор стоимости шлюза без проверки маршрута, который вы фактически используете.
Вызов DeepSeek V4 Flash через reAPI
Существующая интеграция reAPI использует то же стабильное имя модели через конечную точку Chat Completions, совместимую с OpenAI:
curl https://api.reapi.ai/v1/chat/completions \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "Work through the repository methodically. Return a minimal patch."
},
{
"role": "user",
"content": "Trace this authentication failure and identify the smallest safe fix."
}
],
"max_tokens": 8192,
"reasoning_effort": "high"
}'См. документацию API DeepSeek V4 для текущего контракта запроса reAPI. Развёртывание шлюза и развёртывание прямого вендора — это отдельные операционные события, поэтому подтвердите активный маршрут и ответ обнаружения модели, когда приложение зависит от точной редакции 0731.
Кому следует перейти на официальный релиз Flash
Существующие пользователи DeepSeek Direct API не нужно менять ID модели; стабильное имя Flash уже выбирает последнюю версию. Им следует переоценить, потому что поведение изменилось, даже если конфигурация этого не сделала.
Релиз особенно актуален для:
- команд кодирующих агентов, использующих инструменты терминала, поиска и патчей;
- разработчиков, которые ранее поддерживали прокси Chat Completions-to-Responses;
- высокообъёмных рабочих нагрузок, которым нужен меньший активный размер параметров, чем V4 Pro;
- долгоконтекстных агентов, которые могут извлечь выгоду из автоматического кэширования префиксов;
- пользователей Codex, готовых работать в пределах документированных ограничений совместимости DeepSeek.
Подождите перед тем, как рассматривать это как замену plug-in, когда ваш рабочий процесс требует понимания изображений, стойких Responses разговоров, фоновых задач, интерпретатора кода, MCP через API или точного соответствия функциям OpenAI. Эти функции отсутствуют или обрабатываются вне конечной точки модели сегодня.[3]
Контрольный список миграции продакшена
- Держите
deepseek-v4-flash; не придумывайте ID APIdeepseek-v4-flash-0731, если провайдер явно его не раскрывает. - Переоцените агенты, потому что поведение бэкенда изменилось под стабильным именем.
- Зафиксируйте стенд, определения инструментов, уровень рассуждений, бюджет токенов и таймаут при сравнении результатов.
- Протестируйте каждое поле Responses API, на которое опирается ваше приложение; несколько неподдерживаемых полей молча игнорируются.
- Сохраняйте историю разговора на стороне клиента, потому что
previous_response_idне поддерживается. - Отклоняйте или предварительно обрабатывайте входные данные изображения и файла вместо того, чтобы предполагать, что модель может их проверить.
- Отслеживайте кэшированный и некэшированный вход отдельно в телеметрии затрат.
- Развёртывайте за флагом функции и держите предыдущий маршрут продакшена доступным, пока проходят тесты принятия.
Часто задаваемые вопросы
DeepSeek V4 Flash 0731 — это официальная версия?
Да. DeepSeek называет это официальным релизом V4 Flash, поступающим из публичной беты API с 31 июля 2026 года.[1] "Официальный релиз" описывает редакцию модели; "публичная бета" описывает текущий этап обслуживания.
Нужно ли мне менять имя модели API?
Нет. DeepSeek Direct продолжает использовать deepseek-v4-flash, что теперь маршрутизируется на DeepSeek-V4-Flash-0731.[5]
DeepSeek V4 Flash 0731 — это модель большего размера?
Нет. Она сохраняет архитектуру превью и размер: 284B всего параметров и 13B активированных. Обновление приходит от дополнительного постобучения.[1]
Поддерживает ли официальный релиз Flash Responses API?
Да. DeepSeek предоставляет встроенную поверхность Responses API для Flash и документирует прямую интеграцию Codex.[3][4]
Может ли DeepSeek V4 Flash обрабатывать изображения через Responses API?
Нет. Официальная таблица совместимости говорит, что части входных данных изображения и файла заменены текстом-заполнителем. Рассматривайте конечную точку как текстовый вход.[3]
Был ли DeepSeek V4 Pro обновлён?
Нет. DeepSeek говорит, что обновление 0731 применяется только к Flash API. Pro API и модели App/Web остались неизменными, с официальным релизом Pro запланированным отдельно.[1]
Что на самом деле означает этот релиз
Официальный релиз DeepSeek V4 Flash — это целенаправленный апгрейд агента. Он сохраняет эффективную архитектуру Flash и стабильное имя API, затем меняет часть, которую разработчики ощущают больше всего: использование инструментов, работу терминала, поведение кодирования и интеграцию с клиентами на основе Responses.
Практический заголовок — это не просто рост числовых бенчмарков. deepseek-v4-flash может теперь подключаться прямо к Codex через документированный встроенный протокол. Команды всё ещё должны протестировать щели совместимости, воспроизвести производительность в своих собственных репозиториях и помнить, что сервис находится в публичной бете. Это существенный релиз, но это ещё не полный rollout продуктовой линии DeepSeek V4.
Источники
- DeepSeek. Change Log — DeepSeek-V4-Flash Update. July 31, 2026. api-docs.deepseek.com/updates
- DeepSeek. DeepSeek-V4-Flash model card — architecture, parameters, context, reasoning modes, and license. Retrieved August 2, 2026 from huggingface.co/deepseek-ai/DeepSeek-V4-Flash
- DeepSeek. Using the Responses API — supported fields, tools, streaming, and compatibility limits. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/responses_api
- DeepSeek. Integrate with Codex — official provider and model configuration. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/agent_integrations/codex
- DeepSeek. Your First API Call —
deepseek-v4-flashnow routes to the 0731 model. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/function_calling - DeepSeek. Models & Pricing — Flash token rates, context, maximum output, and features. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/pricing
- DeepSeek. Rate Limit & Isolation — account-level Flash concurrency. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/rate_limit
Дальнейшее чтение
- reAPI. Страница модели DeepSeek V4 и живая цена шлюза. reapi.ai/models/deepseek-v4
- reAPI. Справочник API DeepSeek V4. reapi.ai/docs/deepseek-v4
- reAPI. MiniMax M3 API: 1M Context, Pricing, and Coding Guide. reapi.ai/blog/minimax-m3-api-guide
Автор

Категории
Ещё статьи

Планы Seedance 2.5 Unlimited: проверяем расчёты
Разбираем безлимитный план Seedance 2.5 по модели, окну, очереди, параллелизму и длительности, затем сравниваем со стоимостью поминутной оплаты.


Контекстное окно Claude: размер и из чего оно состоит
На текущих моделях Claude контекстное окно составляет 1M токенов, но определения инструментов, логика мышления и кеш его потребляют. Больше не означает лучше.


Цены API FLUX 3 Video: черновик, HD, FHD и продолжение
Рассчитай стоимость FLUX 3 Video в режимах черновика, HD, FHD, ключевых кадров и продолжения, включая рабочий процесс черновик-финал и итоги на 5–20 секунд.
