Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
DeepSeek V4 Flash 0731 정식 출시: 에이전트와 Codex 통합
2026/08/02

DeepSeek V4 Flash 0731 정식 출시: 에이전트와 Codex 통합

DeepSeek V4 Flash 0731 공개 베타: 에이전트 벤치마크 개선, 네이티브 Responses API, Codex 통합, 기존 모델 ID 유지.

DeepSeek V4 Flash 0731은 이제 DeepSeek API가 제공하는 공식 Flash 모델입니다. 2026년 7월 31일의 업데이트는 기존의 deepseek-v4-flash 모델 ID 뒤에 있던 4월 프리뷰를 교체하고, 네이티브 Responses API 지원을 추가하며, 코딩 에이전트와 도구 기반 작업을 위해 모델을 대폭 재조정했습니다. DeepSeek은 이 출시를 공식이라고 부르지만, API 서비스는 여전히 공개 베타로 표시되어 있습니다.[1]

이것은 API만의 롤아웃입니다. DeepSeek V4 Pro, DeepSeek 앱, 웹 채팅은 0731 출시의 일부로 업그레이드되지 않았습니다. 아키텍처도 변하지 않았습니다. Flash는 여전히 284B 파라미터의 혼합 전문가 모델로 13B개의 활성 파라미터와 100만 토큰의 컨텍스트 윈도우를 유지합니다.[1][2]

TL;DR

  • 공식 모델은 DeepSeek-V4-Flash-0731입니다. 기존 API 호출은 deepseek-v4-flash를 계속 사용하며, 모델 이름 마이그레이션이 필요하지 않습니다.[1]
  • 이것은 새로운 아키텍처가 아닌 사후 훈련 업그레이드입니다. 총 파라미터, 활성 파라미터, 100만 토큰 컨텍스트 윈도우는 변경되지 않았습니다.[1][2]
  • 에이전트 성능이 핵심입니다. DeepSeek은 Terminal Bench 2.1에서 82.7, DeepSWE에서 54.4, Toolathlon Verified에서 70.3을 보고했으며, 미공개 최소 하네스와 최대 추론 노력을 사용했습니다.[1]
  • Responses API 지원은 네이티브입니다. Flash는 이제 프리뷰가 필요로 했던 프로토콜 변환 프록시 없이 Codex를 지원할 수 있습니다.[3][4]
  • 호환성 계층은 완전한 OpenAI 패리티가 아닙니다. API는 상태가 없고, 이미지/파일 입력보다는 텍스트를 허용하며, 여러 Responses API 필드를 무시하거나 거부합니다.[3]
  • Pro와 소비자 채팅은 변경되지 않았습니다. DeepSeek은 공식 V4 Pro 출시가 별도로 진행될 것이라고 말합니다.[1]

DeepSeek V4 Flash 0731 사양

항목공식 출시 상태
출시 날짜2026년 7월 31일
서비스 상태공개 베타의 공식 API 출시
API 모델 IDdeepseek-v4-flash
체크포인트 이름DeepSeek-V4-Flash-0731
아키텍처혼합 전문가, 프리뷰에서 변경 없음
파라미터284B 총합, 13B 활성화됨
컨텍스트 윈도우100만 토큰
최대 출력384K 토큰
추론 모드비사고형, Think High, Think Max
API 형식Chat Completions, Anthropic 호환, Responses API
Responses API 입력텍스트만 제공, 이미지 및 파일 입력 미지원
공개 가중치MIT 라이선스 모델 가중치 사용 가능

모델 ID와 체크포인트 이름의 구분은 의도적입니다. DeepSeek-V4-Flash-0731은 업데이트된 가중치를 식별하며, deepseek-v4-flash는 애플리케이션이 API에 전송하는 안정적인 서비스 이름입니다.[5] 이를 통해 DeepSeek은 모든 개발자가 프로덕션 구성을 변경하지 않도록 백엔드를 업데이트할 수 있습니다.

DeepSeek V4 Flash 프리뷰에서 변경된 사항

DeepSeek V4 Flash 0731 업그레이드 맵은 변경되지 않은 아키텍처, 새로운 사후 훈련, 더 강력한 에이전트 동작, 네이티브 Responses API 지원을 보여줍니다

0731 출시는 원시 모델 규모보다는 동작과 통합을 더 변경합니다.

영역4월 프리뷰0731 공식 Flash
아키텍처284B 총합 / 13B 활성 MoE변경 없음
컨텍스트100만 토큰변경 없음
모델 IDdeepseek-v4-flash변경 없음
훈련 단계프리뷰 사후 훈련공식 출시를 위한 재사후 훈련
에이전트 기능강력한 일반 에이전트 기준주요 코딩 에이전트 및 도구 사용 재조정
Responses API네이티브 엔드포인트 없음네이티브 지원
Codex 통합어댑터 또는 다른 호환 경로 필요공식 문서화된 직접 구성
롤아웃 범위Flash 및 Pro 프리뷰 APIFlash API만

DeepSeek은 0731이 "재사후 훈련만 하였다"고 말합니다.[1] 이 표현은 과소평가하기 쉽습니다. 에이전트 모델의 경우, 사후 훈련은 모델이 효과적으로 계획하는지, 올바른 도구를 호출하는지, 결과를 읽는지, 실패에서 복구하는지, 작업이 완료될 때까지 계속하는지 여부를 결정합니다. 아키텍처는 용량을 설정하고 사후 훈련은 작동하는 에이전트 내에서 그 용량이 얼마나 안정적으로 나타나는지를 결정합니다.

따라서 이 출시는 모델을 더 크게 만들지 않습니다. 기존 Flash 모델을 리포지토리 작업, 터미널 작업, 패치 생성, 검색, 다단계 자동화에 더 유용하게 만듭니다.

DeepSeek의 새로운 에이전트 벤치마크—그리고 이를 읽는 방법

DeepSeek은 공식 출시를 위해 9개의 점수를 발표했습니다:[1]

벤치마크DeepSeek V4 Flash 0731
Terminal Bench 2.182.7
NL2Repo54.2
CyberGym76.7
DeepSWE54.4
Toolathlon Verified70.3
Agent Last Exam25.2
Automation Bench Public25.1
DSBench FullStack68.7
DSBench Hard59.6

이 수치들은 에이전트 작업이 업데이트의 초점이었다는 주장을 뒷받침합니다. 이들은 보편적인 순위를 확립하지는 않습니다.

DeepSeek은 자신의 "하네스 최소 모드"를 사용했으며, 회사는 나중에 출시될 것이라고 말했고, 최대 추론 노력, top_p: 0.95, temperature: 1.0을 사용했습니다. 보고된 데이터 세트 중 두 개인 DSBench FullStack과 DSBench Hard는 내부 데이터입니다.[1] 하네스와 내부 작업을 사용할 수 있을 때까지, 이러한 결과는 끝까지 독립적으로 재현될 수 없습니다.

프로덕션 평가를 위해, 모델 간에 동일한 리포지토리 집합, 도구 권한, 타임아웃, 재시도 정책, 추론 노력, 토큰 예산을 유지하십시오. 완료된 작업과 수락된 패치를 측정하되, 에이전트가 그럴듯한 diff를 생성했는지만 측정하지는 마십시오.

네이티브 Responses API는 가장 중요한 개발자 변경입니다

DeepSeek V4 Flash는 이제 표준 DeepSeek 기본 URL에서 Responses API 형식을 허용합니다. 이는 Chat Completions보다는 /v1/responses를 중심으로 구축된 Codex 및 기타 클라이언트에 대한 중대한 통합 격차를 제거합니다.[3]

최소한의 직접 호출은 OpenAI SDK를 사용합니다:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="Review code conservatively and explain every proposed edit.",
    input="Find the race condition in this queue worker.",
    reasoning={"effort": "high"},
    max_output_tokens=8_192,
)

print(response.output_text)

스트리밍은 response.output_text.delta, response.function_call_arguments.delta, response.completed와 같은 의미론적 이벤트를 반환합니다. 익숙한 Chat Completions 스트림과 달리 data: [DONE]으로 끝나지 않습니다.[3]

네이티브 지원은 어댑터가 더 이상 도구 호출, 추론 이벤트, 출력 항목을 두 가지 와이어 형식 간에 변환할 필요가 없다는 의미이기 때문에 중요합니다. 더 적은 번역 계층은 도구 호출 ID, 스트리밍 상태 또는 추론 기록이 손상될 장소가 더 적다는 의미입니다.

Responses API 호환성에는 중요한 제한이 있습니다

"네이티브 Responses API"는 모든 OpenAI Responses 기능이 작동한다는 의미는 아닙니다. DeepSeek은 호환성 경계를 자세히 문서화합니다.[3]

지원되는 기능은 다음을 포함합니다:

  • 텍스트 입력 및 개발자/시스템 지시사항;
  • 스트리밍;
  • 함수 도구 및 서버 측 웹 검색;
  • 필수 또는 특정 도구 선택;
  • 추론 노력;
  • 구조화된 텍스트 형식;
  • Codex 호환성을 위해 사용되는 apply_patch 사용자 정의 도구.

중요한 제한사항은 다음을 포함합니다:

  • previous_response_idconversation은 지원되지 않으므로 API는 상태가 없습니다;
  • store, 백그라운드 모드, 메타데이터, 프롬프트 템플릿, 서비스 티어는 지원되지 않습니다;
  • 이미지 및 파일 입력 항목은 플레이스홀더 텍스트로 바뀝니다;
  • MCP, 컴퓨터 사용, 코드 인터프리터, 파일 검색 도구는 무시됩니다;
  • parallel_tool_calls는 병렬 도구 사용이 항상 활성화되기 때문에 무시됩니다;
  • 컨텍스트 윈도우를 초과하는 요청은 자동으로 잘리지 않고 HTTP 400을 반환합니다.

일부 지원되지 않는 매개변수는 자동으로 무시됩니다. 이는 초기 연결을 더 쉽게 만들지만, 요청이 애플리케이션이 전송한 모든 제어를 따르지 않고도 성공적으로 반환될 수 있다는 의미이기도 합니다. 통합 테스트는 HTTP 상태만이 아니라 동작을 확인해야 합니다.

DeepSeek V4 Flash 0731을 Codex와 함께 사용하는 방법

DeepSeek은 이제 전용 Codex 구성 가이드를 발행합니다. 8월 2일 기준으로 Flash만 지원되며, V4 Pro 지원은 별도로 예상됩니다.[4]

공식 설정은 ~/.codex/config.toml에서 DeepSeek 제공자를 만들고 ~/.codex/models.json에서 모델 카탈로그를 만듭니다. 중요한 런타임 값은 다음과 같습니다:

model = "deepseek-v4-flash"
model_provider = "deepseek"

[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
wire_api = "responses"
env_key = "DEEPSEEK_API_KEY"

DeepSeek의 카탈로그는 Flash에 1,048,576 토큰 최대 컨텍스트를 제공하고, 병렬 도구 호출을 활성화하며, 낮음, 높음, 최대 추론 수준을 노출합니다.[4] API 키를 공유 구성 파일에 작성하기보다는 환경 변수에 보관하십시오.

리포지토리 작업의 경우, high 추론으로 시작하십시오. 서비스 간 마이그레이션이나 어려운 산발적 버그와 같이 추가 지연 및 출력 토큰을 정당화하는 작업에 대해서만 max로 이동하십시오.

가격 책정과 컨텍스트 제한은 새로운 출시 티어를 받지 않았습니다

현재 DeepSeek Direct 가격표는 Flash를 다음과 같이 나열합니다:[6]

토큰 카테고리100만 토큰당 가격
캐시된 입력$0.0028
캐시되지 않은 입력$0.14
출력$0.28

Flash는 100만 토큰 공유 컨텍스트 윈도우, 384K 최대 출력, 계정 수준 2,500 동시성 제한을 유지합니다.[6][7] 낮은 헤드라인 토큰 가격은 최대 컨텍스트 에이전트 실행을 무료로 만들지는 않습니다: 도구 스키마, 리포지토리 파일, 추론 토큰, 재시도 및 긴 출력은 모두 사용에 기여합니다.

컨텍스트 예산 책정 및 캐시 동작에 대한 자세한 설명은 DeepSeek V4 100만 컨텍스트: max_tokens, 가격 책정 및 동시성을 참조하십시오.

이는 DeepSeek Direct 요금입니다. reAPI는 DeepSeek V4 모델 페이지의 자체 제품 계약 및 실시간 요금표를 가집니다. 게이트웨이 비용 계산기에 벤더 가격을 복사하지 마시고 실제로 사용 중인 경로를 확인하세요.

reAPI를 통해 DeepSeek V4 Flash 호출

기존 reAPI 통합은 OpenAI 호환 Chat Completions 엔드포인트를 통해 동일한 안정적인 모델 이름을 사용합니다:

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "Work through the repository methodically. Return a minimal patch."
      },
      {
        "role": "user",
        "content": "Trace this authentication failure and identify the smallest safe fix."
      }
    ],
    "max_tokens": 8192,
    "reasoning_effort": "high"
  }'

현재 reAPI 요청 계약은 DeepSeek V4 API 문서를 참조하세요. 게이트웨이 롤아웃과 벤더 직접 롤아웃은 별개의 운영 이벤트이므로, 애플리케이션이 정확한 0731 수정 버전에 의존할 때 활성 경로 및 모델 검색 응답을 확인하십시오.

누가 공식 Flash 출시로 전환해야 합니까?

기존 DeepSeek Direct API 사용자는 모델 ID를 전환할 필요가 없습니다. 안정적인 Flash 이름은 이미 최신 버전을 선택합니다. 그들은 구성이 변경되지 않았더라도 동작이 변경되었기 때문에 평가를 다시 실행해야 합니다.

이 출시는 특히 다음에 관련이 있습니다:

  • 터미널, 검색, 패치 도구를 사용하는 코딩 에이전트 팀;
  • 이전에 Chat Completions-to-Responses 프록시를 유지 관리한 개발자;
  • V4 Pro보다 더 작은 활성 파라미터 풋프린트가 필요한 고용량 워크로드;
  • 자동 접두사 캐싱의 이점을 얻을 수 있는 긴 컨텍스트 에이전트;
  • DeepSeek의 문서화된 호환성 제한 내에서 운영할 의향이 있는 Codex 사용자.

워크플로우가 이미지 이해, 지속적인 Responses 대화, 백그라운드 작업, 코드 인터프리터, API를 통한 MCP 또는 정확한 OpenAI 기능 패리티를 필요로 하는 경우 드롭인 대체로 취급하기 전에 기다리십시오. 이러한 기능은 현재 없거나 모델 엔드포인트 외부에서 처리됩니다.[3]

프로덕션 마이그레이션 체크리스트

  1. deepseek-v4-flash를 유지하고 deepseek-v4-flash-0731 API ID를 만들지 마십시오 (제공자가 명시적으로 노출하지 않는 한).
  2. 백엔드 동작이 안정적인 이름 아래서 변경되었기 때문에 에이전트 평가를 다시 실행하십시오.
  3. 하네스, 도구 정의, 추론 노력, 토큰 예산, 타임아웃을 고정하십시오.
  4. 애플리케이션이 의존하는 모든 Responses API 필드를 테스트하십시오. 지원되지 않는 여러 필드는 자동으로 무시됩니다.
  5. 클라이언트 측에서 대화 기록을 유지하십시오. previous_response_id는 지원되지 않습니다.
  6. 모델이 검사할 수 있다고 가정하기보다는 이미지 및 파일 입력을 거부하거나 전처리하십시오.
  7. 비용 원격 측정에서 캐시되고 캐시되지 않은 입력을 별도로 추적하십시오.
  8. 기능 플래그 뒤에 배포하고 수락 테스트가 통과할 때까지 이전 프로덕션 경로를 사용 가능하게 유지하십시오.

자주 묻는 질문

DeepSeek V4 Flash 0731이 공식 버전인가요?

네. DeepSeek은 이를 공식 V4 Flash 출시라고 부르며, 2026년 7월 31일부터 공개 베타 API를 통해 제공됩니다.[1] "공식 출시"는 모델 수정 버전을 설명하고 "공개 베타"는 현재 서비스 단계를 설명합니다.

API 모델 이름을 변경해야 합니까?

아니요. DeepSeek Direct는 계속해서 deepseek-v4-flash를 사용하며, 이는 이제 DeepSeek-V4-Flash-0731으로 라우팅됩니다.[5]

DeepSeek V4 Flash 0731이 더 큰 모델입니까?

아니요. 프리뷰 아키텍처 및 크기를 유지합니다: 284B 총 파라미터 및 13B 활성화됨. 업데이트는 추가 사후 훈련에서 나옵니다.[1]

공식 Flash 출시는 Responses API를 지원합니까?

네. DeepSeek은 Flash에 대한 네이티브 Responses API 표면을 제공하고 직접 Codex 통합을 문서화합니다.[3][4]

DeepSeek V4 Flash가 Responses API를 통해 이미지를 처리할 수 있습니까?

아니요. 공식 호환성 표에는 이미지 및 파일 입력 부분이 플레이스홀더 텍스트로 바뀐다고 나와 있습니다. 엔드포인트를 텍스트 입력으로 취급하십시오.[3]

DeepSeek V4 Pro도 업그레이드되었습니까?

아니요. DeepSeek은 0731 업데이트가 Flash API에만 적용된다고 말합니다. Pro API와 App/Web 모델은 변경되지 않았으며, 공식 Pro 출시가 별도로 계획되어 있습니다.[1]

이 출시가 실제로 의미하는 바

DeepSeek V4 Flash 공식 출시는 초점을 맞춘 에이전트 업그레이드입니다. 효율적인 Flash 아키텍처와 안정적인 API 이름을 유지한 다음 개발자가 가장 많이 느끼는 부분을 변경합니다: 도구 사용, 터미널 작업, 코딩 동작, Responses 기반 클라이언트와의 통합입니다.

실제 헤드라인은 단지 벤치마크 수치가 상승했다는 것이 아닙니다. deepseek-v4-flash는 이제 문서화된 네이티브 프로토콜을 통해 Codex에 직접 플러그인될 수 있습니다. 팀은 호환성 격차를 여전히 테스트하고, 자신의 리포지토리에서 성능을 재현하며, 서비스가 공개 베타에 있다는 것을 기억해야 합니다. 이것은 상당한 출시이지만, 아직 전체 DeepSeek V4 제품 라인 롤아웃이 아닙니다.

참고

  1. DeepSeek. Change Log — DeepSeek-V4-Flash Update. July 31, 2026. api-docs.deepseek.com/updates
  2. DeepSeek. DeepSeek-V4-Flash model card — architecture, parameters, context, reasoning modes, and license. Retrieved August 2, 2026 from huggingface.co/deepseek-ai/DeepSeek-V4-Flash
  3. DeepSeek. Using the Responses API — supported fields, tools, streaming, and compatibility limits. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/responses_api
  4. DeepSeek. Integrate with Codex — official provider and model configuration. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/agent_integrations/codex
  5. DeepSeek. Your First API Call — deepseek-v4-flash now routes to the 0731 model. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/function_calling
  6. DeepSeek. Models & Pricing — Flash token rates, context, maximum output, and features. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/pricing
  7. DeepSeek. Rate Limit & Isolation — account-level Flash concurrency. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/rate_limit

추가 읽기