2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.

DeepSeek V4-Flash-0731 정식판 평가: 벤치마크·가격 비교

리드: 7월 말 DeepSeek changelog를 추적했다면 역설적 사실을 발견했을 겁니다——신규 모델 출시 없음, 동일 284B V4-Flash의 후훈련만 교체했는데 Agent 벤치에서 자사 1.6T V4-Pro 프리뷰를 역전, API 가격은 Claude Opus 4.8의 수십 분의 일. 본문은 조사 소스 전 항목 반영: 4~8월 타임라인, 핵심 가격표, 후훈련·Harness 분해, 중국 오픈소스 6자 횡비교, 논쟁 경고, 「참살선(斩杀线)」 인사이트, 5단계 도입·FAQ.

30초 요약 · TL;DR

출시2026-07-31 V4-Flash-0731 정식 API 공개 베타 · API 전용, App/웹 미동기화
아키텍처284B / 13B 활성, 4월 프리뷰와 동일 · 성능 향상은 후훈련만
가격입력 $0.14(캐시 미스) / $0.0028(히트) · 출력 $0.28/M
AgentTerminal Bench 2.0 82.7(벤더 자보 + Harness 미니멀 모드) · V4-Pro 프리뷰 67.9 역전
미출시V4-Pro 정식판 · 자체 Agent 프레임워크 Harness · 확정일 없음

1. 왜 0731이 주목되는가

  1. 플래그십 Pro 지연 vs Flash 「격상」. 커뮤니티는 양원봉(梁文锋)을 「양백개」(공약 불이행)로 조롱——V4-Pro 정식판 7월 중순 GA 예상이 연기. 7/31 더 작은 Flash 0731이 Pro 프리뷰 Agent 점수 역전, 여론은 「양성(梁圣)」으로 반전했으나 Pro·Harness 일정은 불명.
  2. 점수는 좋지만 프레임워크 민감. 공식 Terminal Bench 2.0(82.7) 등 Agent 점수 전부 미공개 Harness 「미니멀 모드」 측정. 공식 경고: 「점수는 harness 선택에 매우 민감」——Claude Code/Cursor 실사용과 동치 아님.
  3. API 전용 업데이트, 소비자端 지연. 이번 베타는 API만, App·웹 미갱신. chat.deepseek.com 체감 변화 없어도 모순 아님——개발자·일반 사용자 버전 리듬이 다름.

2. 타임라인: 4월 프리뷰→7월 「정식판」

일자이벤트
2026-04-24DeepSeek-V4 프리뷰 최초 공개·오픈소스(MIT). V4-Pro(1.6T/49B 활성)·V4-Flash(284B/13B 활성), 1M 컨텍스트
2026-07-24구 인터페이스 deepseek-chat·deepseek-reasoner 공식 중단, V4 명명으로 전환
2026-07-27월지암면(Moonshot) Kimi K3(2.8T) Hugging Face 오픈웨이트 공개, DeepSeek 경쟁 압박
2026-07-31V4-Flash-0731 정식 API 베타, 웨이트 HF 동기화. changelog에서 자체 Agent 프레임워크 「Harness」 최초 언급, V4 정식판과 함께 곧 공개 예정
2026-08-05 기준V4-Pro 정식판 여전히 「가능한 한 빨리」. 일부 매체 익명 소스 8/10–8/20 GA 보도——공식 미확인·참고용

3. 핵심 데이터

모델상태총/활성 파라미터컨텍스트입력가(미스/히트, $/M)출력가($/M)라이선스
V4-Flash-0731정식(07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro프리뷰(04-24, 정식 미출시)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3웨이트 공개(07-27)2.8T / ~104B(커뮤니티 추정)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2오픈(2026년 6월)~744B / ~40B1M본문 미확인본문 미확인MIT
Qwen3.8-MaxAPI GA(08-02), 웨이트 대기2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00오픈 약속

가격은 벤더 공개 데이터. DeepSeek는 API 「피크 시간 2배 요금」(베이징 9–12시·14–18시) 예고, 발효일 미공개.

4. 심층 분석: 성능은 어떻게 「나왔나」

4.1 아키텍처 불변, 후훈련만 변경

V4-Flash-0731은 파라미터 규모·구조 모두 4월 프리뷰와 동일, 공식: 성능 향상 「완전히 재실시한 후훈련에서 비롯」. 284B/13B Flash가 1.6T/49B V4-Pro 프리뷰를 다수 Agent 벤치에서 역전——2026 하반기 LLM 경쟁에서 후훈련 품질이 단순 스케일링에 근접·초과.

4.2 하이브리드 어텐션: CSA+HCA, mHC, Muon

기술 보고서 《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》 핵심 3변경:

  1. 하이브리드 어텐션: 압축 희소 어텐션(CSA)+고도 압축 어텐션(HCA), 대외 「DSA 희소 어텐션」——장컨텍스트 연산·VRAM 절감;
  2. 다양체 제약 하이퍼커넥션(mHC): 잔차 연결 개선;
  3. Muon 옵티마이저: 수렴·안정성 향상.

공식 지표: 1M 토큰에서 V4-Pro 단일 토큰 FLOPs V3.2의 27%, KV Cache 10%(벤더 자보, 독립 재현 미확인).

4.3 자체 Agent 프레임워크 Harness 최초 공개

7/31 changelog 「DeepSeek Harness」——Claude Code 대응 Agent 실행 프레임워크, 파일 I/O·도구 호출·E2E 엔지니어링. 기존 Claude Code·OpenCode 의존. 공식 Agent 점수 전부 Harness 「미니멀 모드」, max·top_p=0.95·temperature=1.0. 공식: 「점수는 harness 선택에 매우 민감, 모델 능력 향상과 동치 아님.」

5. 횡비교: 중국 오픈소스 LLM 6자 혼전

모델출시/웨이트총 파라미터AA Intelligence Index단일 태스크 비용(AA)
V4-Flash-0731DeepSeek07-31 정식284B50$0.03
Kimi K3월지암면07-16 프리뷰 / 07-27 웨이트2.8T57$0.86
GLM-5.2智谱/Z.ai2026년 6월~744BFlash 대비 ~1점↑본문 미확인
Qwen3.8-Max阿里08-02 GA(웨이트 대기)2.4T본문 미확인본문 미확인
GPT-5.6 SolOpenAI폐쇄비공개Flash 대비 9점+↑$1.86
Claude Fable 5Anthropic폐쇄비공개Flash 대비 9점+↑$3.15

출처: Intelligence Index·단일 태스크 비용 Artificial Analysis(독립). DeepSeek Agent 점수 벤더 자보, 방법론 상이——직접 합산 비교 불가.

대비 선명: AA 종합지수에서 V4-Flash 최고 아님, Kimi K3·GLM-5.2에 열세. 그러나 단일 태스크 비용 Kimi K3의 약 1/29, GPT-5.6 Sol 1/62, Claude Fable 5 1/105. DeepSeek 목표는 「1위 점수」가 아닌 「충분한 지능+극한 가격」——V4-Flash 프리뷰 OpenRouter 7주 연속 호출량 1위의 이유.

6. 논쟁점: 점수는 좋지만 수분도 있다

  • Harness 의존, 공식도 경고. Terminal Bench 2.0(82.7 vs Pro 67.9) 미공개 Harness 미니멀 모드——「벤더 자보+특정 프레임워크」로 취급.
  • 해외 개발자 실사용 이슈. 21세기경제보도 인용: 입력 캐시 히트율 저조, 안전 분류기 간헐 타임아웃.
  • V4-Pro·Harness 일정 미확인. 「8/10–20 GA」 익명 소스 보도, 공식 changelog는 「가능한 한 빨리」만 확실.
  • 투자·IPO 루머 신중. ~74억 달러 조달·487억 달러 밸류에이션 등 「보도에 따르면」 단계, 공식·규제 확인 없음.

7. 5단계 도입 가이드

  1. API 모델명 마이그레이션 확인: deepseek-chat/deepseek-reasoner 전역 검색→deepseek-v4-flash 또는 deepseek-v4-pro(7/24 이후 구명 중단).
  2. Flash vs Pro 프리뷰 시나리오 분기: 배치 Agent·의도 라우팅·고빈도 경량→Flash 0731. 심층 세계지식·복잡 추론→Pro 프리뷰, 정식 후 재평가.
  3. Prompt Cache로 비용 절감: 반복 System Prompt 캐시 히트, Flash 히트 $0.0028/M 사실상 거의 무료.
  4. 피크 요금 대비 오프피크: 비실시간 배치 베이징 9시 전·18시 후 실행, 예고된 2배 피크 회피.
  5. Mac 대조 검증: Cursor/OpenClaw로 Flash 0731 vs Kimi K3/Qwen3.8-Max, 동일 SWE-bench 서브셋에서 지연·통과율 비교——벤더 표만 보지 말 것.
from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # V4-Flash-0731은 최신 정식판 자동 참조 response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Summarize the 0731 changelog."}] )

8. FAQ

Q: V4 vs V3.2 최대 차이?
A: 네이티브 1M 컨텍스트, 장컨텍스트 FLOPs V3.2의 27%·KV Cache 10%(공식). Agent 최적화, Claude Code·OpenCode 등 호환.

Q: 일상 Flash vs Pro?
A: 배치·Agent 파이프라인·비용 민감→Flash 0731(Agent 점수 Pro 프리뷰 역전). 심층 추론·예산 여유→Pro 프리뷰, 정식 후 재평가.

Q: V4 Pro 정식 지금 가능?
A: 2026-08-05 기준 불가. 정식은 Flash 0731만, API 전용. 「8/10–20」 미확인 루머.

Q: 공표 점수 신뢰?
A: SWE-bench Verified 등 제3자 벤치 신뢰도 높음. Terminal Bench 2.0 등 Agent는 미공개 Harness——커뮤니티 독립 재현 대기.

Q: 일반 개발자 실무 영향?
A: OpenAI/Anthropic 형식 API 코드 변경 불필요, deepseek-v4-flash가 신정식 가리킴. 구 모델명 즉시 전환.

9. 인사이트: 「참살선(斩杀线)」과 가격전 다음 라운드

V4-Flash-0731 이전 중국 AI 커뮤니티는 Pro 지연으로 양원봉을 「양백개」 조롱. 출시 후 기대 초과로 「양성」 반전——닉네임 반전 자체가 여론 바로미터.

핵심 개념 「참살선(zhǎn shā xiàn)」: DeepSeek 「충분한 성능+극저가」 임계선——경쟁사가 성능으로 명확히 우위·가격으로도 하회 못하면 시장 존재감 상실. GPT-5.6 Luna 저가판 80% 인하 보도 등 동시 가격 조정과 정합. AI 인큐베이터 관계자(21세기경제보도): 「모든 LLM 기업이 양원봉 앞에서 달려야 생존.」

산업 배경: 7/31 NVIDIA·Broadcom·AMD 등 산력주 큰 변동 없음——시장은 「DeepSeek식 효율 돌파」에 익숙, 산력주 악재로 단순 연결 안 함. 2025 초 R1 때 글로벌 AI 칩주 급락과 대비, 중국 LLM 공학 혁신 인식 성숙 시사.

Mac 개발자: Flash 0731 MIT+13B 활성으로 Apple Silicon UMA에서 V4-Flash 양자화 커뮤니티 실험 여지(AMX-2 벤치마크). 단, 프로덕션 Agent 파이프라인·Harness 대조·Kimi K3/Qwen3.8-Max 횡단 SWE-bench 회귀는 격리 환경 권장——본机 UMA 점유로 Cursor/Xcode 일상 개발 영향 방지.

10. 정리: API는 어디서든, Agent 실측은 Mac

OpenRouter 라우팅 전환·DeepSeek API Key 복사——Windows/Linux로 충분. 그러나 동일 환경에서 Cursor+V4-Flash 장컨텍스트 개발, OpenClaw 멀티채널 Agent 대조, Mac MLX Flash 양자화 로컬 검증이면 Apple Silicon UMA+Metal이 마찰 최소.

실무적 접근: 메인机 API 유지, Flash 0731 배치 Agent 부하·Harness 공개 후 대조 회귀·1M 컨텍스트 문서 배치를 MACGPU 원격 Mac mini M4 노드로——온디맨드·SSH로 예고 피크 요금 하 실기 검증에 산력 집중, 본机은 안정 개발.