2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.
리드: 7월 말 DeepSeek changelog를 추적했다면 역설적 사실을 발견했을 겁니다——신규 모델 출시 없음, 동일 284B V4-Flash의 후훈련만 교체했는데 Agent 벤치에서 자사 1.6T V4-Pro 프리뷰를 역전, API 가격은 Claude Opus 4.8의 수십 분의 일. 본문은 조사 소스 전 항목 반영: 4~8월 타임라인, 핵심 가격표, 후훈련·Harness 분해, 중국 오픈소스 6자 횡비교, 논쟁 경고, 「참살선(斩杀线)」 인사이트, 5단계 도입·FAQ.
30초 요약 · TL;DR
| 출시 | 2026-07-31 V4-Flash-0731 정식 API 공개 베타 · API 전용, App/웹 미동기화 |
| 아키텍처 | 284B / 13B 활성, 4월 프리뷰와 동일 · 성능 향상은 후훈련만 |
| 가격 | 입력 $0.14(캐시 미스) / $0.0028(히트) · 출력 $0.28/M |
| Agent | Terminal Bench 2.0 82.7(벤더 자보 + Harness 미니멀 모드) · V4-Pro 프리뷰 67.9 역전 |
| 미출시 | V4-Pro 정식판 · 자체 Agent 프레임워크 Harness · 확정일 없음 |
1. 왜 0731이 주목되는가
- 플래그십 Pro 지연 vs Flash 「격상」. 커뮤니티는 양원봉(梁文锋)을 「양백개」(공약 불이행)로 조롱——V4-Pro 정식판 7월 중순 GA 예상이 연기. 7/31 더 작은 Flash 0731이 Pro 프리뷰 Agent 점수 역전, 여론은 「양성(梁圣)」으로 반전했으나 Pro·Harness 일정은 불명.
- 점수는 좋지만 프레임워크 민감. 공식 Terminal Bench 2.0(82.7) 등 Agent 점수 전부 미공개 Harness 「미니멀 모드」 측정. 공식 경고: 「점수는 harness 선택에 매우 민감」——Claude Code/Cursor 실사용과 동치 아님.
- API 전용 업데이트, 소비자端 지연. 이번 베타는 API만, App·웹 미갱신. chat.deepseek.com 체감 변화 없어도 모순 아님——개발자·일반 사용자 버전 리듬이 다름.
2. 타임라인: 4월 프리뷰→7월 「정식판」
| 일자 | 이벤트 |
|---|---|
| 2026-04-24 | DeepSeek-V4 프리뷰 최초 공개·오픈소스(MIT). V4-Pro(1.6T/49B 활성)·V4-Flash(284B/13B 활성), 1M 컨텍스트 |
| 2026-07-24 | 구 인터페이스 deepseek-chat·deepseek-reasoner 공식 중단, V4 명명으로 전환 |
| 2026-07-27 | 월지암면(Moonshot) Kimi K3(2.8T) Hugging Face 오픈웨이트 공개, DeepSeek 경쟁 압박 |
| 2026-07-31 | V4-Flash-0731 정식 API 베타, 웨이트 HF 동기화. changelog에서 자체 Agent 프레임워크 「Harness」 최초 언급, V4 정식판과 함께 곧 공개 예정 |
| 2026-08-05 기준 | V4-Pro 정식판 여전히 「가능한 한 빨리」. 일부 매체 익명 소스 8/10–8/20 GA 보도——공식 미확인·참고용 |
3. 핵심 데이터
| 모델 | 상태 | 총/활성 파라미터 | 컨텍스트 | 입력가(미스/히트, $/M) | 출력가($/M) | 라이선스 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 정식(07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 프리뷰(04-24, 정식 미출시) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 웨이트 공개(07-27) | 2.8T / ~104B(커뮤니티 추정) | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 오픈(2026년 6월) | ~744B / ~40B | 1M | 본문 미확인 | 본문 미확인 | MIT |
| Qwen3.8-Max | API GA(08-02), 웨이트 대기 | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 오픈 약속 |
가격은 벤더 공개 데이터. DeepSeek는 API 「피크 시간 2배 요금」(베이징 9–12시·14–18시) 예고, 발효일 미공개.
4. 심층 분석: 성능은 어떻게 「나왔나」
4.1 아키텍처 불변, 후훈련만 변경
V4-Flash-0731은 파라미터 규모·구조 모두 4월 프리뷰와 동일, 공식: 성능 향상 「완전히 재실시한 후훈련에서 비롯」. 284B/13B Flash가 1.6T/49B V4-Pro 프리뷰를 다수 Agent 벤치에서 역전——2026 하반기 LLM 경쟁에서 후훈련 품질이 단순 스케일링에 근접·초과.
4.2 하이브리드 어텐션: CSA+HCA, mHC, Muon
기술 보고서 《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》 핵심 3변경:
- 하이브리드 어텐션: 압축 희소 어텐션(CSA)+고도 압축 어텐션(HCA), 대외 「DSA 희소 어텐션」——장컨텍스트 연산·VRAM 절감;
- 다양체 제약 하이퍼커넥션(mHC): 잔차 연결 개선;
- Muon 옵티마이저: 수렴·안정성 향상.
공식 지표: 1M 토큰에서 V4-Pro 단일 토큰 FLOPs V3.2의 27%, KV Cache 10%(벤더 자보, 독립 재현 미확인).
4.3 자체 Agent 프레임워크 Harness 최초 공개
7/31 changelog 「DeepSeek Harness」——Claude Code 대응 Agent 실행 프레임워크, 파일 I/O·도구 호출·E2E 엔지니어링. 기존 Claude Code·OpenCode 의존. 공식 Agent 점수 전부 Harness 「미니멀 모드」, max·top_p=0.95·temperature=1.0. 공식: 「점수는 harness 선택에 매우 민감, 모델 능력 향상과 동치 아님.」
5. 횡비교: 중국 오픈소스 LLM 6자 혼전
| 모델 | 랩 | 출시/웨이트 | 총 파라미터 | AA Intelligence Index | 단일 태스크 비용(AA) |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 07-31 정식 | 284B | 50 | $0.03 |
| Kimi K3 | 월지암면 | 07-16 프리뷰 / 07-27 웨이트 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | 2026년 6월 | ~744B | Flash 대비 ~1점↑ | 본문 미확인 |
| Qwen3.8-Max | 阿里 | 08-02 GA(웨이트 대기) | 2.4T | 본문 미확인 | 본문 미확인 |
| GPT-5.6 Sol | OpenAI | 폐쇄 | 비공개 | Flash 대비 9점+↑ | $1.86 |
| Claude Fable 5 | Anthropic | 폐쇄 | 비공개 | Flash 대비 9점+↑ | $3.15 |
출처: Intelligence Index·단일 태스크 비용 Artificial Analysis(독립). DeepSeek Agent 점수 벤더 자보, 방법론 상이——직접 합산 비교 불가.
대비 선명: AA 종합지수에서 V4-Flash 최고 아님, Kimi K3·GLM-5.2에 열세. 그러나 단일 태스크 비용 Kimi K3의 약 1/29, GPT-5.6 Sol 1/62, Claude Fable 5 1/105. DeepSeek 목표는 「1위 점수」가 아닌 「충분한 지능+극한 가격」——V4-Flash 프리뷰 OpenRouter 7주 연속 호출량 1위의 이유.
6. 논쟁점: 점수는 좋지만 수분도 있다
- Harness 의존, 공식도 경고. Terminal Bench 2.0(82.7 vs Pro 67.9) 미공개 Harness 미니멀 모드——「벤더 자보+특정 프레임워크」로 취급.
- 해외 개발자 실사용 이슈. 21세기경제보도 인용: 입력 캐시 히트율 저조, 안전 분류기 간헐 타임아웃.
- V4-Pro·Harness 일정 미확인. 「8/10–20 GA」 익명 소스 보도, 공식 changelog는 「가능한 한 빨리」만 확실.
- 투자·IPO 루머 신중. ~74억 달러 조달·487억 달러 밸류에이션 등 「보도에 따르면」 단계, 공식·규제 확인 없음.
7. 5단계 도입 가이드
- API 모델명 마이그레이션 확인:
deepseek-chat/deepseek-reasoner전역 검색→deepseek-v4-flash또는deepseek-v4-pro(7/24 이후 구명 중단). - Flash vs Pro 프리뷰 시나리오 분기: 배치 Agent·의도 라우팅·고빈도 경량→Flash 0731. 심층 세계지식·복잡 추론→Pro 프리뷰, 정식 후 재평가.
- Prompt Cache로 비용 절감: 반복 System Prompt 캐시 히트, Flash 히트 $0.0028/M 사실상 거의 무료.
- 피크 요금 대비 오프피크: 비실시간 배치 베이징 9시 전·18시 후 실행, 예고된 2배 피크 회피.
- Mac 대조 검증: Cursor/OpenClaw로 Flash 0731 vs Kimi K3/Qwen3.8-Max, 동일 SWE-bench 서브셋에서 지연·통과율 비교——벤더 표만 보지 말 것.
8. FAQ
Q: V4 vs V3.2 최대 차이?
A: 네이티브 1M 컨텍스트, 장컨텍스트 FLOPs V3.2의 27%·KV Cache 10%(공식). Agent 최적화, Claude Code·OpenCode 등 호환.
Q: 일상 Flash vs Pro?
A: 배치·Agent 파이프라인·비용 민감→Flash 0731(Agent 점수 Pro 프리뷰 역전). 심층 추론·예산 여유→Pro 프리뷰, 정식 후 재평가.
Q: V4 Pro 정식 지금 가능?
A: 2026-08-05 기준 불가. 정식은 Flash 0731만, API 전용. 「8/10–20」 미확인 루머.
Q: 공표 점수 신뢰?
A: SWE-bench Verified 등 제3자 벤치 신뢰도 높음. Terminal Bench 2.0 등 Agent는 미공개 Harness——커뮤니티 독립 재현 대기.
Q: 일반 개발자 실무 영향?
A: OpenAI/Anthropic 형식 API 코드 변경 불필요, deepseek-v4-flash가 신정식 가리킴. 구 모델명 즉시 전환.
9. 인사이트: 「참살선(斩杀线)」과 가격전 다음 라운드
V4-Flash-0731 이전 중국 AI 커뮤니티는 Pro 지연으로 양원봉을 「양백개」 조롱. 출시 후 기대 초과로 「양성」 반전——닉네임 반전 자체가 여론 바로미터.
핵심 개념 「참살선(zhǎn shā xiàn)」: DeepSeek 「충분한 성능+극저가」 임계선——경쟁사가 성능으로 명확히 우위·가격으로도 하회 못하면 시장 존재감 상실. GPT-5.6 Luna 저가판 80% 인하 보도 등 동시 가격 조정과 정합. AI 인큐베이터 관계자(21세기경제보도): 「모든 LLM 기업이 양원봉 앞에서 달려야 생존.」
산업 배경: 7/31 NVIDIA·Broadcom·AMD 등 산력주 큰 변동 없음——시장은 「DeepSeek식 효율 돌파」에 익숙, 산력주 악재로 단순 연결 안 함. 2025 초 R1 때 글로벌 AI 칩주 급락과 대비, 중국 LLM 공학 혁신 인식 성숙 시사.
Mac 개발자: Flash 0731 MIT+13B 활성으로 Apple Silicon UMA에서 V4-Flash 양자화 커뮤니티 실험 여지(AMX-2 벤치마크). 단, 프로덕션 Agent 파이프라인·Harness 대조·Kimi K3/Qwen3.8-Max 횡단 SWE-bench 회귀는 격리 환경 권장——본机 UMA 점유로 Cursor/Xcode 일상 개발 영향 방지.
10. 정리: API는 어디서든, Agent 실측은 Mac
OpenRouter 라우팅 전환·DeepSeek API Key 복사——Windows/Linux로 충분. 그러나 동일 환경에서 Cursor+V4-Flash 장컨텍스트 개발, OpenClaw 멀티채널 Agent 대조, Mac MLX Flash 양자화 로컬 검증이면 Apple Silicon UMA+Metal이 마찰 최소.
실무적 접근: 메인机 API 유지, Flash 0731 배치 Agent 부하·Harness 공개 후 대조 회귀·1M 컨텍스트 문서 배치를 MACGPU 원격 Mac mini M4 노드로——온디맨드·SSH로 예고 피크 요금 하 실기 검증에 산력 집중, 본机은 안정 개발.