2026 DEEPSEEK V4
JEONGSHIK_BAN_
GA_RELEASE.

DeepSeek V4 정식판 GA 출시: 아키텍처·시간대별 요금·벤치마크 비교

리드: 3개월을 기다린 DeepSeek V4 정식판(GA)이 2026년 7월 20일 드디어 프로덕션 공개되었습니다. 4월 프리뷰판 대비 Agent 능력, 수학 추론, 코드 생성이 강화되었고, 처음으로 피크·오프피크 차등 요금이 도입되었습니다. 이는 DeepSeek가 「거의 무료」에서 규율 있는 상용 운영으로 나아가는 전환점입니다. 본문은 조사 자료의 모든 핵심을 담습니다: 전체 타임라인, V4-Pro/Flash 사양표, CSA+HCA+mHC 아키텍처, 3가지 추론 모드, 벤치마크 전체표, 시간대별 요금, API 마이그레이션 가이드(7월 24일 마감), GPT-5.6 / Claude Fable 5 비교 매트릭스, FAQ, 오픈소스 마일스톤 심층 분석.

30초 요약 · TL;DR

출시2026-07-20 GA 정식판 공개 · 7/24 deepseek-chat 영구 종료
규모V4-Pro 1.6T(49B 활성) · V4-Flash 284B(13B 활성) · 모두 1M 컨텍스트
핵심 능력SWE-bench Verified 80.6%(오픈소스 최고) · LiveCodeBench 93.5% · MIT 오픈소스
요금시간대별 · V4-Pro 출력 $0.87/M(오프피크) / $1.74/M(피크)
가성비동일 태스크 비용은 Claude Fable 5의 1/116($0.03 vs $3.48)

1. 왜 정식판이 중요한가

  1. 프리뷰는 강했지만, 프로덕션에는 「공식 약속」이 없었다. 4월 24일 프리뷰 공개 이후 개발자들이 가진 질문은 두 가지였습니다. 성능이 더 오를까? 요금이 급변할까? GA 정식판은 3개월의 프로덕션 튜닝으로 전자에, 시간대별 요금 체계로 후자에 답했습니다. 이제 SLA 하에서 안심하고 프로덕션에 올릴 수 있습니다.
  2. 구 API 이름이 곧 영구 종료되며, 마이그레이션 창이 매우 짧다. deepseek-chatdeepseek-reasoner7월 24일 15:59 UTC에 서비스가 중단됩니다. Cursor, OpenClaw, 자체 Agent가 아직 구 모델명을 쓰고 있다면 남은 시간은 겨우 4일입니다.
  3. 시간대별 요금은 양날의 검이다. 평일 09–12시, 14–18시(베이징 시간) 요금이 2배이지만, 피크 시간대에도 V4-Pro 출력 단가($1.74/M)는 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다. 핵심은 오프피크 스케줄링과 Flash 트래픽 분산입니다.

2. 한 줄 정의

DeepSeek V4 정식판은 2026년 7월 20일 공개된 일반 제공(GA) 버전으로, V4-Pro(1.6조 파라미터 MoE)와 V4-Flash(2840억 파라미터 MoE) 두 모델을 포함합니다. 모두 MIT 라이선스로 오픈소스화되었고, 100만 토큰 컨텍스트와 384K 최대 출력을 지원합니다.

프리뷰판 대비 GA판은 Agent 오케스트레이션, 수학 추론, 코드 생성을 강화하고 시간대별 API 요금을 정비했습니다. 아키텍처 자체는 새롭지 않습니다——CSA(압축 희소 어텐션) + HCA(고도 압축 어텐션) + mHC(다양체 제약 하이퍼커넥션) 설계는 4월 프리뷰부터 확립되었고, 정식판은 안정성·튜닝·상용화 완결을 담당합니다.

요약: DeepSeek V4는 오픈소스 모델 중 SWE-bench Verified 최고 점수(80.6%)를 기록하며, 클로즈드 플래그십의 1/10~1/100 비용으로 프론티어에 근접한 성능을 제공하고, 프라이빗 배포와 1M 초장문 컨텍스트를 지원합니다.

3. 타임라인: 프리뷰에서 정식판까지

날짜이벤트
2026-04-24V4 프리뷰 공개 + 오픈소스(MIT), V4-Pro(1.6T)와 V4-Flash(284B) 포함
2026-05V4-Flash와 V4-Pro 프로덕션 튜닝 버전 출시, API 정식 이용 가능
2026-06V4-Pro 가격 영구 75% 인하(출력 $0.87/M tokens), 역대 최고 가성비 구간 확정
2026-06-29DeepSeek가 전체 API 사용자에 이메일 발송, GA 정식판 7월 중순 공개 예고, 시간대별 요금 최초 공개
2026-07-19다수 개발자 GA 그레이 내부 테스트 자격 획득, 언론이 「정식판 내일 공개 가능성」 보도
2026-07-20GA 정식판 공개(본문 게시일)
2026-07-24구 인터페이스명 deepseek-chat, deepseek-reasoner 영구 종료

관련 글: DeepSeek 자작 칩과 연산력 전략, Kimi K3 심층 평가, 6월 AI 대모델 할인·혜택 총정리도 함께 참고하세요.

4. 모델 패밀리 사양: V4-Pro vs V4-Flash

사양V4-ProV4-Flash
총 파라미터1.6조(1.6T)2840억(284B)
토큰당 활성 파라미터490억(49B)130억(13B)
Transformer 레이어61층43층
컨텍스트 윈도우1,000,000 tokens1,000,000 tokens
최대 출력384K tokens384K tokens
정밀도FP4(전문가 가중치) + FP8(기타)FP4 + FP8 혼합
사전학습 데이터33T+ tokens32T+ tokens
오픈소스 라이선스MITMIT

5. 핵심 아키텍처: CSA + HCA + mHC 상세

기존 Transformer는 KV Cache 메모리 소비가 컨텍스트 길이에 비례해 증가하여, 1M 토큰 지원은 사실상 불가능했습니다. DeepSeek V4는 V2/V3 시대의 MLA(다중 헤드 잠재 어텐션)를 버리고 세 가지 핵심 아키텍처 혁신으로 이 문제를 해결했습니다.

5.1 압축 희소 어텐션(CSA, Compressed Sparse Attention)

  • KV 시퀀스를 Softmax 게이트 풀링으로 먼저 4배 압축
  • FP4 정밀도 「Lightning Indexer」로 top-k 희소 선택(V4-Pro top-1024, V4-Flash top-512)
  • 최근 128 토큰 슬라이딩 윈도우도 유지
  • 효과: 1M 컨텍스트에서 DeepSeek V3.2 대비 27% 추론 FLOPs만 필요

5.2 고도 압축 어텐션(HCA, Heavily Compressed Attention)

  • 토큰을 128배 압축해 글로벌 밀집 어텐션 수행
  • 장거리 의존성 포착, CSA와 상호 보완
  • V4-Flash는 처음 2층이 HCA, 이후 CSA/HCA 교차 사용. V4-Pro도 유사 구조

종합 효과: 1M 토큰 시나리오에서 KV Cache 메모리는 V3.2의 10%(V4-Flash는 7%까지 감소).

5.3 다양체 제약 하이퍼커넥션(mHC)과 Muon 옵티마이저

mHC(Manifold-Constrained Hyper-Connections)는 기존 잔차 연결의 업그레이드입니다. 표준 Transformer의 x = x + f(x) 잔차 경로는 매우 깊은 네트워크에서 기울기 퇴화가 쉽게 발생합니다. mHC는 4채널 잔차 스트림을 도입하고, 이중 확률 행렬 제약(Birkhoff 다면체)을 만족하는 혼합 행렬로 61층 깊은 네트워크에서도 신호가 안정적으로 전파됩니다.

학습 시 표준 AdamW 대신 Muon 옵티마이저를 사용하며, 뉴턴-슐츠 직교화로 기울기를 처리해 더 근거 있는 스텝, 빠른 수렴, 안정적 학습을 달성합니다.

5.4 세 가지 추론 모드

모드특징적용 시나리오
Non-think사고 체인 없음, 초고속 응답간단 Q&A, 라우팅
Think High명시적 추론(<redacted_thinking> 태그)중간 복잡도 태스크, 코드 디버깅
Think Max최대 추론 강도, 384K+ 컨텍스트 필요복잡한 수학, 긴 체인 Agent

권장 샘플링 파라미터: temperature=1.0, top_p=1.0(공식 권장, 전 모드 공통).

6. 벤치마크: 오픈소스 1위 성적표

벤치마크DeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% ★ 오픈소스 최고96.0%개별 미공개~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

해석 포인트:

  • SWE-bench Verified: V4-Pro 80.6%로 오픈소스 1위, Gemini 3.1 Pro와 동률
  • LiveCodeBench: V4-Pro 93.5%로 모든 클로즈드 경쟁 모델 상회, 알고리즘 대회 시나리오 최적
  • SWE-bench Pro: Claude Fable 5가 80.3%로 선두, 멀티파일 Repo급 버그 수정은 여전히 그 강점
  • Terminal-Bench: GPT-5.6 Ultra 85.1%로 선두, 터미널/툴체인 집약 Agent 시나리오에 유리

주의: 위 벤치마크는 DeepSeek 자체 보고 및 제3자 집계 데이터 기반이며, 모델마다 다른 추론 harness를 사용했습니다. 독립 재현 검증은 진행 중입니다.

7. 가성비: 태스크당 비용 vs 성능

Artificial Analysis 평가 데이터에 따르면 Strategy & Ops 지수 태스크에서:

모델태스크당 비용점수가성비 배수
Claude Fable 5$3.4850점기준
DeepSeek V4-Pro$0.0338점비용은 Fable 5의 1/116
DeepSeek V4-Flash6개 지수 태스크 모두 $0.04 미만경량 태스크 극한 절약

Fable 5 비용은 V4-Pro의 116배이지만, 점수는 약 12점(31%)만 높습니다. 대부분의 프로덕션 시나리오에서 V4-Pro 가성비는 독보적입니다.

8. 횡단 비교: DeepSeek V4 vs GPT-5.6 Sol vs Claude Fable 5

관점DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
오픈소스✅ MIT 라이선스❌ 클로즈드❌ 클로즈드
셀프호스팅✅ 지원
컨텍스트 윈도우1M tokens미공개1M tokens
코드 능력매우 강함(Fable 5에 근접)매우 강함최강
API 출력 단가(오프피크)$0.87/M tokens~$15/M$50/M
피크 출력 단가$1.74/M tokens
Agent 능력강함, 멀티 Agent 오케스트레이션 지원강함최강
데이터 프라이버시✅ 프라이빗 배포 가능
시나리오추천 모델이유
예산 제한 / 고빈도 호출 / 프라이빗 배포DeepSeek V4-Pro / Flash출력 $0.87/M, MIT 오픈소스
극한 코드 능력, 비용 무관Claude Fable 5SWE-bench Pro 최고 80.3%
복잡한 알고리즘 + 수학 추론GPT-5.6 Sol / UltraTerminal-Bench 선두
초대규모 로그/문서 처리V4-Flash캐시 히트 입력 $0.0028/M만

9. 시간대별 요금: 전체 가격표와 절약 전략

GA판에서 가장 주목받고 논쟁적인 변화입니다. DeepSeek가 처음으로 시간대별 차등 요금을 도입했습니다. 전력 시간대별 요금과 유사한 구조입니다. 피크 시간대(베이징 시간): 평일 09:00–12:00, 14:00–18:00, 모든 요금 2배.

모델과금 항목오프피크피크
V4-Pro입력(캐시 히트)¥0.025 / $0.0035 / 1M tokens2배
입력(캐시 미스)¥3.00 / $0.435 / 1M tokens¥6.00 / $0.87
출력¥6.00 / $0.87 / 1M tokens¥12.00 / $1.74
V4-Flash입력(캐시 히트)¥0.02 / $0.0028 / 1M tokens2배
입력(캐시 미스)¥1.00 / $0.14 / 1M tokens¥2.00 / $0.28
출력¥2.00 / $0.28 / 1M tokens¥4.00 / $0.56

9.1 네 가지 절약 팁

  1. 비실시간 작업은 오프피크로: 배치 문서 처리, 데이터 어노테이션, 코드 리뷰 등은 18:00 이후 또는 오전 9시 이전 실행
  2. 캐시 히트 활용: 반복 System Prompt에는 Prompt Cache 구축. V4-Flash 캐시 히트 비용 $0.0028/M로 거의 무료
  3. Flash로 트래픽 분산: 간단한 의도 인식·라우팅은 V4-Flash, 복잡한 추론은 V4-Pro로——추론 비용 60–80% 절감 가능
  4. 청구 알림 사전 수신: DeepSeek는 요금 변경 24시간 전 이메일 알림을 보내겠다고 약속

피크 시간대에도 V4-Pro 출력 단가($1.74/M)는 Claude Opus 4.8($15/M)보다 8.6배 저렴하고, GPT-5.6 Sol(약 $15/M)과 동일 배율로 저렴합니다.

10. 개발자 필독: API 마이그레이션 가이드(7월 24일 마감) ⚠️

중요 경고: 구 모델명 deepseek-chat, deepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 접근이 중단됩니다.

구 모델명신 모델명비고
deepseek-chatdeepseek-v4-flash(비사고 모드)고속, 경량 태스크용
deepseek-reasonerdeepseek-v4-flash(사고 모드)또는 deepseek-v4-pro로 업그레이드해 더 강한 추론

10.1 OpenAI SDK(Python)

from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # ❌ 구写法(7월 24일 이후 무효) # client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ 신写法 — 비사고 모드 response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}] ) # ✅ 신写法 — 사고 모드(deepseek-reasoner 대체) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Solve this step by step..."}], extra_body={ "thinking": {"type": "enabled", "budget_tokens": 8000} } )

10.2 Anthropic SDK 호환写法

V4는 OpenAI ChatCompletions 형식과 Anthropic Messages 형식을 모두 지원합니다. base_url은 그대로 두고 model 파라미터만 업데이트하세요.

import anthropic client = anthropic.Anthropic( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "What changed in the V4 GA release?"}] )

11. 도입 단계: 다섯 가지 방법으로 즉시 연결

  1. DeepSeek 웹/App(가장 간단): chat.deepseek.com 접속, 계정 등록. V4 정식판이 기본으로 제공됩니다.
  2. 공식 API(개발자): platform.deepseek.com에서 API Key 발급, OpenAI 호환 인터페이스 사용, 모델명을 deepseek-v4-pro 또는 deepseek-v4-flash로 변경.
  3. OpenRouter 멀티 라우트: 모델 ID deepseek/deepseek-v4-pro. OpenRouter 코딩 리더보드와 Mac 멀티 라우트 가이드 참고.
  4. Cursor / IDE 설정: DeepSeek V4-Pro를 일상 코딩 메인으로, 복잡한 Repo 버그 수정 시 Claude Fable 5로 폴백.
  5. 코드베이스 검색으로 마이그레이션 완료: deepseek-chat, deepseek-reasoner 전역 검색, staging 환경에서 신 모델명 테스트, 7월 24일 전 프로덕션 전환 완료.

12. 자주 묻는 질문(FAQ)

Q: DeepSeek V4 정식판과 프리뷰판의 차이는?
A: 정식판은 프리뷰판 대비 Agent 능력, 수학 추론, 코드 생성을 강화하고 시간대별 차등 요금을 처음 도입했습니다. CSA+HCA 아키텍처는 동일하지만 프로덕션 안정성과 튜닝이 더 성숙합니다.

Q: V4-Pro와 V4-Flash 중 무엇을 선택해야 하나?
A: V4-Pro는 복잡한 추론, 긴 체인 Agent용. V4-Flash는 고빈도 경량 호출, 의도 라우팅용이며 출력 단가 $0.28/M(오프피크).

Q: 시간대별 요금의 피크 시간대는?
A: 베이징 시간 평일 09:00–12:00, 14:00–18:00, 모든 요금 2배. 비실시간 작업은 오프피크 실행 권장.

Q: deepseek-chat은 언제 중단되나?
A: 2026년 7월 24일 15:59 UTC(베이징 시간 23:59) 영구 종료. 즉시 deepseek-v4-flash 또는 deepseek-v4-pro로 이전하세요.

Q: DeepSeek V4를 로컬에 배포할 수 있나?
A: 가능——MIT 오픈소스, Hugging Face에 가중치 공개. 다만 1.6T MoE 프로덕션 배포는 멀티 GPU 클러스터 필요, Mac 로컬은 API 또는 양자화 버전 검증이 현실적.

Q: Claude Fable 5와 어느 쪽이 더 강한가?
A: Fable 5가 SWE-bench에서 앞서지만, V4-Pro는 1/116 비용으로 프론티어에 근접한 성능을 제공하고 프라이빗 배포도 가능합니다.

13. 심층 분석: 2026 오픈소스 대모델의 마일스톤 신호

DeepSeek V4 GA 정식판 출시는 단순한 「프리뷰 졸업」을 넘어섭니다——2026년 중반 중국 오픈소스 대모델 생태계의 구조적 전환점을 나타냅니다. 이 전환의 깊이를 이해하려면 세 가지 관점에서 분석해야 합니다.

13.1 「가격 파괴자」에서 「규율 있는 상용 플랫폼」으로

지난 18개월 DeepSeek는 혁신적 저가(V3 시대 출력 $0.28/M)로 글로벌 AI API 시장을 재편했고, OpenAI와 Anthropic의 인하를 촉발했습니다. 그러나 「거의 무료」는 지속 불가능합니다——연산 비용, R&D 투자, 컴플라이언스 운영 모두 현금 흐름이 필요합니다. 시간대별 요금 도입은 DeepSeek가 시장 확보 보조금에서 규율 있는 상용화로 이동하는 신호입니다.

이 전환의 핵심은 DeepSeek가 인상 과정에서 경쟁력을 희생하지 않았다는 점입니다. 피크 시간대에도 V4-Pro 출력 $1.74/M로 Claude Opus 4.8보다 8.6배 저렴합니다. 시간대별 메커니즘은 본질적으로 수요측 스케줄링 도구로, 비실시간 연산 수요를 오프피크로 유도해 클러스터 활용률을 높이며 단순히 비용을 사용자에게 전가하지 않습니다. 오프피크 스케줄링이 가능한 엔지니어링 팀(야간 배치, 주말 코드 리뷰)에게 실제 청구액은 이전보다 낮아질 수도 있습니다.

13.2 아키텍처 혁신이 「장문맥 경제학」을 재정의

1M 토큰 컨텍스트는 2026년에 희귀한 파라미터가 아닙니다——Kimi K3, Claude Fable 5도 백만급 컨텍스트를 지원합니다. 그러나 DeepSeek V4의 독특한 가치는 1M 컨텍스트를 경제적으로 실현 가능하게 만든 점입니다: CSA 4배 압축 + top-1024 희소 선택 + 128 토큰 슬라이딩 윈도우로 1M 시나리오 추론 FLOPs는 V3.2의 27%, KV Cache 메모리는 10%로 감소합니다.

이는 동일 하드웨어로 더 긴 컨텍스트를 서비스할 수 있고 API 요금을 낮게 유지할 수 있음을 의미합니다. Kimi K3의 $15/M 출력 단가 대비 V4-Pro $0.87/M은 백만 토큰 시나리오에서 자릿수 차이의 비용 격차를 만듭니다. 전체 코드베이스 일괄 분석, 장문 법률/연구 문서, 멀티턴 Agent 장기 기억이 필요한 팀에게 V4는 「컨텍스트 길이 × 성능 × 비용」 삼각형에서 세 항목 모두 약점이 없는 유일한 선택지입니다.

mHC 4채널 잔차 스트림과 Muon 옵티마이저 조합은 「더 깊은 네트워크 = 더 불안정한 학습」이라는 전통적 난제를 해결했습니다. 61층 깊이로 V4-Pro는 학습 안정성을 유지하며 V3 시리즈를 넘는 표현력을 확보했습니다——파라미터 규모가 671B에서 1.6T로 도약해도 효율적으로 학습할 수 있는 기술 기반입니다.

13.3 오픈소스 라이선스의 전략적 무게: MIT는 「다운로드 가능」 이상

2026년 7월 오픈소스 대모델 판도에서 라이선스는 파라미터 규모만큼 중요한 선택 요소가 되었습니다. Llama 시리즈의 상업 이용 제한, 일부 국산 모델의 「연구용 only」 조항은 기업 컴플라이언트 배포에 잠재 리스크를 만듭니다. DeepSeek V4의 MIT 라이선스는 다음을 의미합니다.

  • 기업이 사내망에 무제한 배포 가능, DeepSeek 보고·수익 분배 불필요
  • V4 가중치 기반 파인튜닝·증류·2차 개발 결과를 클로즈드 상용화 가능
  • 데이터 국외 반출 불가 정부·금융·의료 시나리오에 컴플라이언트 기술 경로 제공

Kimi K3가 2.8T 파라미터로 「최대 오픈소스 모델」 타이틀을 탈환했을 때(K3 심층 평가 참고), DeepSeek V4는 파라미터 규모 정면 경쟁을 피하고 엔지니어링 효율·비용 구조·라이선스 자유도 세 차원에서 차별화 장벽을 구축했습니다. 이는 후퇴가 아니라 더 성숙한 경쟁 전략입니다——오픈소스 커뮤니티에서 「널리 채택되는 것」이 「파라미터 수가 최대」보다 장기적 가치가 큽니다.

Mac 개발자에게 V4의 MIT 라이선스 + OpenAI/Anthropic 듀얼 SDK 호환은 Cursor, Continue, OpenClaw 등 툴체인에서 매끄럽게 전환할 수 있고, 향후 MLX / llama.cpp 양자화 적용 가능성도 남깁니다. 풀 가중치 프로덕션 배포는 멀티 GPU 클러스터가 필요하지만, V4-Flash 13B 활성 파라미터는 Apple Silicon 통합 메모리 아키텍처에서 커뮤니티 양자화 실험이 진행 중입니다——Apple Silicon DeepSeek V4 AMX-2 벤치마크로 로컬 추론 진행을 추적하세요.

궁극적으로 DeepSeek V4 GA의 가치는 Claude Fable 5나 GPT-5.6을 이기는지(아직은 아님)가 아니라, 클로즈드 플래그십의 1/10~1/100 비용으로 오픈소스 모델 중 최강 성능을 제공한다는 점에 있습니다. 데이터 국외 반출을 원치 않는 기업, 예산이 제한된 개인 개발자, 1M 컨텍스트가 필요한 Agent 엔지니어, 극한 가성비를 추구하는 AI 제품 팀에게——DeepSeek V4 Pro는 현재 약점 없는 유일한 선택지입니다.

14. 마무리: API 체험은 아무 기기나, Agent 실측은 여전히 Mac

platform.deepseek.com 가입, API Key 복사, OpenRouter에서 라우트 전환——Windows나 Linux로 충분합니다. 그러나 동일 환경에서 Cursor + DeepSeek V4 장문맥 코딩, Xcode로 iOS 측 Agent 연동, Mac에서 MLX로 V4-Flash 양자화 버전 대조 검증을 하려면 Apple Silicon 통합 메모리 + Metal 그래픽 스택이 여전히 가장 마찰이 적은 경로입니다.

더 실용적인 접근: 메인 머신은 API 호출 유지, V4-Pro Think Max 스트레스 테스트, 멀티 레포 SWE-bench 회귀, 1M 컨텍스트 문서 배치 처리는 MACGPU 원격 Mac mini M4 노드에 맡기세요——온디맨드 기동, SSH 안전 접속, 시간대별 요금 프레임워크 안에서 연산력은 실기 검증에, 로컬 머신은 일상 안정 개발에 쓰면 됩니다.