KIMI K3 오픈 가중치
JULY_27_
RELEASE.

Kimi K3 2.8T 오픈 가중치 공개 및 벤치마크 비교

리드: Moonshot AI는 2026년 7월 27일 Kimi K3의 2.8조 파라미터 완전 가중치를 Hugging Face에 Modified MIT 라이선스로 공개할 예정입니다. API는 7월 16일에 선행 공개되었지만, 가중치 다운로드는 아직 불가능합니다. 본 글은 7/16 API vs 7/27 가중치 차이, KDA+AttnRes+Stable LatentMoE 사양, Artificial Analysis 지수 57.1/58.9/59.9, 승패 벤치마크, API $3/$0.30/$15, 1.4TB·64+ GPU 자체 호스팅 요건, open weights vs open source 구분, 7/27 공개 체크리스트, 업계 분석, FAQ를 다룹니다.

30초 요약 · TL;DR

7/16API·Kimi App/Code 공개 — 모델 ID kimi-k3
7/27완전 가중치 Hugging Face · Modified MIT · 기술 보고서 동시 공개
규모2.8T 파라미터 · 896 전문가 중 16 활성 · 1M 컨텍스트
AA 지수K3 57.1 · GPT-5.6 Sol 58.9 · Claude Fable 5 59.9 (3위/189)
자체 호스팅4-bit 약 1.4TB · 프로덕션 64+ 가속기 권장

1. 타임라인: 7/16 API와 7/27 가중치의 차이

날짜이벤트
2026-07-16Kimi K3가 Kimi App / Kimi Work / Kimi Code / API로 공개. Artificial Analysis가 같은 날 독립 평가 발표
2026-07-17상하이 WAIC 개막. 신화사가 K3를 「국가적 이정표」로 규정
2026-07-27완전 가중치 Hugging Face 공개(Modified MIT) + 기술 보고서(아키텍처·학습·평가)

많은 개발자가 혼동하는 점: 7/16은 API 이용 시작이며, 7/27이 가중치 다운로드 시작입니다. vLLM KDA/prefix caching 지원, Ollama/GGUF 양자화 버전은 가중치 공개 후 순차적으로 따라올 전망입니다. 상세 아키텍처는 7/17 K3 심층 평가를 참고하세요.

2. Kimi K3 사양표

항목데이터
총 파라미터2.8조(2.8T) — 역대 최대 오픈 가중치 모델
아키텍처Stable LatentMoE: 896 전문가 중 16 활성(희소율 1.8%)
어텐션Kimi Delta Attention(KDA) + Attention Residuals(AttnRes) + Gated MLA
컨텍스트1,048,576 토큰(약 100만)
모달리티텍스트 + 이미지(네이티브 비전), 제품 측은 동영상 이해 지원
가중치 형식MXFP4 가중치 + MXFP8 활성화(양자화 인식 학습)
학습 안정화Quantile Balancing · Per-Head Muon · SiTU 활성 함수
장컨텍스트KDA로 100만 토큰에서 최대 6.3× 디코드 가속
확장 효율K2 대비 약 2.5×(동일 연산으로 더 높은 지능)
API 모델 IDkimi-k3
라이선스Modified MIT(7/27 조항 확인)

3. 벤치마크: 강점과 약점

3.1 K3가 우위인 영역

벤치마크K3비고
Frontend Code Arena1위블라인드 테스트에서 UI 코드가 Fable/Sol 상회
Automation Bench30.8(1위)
SpreadsheetBench 21위
BrowseComp91.21M 컨텍스트 무압축으로 90.4+
SWE Marathon42.0장시간 코딩에서 대폭 리드
Terminal Bench 2.188.3GPT-5.6 Sol 88.8과 거의 동급
Program Bench77.8Sol 77.6을 근소하게 상회
FrontierSWE81.2Sol 71.3 대폭 상회(Fable 5 86.6에는 열세)

3.2 K3가 열세인 영역

  • GDPval v2 Elo: K3 1668–1687 vs Fable 5 1760 · Sol 1748(장기 판단력은 Fable 영역)
  • DeepSWE: 67.5 vs Sol 73.0
  • 환각률: K2.6 대비 상승(공식 인정). r/LocalLLaMA에서 자체 앱 연결 시 환각 증가 보고
  • 대화 세련도·안정성: 단일 세션 분산은 Fable 5 / Sol에 열세

Moonshot AI는 공개 시 종합 성능이 Fable 5와 GPT-5.6 Sol에 여전히 뒤진다고 드물게 솔직히 인정했으며, 하네스에 전달된 추론 내용에 대한 과민 반응, 의도가 모호할 때 과도한 주도성 등 알려진 약점을 나열했습니다.

3.3 Artificial Analysis Intelligence Index v4.1

모델점수순위
Claude Fable 559.91위권
GPT-5.6 Sol58.92위권
Kimi K357.13위 / 189

오픈·폐쇄 능력 격차는 「수백 점」에서 「2~3점」으로 축소. K3는 Fable 5 비용의 약 1/3로 프론티어에 근접한 능력을 제공합니다(AA 단일 태스크 $0.94, Fable 5 대비 65.8% 저렴).

4. API 요금

항목가격(100만 토큰당)
입력(캐시 미스)$3.00
입력(캐시 히트)$0.30
출력$15.00

코딩 워크로드에서 캐시 적중률 90% 초과 보고가 있으며, 실효 입력 비용은 표면 단가보다 크게 낮아집니다. 중국계 모델 중 최고 가격대이지만 Claude Opus 4.8 단일 태스크 비용보다는 여전히 낮습니다.

5. Open Weights vs Open Source

영어권에서는 open weights(추론용 가중치만 공개)와 open source(학습 코드·데이터 포함)를 엄격히 구분합니다. K3는 7/27에 open weights를 공개하지만 학습 파이프라인이나 데이터셋은 포함되지 않습니다. Reddit/HN에서는 「benchmaxxed」 비판과 open-weight 정의 논쟁도 활발합니다. 라이선스는 Modified MIT — 공식 조항은 공개일 LICENSE 파일에서 확인하세요.

6. 7/27 공개에서 일어날 일

  • Moonshot Hugging Face 조직에 2.8T 완전 가중치 업로드
  • 기술 보고서(아키텍처·학습·평가 상세) 동시 공개
  • vLLM KDA / prefix caching 지원이 가중치와 동시에 이용 가능
  • 후속: Ollama·GGUF 양자화 버전(K2 시리즈와 유사한 추종 패턴)

7. 자체 호스팅 현실: 1.4TB와 64+ GPU

일반 하드웨어로는 실용적이지 않습니다. 4-bit 양자화에도 약 1.4TB 저장공간이 필요하며, 프로덕션 추론에는 64개 이상 가속기를 갖춘 슈퍼노드(전문가 병렬+텐서 병렬)가 권장됩니다. 참고: 이전 세대 1T 파라미터 K2.7 Code INT4도 약 577GB — K3는 그 2.8배입니다.

자체 호스팅이 합리적인 시나리오는 3가지뿐입니다: (1) 엄격한 데이터 residency/오프라인 요건, (2) 자사 데이터 파인튜닝, (3) 호출량이 커서 자체 HW가 더 저렴한 경우. 대다수 개발자에게 정답은 API($3/$15)입니다.

8. 7/27 공개일 체크리스트(5항목)

  1. HF 저장소: 가중치 파일 완전성(누락 샤드 없음)
  2. LICENSE: Modified MIT 원문 정독(상업 이용·재배포 조항)
  3. 양자화 버전: MXFP4/NVFP4 버전 유무와 품질
  4. 추론 스택: vLLM / SGLang 실행 명령과 KDA 지원 현황
  5. 최소 HW + 독립 검증: 권장 구성과 100만 토큰 장컨텍스트 자체 재테스트

9. 업계 분석: 7/27이 중요한 이유

  1. 오픈·폐쇄 격차 2~3점: 폐쇄 벤더는 능력만으로 프리미엄을 정당화하기 어려워졌습니다
  2. 지정학: WAIC 직전 타이밍. 7/1 일시 중단된 미국 Fable/Mythos 규제는 「규제는 폐쇄를 막을 수 있지만, 공개된 오픈 가중치는 막을 수 없다」는 새 논거 제공
  3. 중국 업체 집단 접근: GLM-5.2 · DeepSeek V4 Pro(1.6T) · MiniMax — K3는 이 물결의 정점
  4. Moonshot의 반격: 2025년 초 DeepSeek R1로 국내 7위 하락 → K2 → K2.5 → K3 오픈 루트로 지위 재건

출처: kimi.com · platform.kimi.ai · Artificial Analysis · VentureBeat · r/LocalLLaMA · Hacker News

10. 지금 바로 취할 5가지 액션

  1. API로 지금 테스트: kimi.com 또는 platform.kimi.ai에서 kimi-k3 호출
  2. 7/27 북마크: Hugging Face 저장소와 LICENSE 확인
  3. 유스케이스별 벤치마크 비교: 장시간 코딩은 SWE Marathon, 추론 깊이는 GDPval
  4. 자체 호스팅은 3조건만: 데이터 residency / 파인튜닝 / 초대규모 호출
  5. 공개일 체크리스트 실행: 위 5항목을 7/27 당일 대조

11. 자주 묻는 질문(FAQ)

Q: Kimi K3 가중치는 언제 공개되나요?
A: 2026년 7월 27일 Hugging Face에서 Modified MIT로 2.8T 완전 가중치가 공개될 예정입니다.

Q: Kimi K3는 진짜 오픈소스인가요?
A: open weights입니다. 가중치는 공개되지만 학습 코드와 데이터는 포함되지 않습니다.

Q: Kimi K3 이용 요금은?
A: API 입력 $3 · 캐시 $0.30 · 출력 $15(100만 토큰당). 웹 버전은 무료 계정으로 이용 가능합니다.

Q: 일반 GPU로 로컬 실행 가능한가요?
A: 실용적이지 않습니다. 4-bit 약 1.4TB, 프로덕션은 64+ 가속기가 필요합니다.

Q: Claude Fable 5 / GPT-5.6 Sol보다 우수한가요?
A: AA 지수 3위(57.1). Frontend Code Arena, SWE Marathon 등 특정 벤치마크에서는 우위이나 종합적으로는 Fable/Sol에 근소하게 열세입니다.

Q: 어떤 라이선스인가요?
A: Modified MIT(7/27 Hugging Face LICENSE에서 공식 확인).

12. 마무리: API는 어디서든, Agent 검증은 Mac에서

kimi.com 가입이나 OpenRouter API 전환은 Windows/Linux에서도 문제없습니다. 하지만 Cursor + Kimi K3 장컨텍스트 코딩, Xcode 연동 Agent, MLX 기반 양자화 검증을 한 머신에서 하려면 Apple Silicon 통합 메모리 + Metal이 가장 마찰이 적습니다.

실무적 분리: 일상 개발은 API 호출, Kimi Code 스트레스 테스트·멀티 레포 SWE Marathon 회귀·100만 토큰 문서 배치는 MACGPU 원격 Mac mini M4 노드로 — 온디맨드, SSH 보호. 7/27 가중치 공개 전 Agent 워크로드를 격리해 메인 머신 안정성을 유지하세요.