KIMI K3 오픈 가중치
JULY_27_
RELEASE.
리드: Moonshot AI는 2026년 7월 27일 Kimi K3의 2.8조 파라미터 완전 가중치를 Hugging Face에 Modified MIT 라이선스로 공개할 예정입니다. API는 7월 16일에 선행 공개되었지만, 가중치 다운로드는 아직 불가능합니다. 본 글은 7/16 API vs 7/27 가중치 차이, KDA+AttnRes+Stable LatentMoE 사양, Artificial Analysis 지수 57.1/58.9/59.9, 승패 벤치마크, API $3/$0.30/$15, 1.4TB·64+ GPU 자체 호스팅 요건, open weights vs open source 구분, 7/27 공개 체크리스트, 업계 분석, FAQ를 다룹니다.
30초 요약 · TL;DR
| 7/16 | API·Kimi App/Code 공개 — 모델 ID kimi-k3 |
| 7/27 | 완전 가중치 Hugging Face · Modified MIT · 기술 보고서 동시 공개 |
| 규모 | 2.8T 파라미터 · 896 전문가 중 16 활성 · 1M 컨텍스트 |
| AA 지수 | K3 57.1 · GPT-5.6 Sol 58.9 · Claude Fable 5 59.9 (3위/189) |
| 자체 호스팅 | 4-bit 약 1.4TB · 프로덕션 64+ 가속기 권장 |
1. 타임라인: 7/16 API와 7/27 가중치의 차이
| 날짜 | 이벤트 |
|---|---|
| 2026-07-16 | Kimi K3가 Kimi App / Kimi Work / Kimi Code / API로 공개. Artificial Analysis가 같은 날 독립 평가 발표 |
| 2026-07-17 | 상하이 WAIC 개막. 신화사가 K3를 「국가적 이정표」로 규정 |
| 2026-07-27 | 완전 가중치 Hugging Face 공개(Modified MIT) + 기술 보고서(아키텍처·학습·평가) |
많은 개발자가 혼동하는 점: 7/16은 API 이용 시작이며, 7/27이 가중치 다운로드 시작입니다. vLLM KDA/prefix caching 지원, Ollama/GGUF 양자화 버전은 가중치 공개 후 순차적으로 따라올 전망입니다. 상세 아키텍처는 7/17 K3 심층 평가를 참고하세요.
2. Kimi K3 사양표
| 항목 | 데이터 |
|---|---|
| 총 파라미터 | 2.8조(2.8T) — 역대 최대 오픈 가중치 모델 |
| 아키텍처 | Stable LatentMoE: 896 전문가 중 16 활성(희소율 1.8%) |
| 어텐션 | Kimi Delta Attention(KDA) + Attention Residuals(AttnRes) + Gated MLA |
| 컨텍스트 | 1,048,576 토큰(약 100만) |
| 모달리티 | 텍스트 + 이미지(네이티브 비전), 제품 측은 동영상 이해 지원 |
| 가중치 형식 | MXFP4 가중치 + MXFP8 활성화(양자화 인식 학습) |
| 학습 안정화 | Quantile Balancing · Per-Head Muon · SiTU 활성 함수 |
| 장컨텍스트 | KDA로 100만 토큰에서 최대 6.3× 디코드 가속 |
| 확장 효율 | K2 대비 약 2.5×(동일 연산으로 더 높은 지능) |
| API 모델 ID | kimi-k3 |
| 라이선스 | Modified MIT(7/27 조항 확인) |
3. 벤치마크: 강점과 약점
3.1 K3가 우위인 영역
| 벤치마크 | K3 | 비고 |
|---|---|---|
| Frontend Code Arena | 1위 | 블라인드 테스트에서 UI 코드가 Fable/Sol 상회 |
| Automation Bench | 30.8(1위) | — |
| SpreadsheetBench 2 | 1위 | — |
| BrowseComp | 91.2 | 1M 컨텍스트 무압축으로 90.4+ |
| SWE Marathon | 42.0 | 장시간 코딩에서 대폭 리드 |
| Terminal Bench 2.1 | 88.3 | GPT-5.6 Sol 88.8과 거의 동급 |
| Program Bench | 77.8 | Sol 77.6을 근소하게 상회 |
| FrontierSWE | 81.2 | Sol 71.3 대폭 상회(Fable 5 86.6에는 열세) |
3.2 K3가 열세인 영역
- GDPval v2 Elo: K3 1668–1687 vs Fable 5 1760 · Sol 1748(장기 판단력은 Fable 영역)
- DeepSWE: 67.5 vs Sol 73.0
- 환각률: K2.6 대비 상승(공식 인정). r/LocalLLaMA에서 자체 앱 연결 시 환각 증가 보고
- 대화 세련도·안정성: 단일 세션 분산은 Fable 5 / Sol에 열세
Moonshot AI는 공개 시 종합 성능이 Fable 5와 GPT-5.6 Sol에 여전히 뒤진다고 드물게 솔직히 인정했으며, 하네스에 전달된 추론 내용에 대한 과민 반응, 의도가 모호할 때 과도한 주도성 등 알려진 약점을 나열했습니다.
3.3 Artificial Analysis Intelligence Index v4.1
| 모델 | 점수 | 순위 |
|---|---|---|
| Claude Fable 5 | 59.9 | 1위권 |
| GPT-5.6 Sol | 58.9 | 2위권 |
| Kimi K3 | 57.1 | 3위 / 189 |
오픈·폐쇄 능력 격차는 「수백 점」에서 「2~3점」으로 축소. K3는 Fable 5 비용의 약 1/3로 프론티어에 근접한 능력을 제공합니다(AA 단일 태스크 $0.94, Fable 5 대비 65.8% 저렴).
4. API 요금
| 항목 | 가격(100만 토큰당) |
|---|---|
| 입력(캐시 미스) | $3.00 |
| 입력(캐시 히트) | $0.30 |
| 출력 | $15.00 |
코딩 워크로드에서 캐시 적중률 90% 초과 보고가 있으며, 실효 입력 비용은 표면 단가보다 크게 낮아집니다. 중국계 모델 중 최고 가격대이지만 Claude Opus 4.8 단일 태스크 비용보다는 여전히 낮습니다.
5. Open Weights vs Open Source
영어권에서는 open weights(추론용 가중치만 공개)와 open source(학습 코드·데이터 포함)를 엄격히 구분합니다. K3는 7/27에 open weights를 공개하지만 학습 파이프라인이나 데이터셋은 포함되지 않습니다. Reddit/HN에서는 「benchmaxxed」 비판과 open-weight 정의 논쟁도 활발합니다. 라이선스는 Modified MIT — 공식 조항은 공개일 LICENSE 파일에서 확인하세요.
6. 7/27 공개에서 일어날 일
- Moonshot Hugging Face 조직에 2.8T 완전 가중치 업로드
- 기술 보고서(아키텍처·학습·평가 상세) 동시 공개
- vLLM KDA / prefix caching 지원이 가중치와 동시에 이용 가능
- 후속: Ollama·GGUF 양자화 버전(K2 시리즈와 유사한 추종 패턴)
7. 자체 호스팅 현실: 1.4TB와 64+ GPU
일반 하드웨어로는 실용적이지 않습니다. 4-bit 양자화에도 약 1.4TB 저장공간이 필요하며, 프로덕션 추론에는 64개 이상 가속기를 갖춘 슈퍼노드(전문가 병렬+텐서 병렬)가 권장됩니다. 참고: 이전 세대 1T 파라미터 K2.7 Code INT4도 약 577GB — K3는 그 2.8배입니다.
자체 호스팅이 합리적인 시나리오는 3가지뿐입니다: (1) 엄격한 데이터 residency/오프라인 요건, (2) 자사 데이터 파인튜닝, (3) 호출량이 커서 자체 HW가 더 저렴한 경우. 대다수 개발자에게 정답은 API($3/$15)입니다.
8. 7/27 공개일 체크리스트(5항목)
- HF 저장소: 가중치 파일 완전성(누락 샤드 없음)
- LICENSE: Modified MIT 원문 정독(상업 이용·재배포 조항)
- 양자화 버전: MXFP4/NVFP4 버전 유무와 품질
- 추론 스택: vLLM / SGLang 실행 명령과 KDA 지원 현황
- 최소 HW + 독립 검증: 권장 구성과 100만 토큰 장컨텍스트 자체 재테스트
9. 업계 분석: 7/27이 중요한 이유
- 오픈·폐쇄 격차 2~3점: 폐쇄 벤더는 능력만으로 프리미엄을 정당화하기 어려워졌습니다
- 지정학: WAIC 직전 타이밍. 7/1 일시 중단된 미국 Fable/Mythos 규제는 「규제는 폐쇄를 막을 수 있지만, 공개된 오픈 가중치는 막을 수 없다」는 새 논거 제공
- 중국 업체 집단 접근: GLM-5.2 · DeepSeek V4 Pro(1.6T) · MiniMax — K3는 이 물결의 정점
- Moonshot의 반격: 2025년 초 DeepSeek R1로 국내 7위 하락 → K2 → K2.5 → K3 오픈 루트로 지위 재건
출처: kimi.com · platform.kimi.ai · Artificial Analysis · VentureBeat · r/LocalLLaMA · Hacker News
10. 지금 바로 취할 5가지 액션
- API로 지금 테스트: kimi.com 또는 platform.kimi.ai에서
kimi-k3호출 - 7/27 북마크: Hugging Face 저장소와 LICENSE 확인
- 유스케이스별 벤치마크 비교: 장시간 코딩은 SWE Marathon, 추론 깊이는 GDPval
- 자체 호스팅은 3조건만: 데이터 residency / 파인튜닝 / 초대규모 호출
- 공개일 체크리스트 실행: 위 5항목을 7/27 당일 대조
11. 자주 묻는 질문(FAQ)
Q: Kimi K3 가중치는 언제 공개되나요?
A: 2026년 7월 27일 Hugging Face에서 Modified MIT로 2.8T 완전 가중치가 공개될 예정입니다.
Q: Kimi K3는 진짜 오픈소스인가요?
A: open weights입니다. 가중치는 공개되지만 학습 코드와 데이터는 포함되지 않습니다.
Q: Kimi K3 이용 요금은?
A: API 입력 $3 · 캐시 $0.30 · 출력 $15(100만 토큰당). 웹 버전은 무료 계정으로 이용 가능합니다.
Q: 일반 GPU로 로컬 실행 가능한가요?
A: 실용적이지 않습니다. 4-bit 약 1.4TB, 프로덕션은 64+ 가속기가 필요합니다.
Q: Claude Fable 5 / GPT-5.6 Sol보다 우수한가요?
A: AA 지수 3위(57.1). Frontend Code Arena, SWE Marathon 등 특정 벤치마크에서는 우위이나 종합적으로는 Fable/Sol에 근소하게 열세입니다.
Q: 어떤 라이선스인가요?
A: Modified MIT(7/27 Hugging Face LICENSE에서 공식 확인).
12. 마무리: API는 어디서든, Agent 검증은 Mac에서
kimi.com 가입이나 OpenRouter API 전환은 Windows/Linux에서도 문제없습니다. 하지만 Cursor + Kimi K3 장컨텍스트 코딩, Xcode 연동 Agent, MLX 기반 양자화 검증을 한 머신에서 하려면 Apple Silicon 통합 메모리 + Metal이 가장 마찰이 적습니다.
실무적 분리: 일상 개발은 API 호출, Kimi Code 스트레스 테스트·멀티 레포 SWE Marathon 회귀·100만 토큰 문서 배치는 MACGPU 원격 Mac mini M4 노드로 — 온디맨드, SSH 보호. 7/27 가중치 공개 전 Agent 워크로드를 격리해 메인 머신 안정성을 유지하세요.