KIMI K3
2.8T_
OPEN_
WEIGHT.

Kimi K3 2.8조 파라미터 오픈웨이트 모델 아키텍처

7월 27일 23시경, Moonshot AI(월지암면)가 Kimi K3 완전 모델 가중치와 기술 보고서를 공식 발표하고 MoonEP·FlashKDA·AgentEnv 3대 핵심 인프라를 동시 오픈소스화했습니다.핵심 과제: K3는 2.8조 파라미터 MoE 모델이지만 '오픈소스'와 '오픈웨이트'는 의미가 다르며, 라이선스에 2가지 상업적 게이트가 숨어 있습니다.결론: 오픈웨이트 진영 능력 천장(AA Index 글로벌 3위)이지만 가성비 최적 선택은 아닙니다.구성: 타임라인 → 사양표 → KDA/AttnRes 아키텍처 → 3대 Infra → 벤치마크 비교 → 라이선스 → API/자체 배포 → 지정학적 맥락 → 5단계 연동 → FAQ.

1. 과제 분석: 7/27 공개가 재평가를 받아야 하는 이유

1)'오픈소스' 함정: 공식은 open source가 아닌 open weight를 사용하며, 학습 데이터와 완전한 학습 코드는 비공개입니다. 2)라이선스 2대 게이트: MaaS 연간 매출 2,000만 달러 초과, 또는 MAU 1억 초과/월 매출 2,000만 달러 초과 시 추가 조항 발동. 3)자체 배포는 비현실적: 1.56TB 가중치, 공식 권장 64 GPU 슈퍼노드——개인 개발자에게는 API 또는 OpenRouter가 현실적입니다. 4)비용은 최저가 아님: 작업당 약 $0.95로 GLM-5.2($0.47)의 약 2배. 5)지정학적 논란: 미국 측 '산업 규모 증류' 혐의, 중국 7/28 'AI 패권주의' 반박——선정 시 컴플라이언스와 여론 리스크를 고려해야 합니다.

2. 타임라인: API 최초 공개부터 완전 공개까지 단 11일

날짜이벤트
7/16 밤K3가 kimi.com, Kimi Work, Kimi Code, API에서 최초 공개, 가중치 미공개
7/17업계 아키텍처 분석 집중; 신화사 '글로벌 최대 파라미터 오픈소스 모델' 보도
7/22–23미국 측 Moonshot AI의 Anthropic Fable 증류 혐의, 제재 위협
7/27 23:00완전 가중치·기술 보고서 공개; MoonEP·AgentEnv 오픈소스(FlashKDA는 선행 공개)
7/28중국 상무부 공식 대응; 국내 미디어 오픈소스 세부 보도

가중치 파일 약 1.56TB, Hugging Face 공개 30분 만에 트렌드 1위. API 최초 공개로부터 단 11일입니다.

3. Kimi K3 핵심 사양 일람

항목사양
총 파라미터2.8조(2.8T)
활성화 파라미터1,040억
아키텍처Mixture of Experts(MoE)
전문가 구성896 라우팅 전문가, 토큰당 16개 + 공유 전문가
어텐션Kimi Delta Attention(KDA) + 게이팅 MLA
컨텍스트100만 토큰
멀티모달네이티브 시각 이해(ViT-V2, 27층)
가중치 형식MXFP4 가중치 + MXFP8 활성화(SFT부터 양자화 인식 학습)
가중치 용량약 1.56TB(Hugging Face)
라이선스커스텀 라이선스(open weight, open source 아님)

4. 3대 아키텍처 혁신: KDA, AttnRes, Per-Head Muon

Kimi Delta Attention(KDA)

기존 Gated DeltaNet은 스칼라 망각 게이트를 사용하지만, KDA는 채널별 독립 감쇠율을 적용해 일부 특징은 장기 보존, 다른 특징은 빠르게 망각합니다. chunkwise DPLR 공식으로 선형 시간 재귀를 구현하고 소수의 Gated MLA 글로벌 어텐션 레이어와 교차 혼합——100만 토큰 컨텍스트를 지원하면서 KV Cache 메모리 소비를 억제하는 핵심 기술입니다.

Attention Residuals(AttnRes)

기존 잔차 연결은 레이어별 균등 누적으로 깊은 레이어에서 초기 정보가 희석됩니다. AttnRes는 선택적·입력 의존적 동적 집계로 변경——레이어당 RMSNorm 1개와 의사 쿼리 벡터 1개만 추가해 약 25% 학습 효율 향상, 파라미터 증가는 2% 미만입니다.

Per-Head Muon과 Stable LatentMoE

Muon 옵티마이저를 어텐션 헤드별 독립 최적화로 확장; MoE 레이어 896 중 16 선택(희소도 약 1.8%), Quantile Balancing과 MoonEP로 전문가 부하 불균형 해결.

5. 3대 오픈소스 Infra 기술

기술포지셔닝핵심 역량
MoonEP초대규모 세밀 MoE 통신 라이브러리과부하 전문가 임시 복제, 중복 전문가 수 이론적 상한 수학적 증명, 부하 균형 하 고통신 효율 유지
FlashKDACUTLASS 기반 KDA 고성능 연산자H20에서 prefill이 flash-linear-attention 기준 대비 1.72–2.22× 빠름; chunk_kda 직접 대체 백엔드로 사용 가능
AgentEnvKVCache.ai 공동 Agent 샌드박스(Firecracker microVM)checkpoint 지연 133ms, 복구 49ms, 메모리 오버서브스크립션 최대 6.5×(공식 데이터, 제3자 검증 대기)

6. 벤치마크 비교: GPT-5.6, Claude, GLM-4.5와 대결

SWE-bench Verified(Vals AI 독립 재검증, 2026년 7월)

모델점수공개일
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 인텔리전스 지수(max 추론 모드): Claude Fable 5(60) > GPT-5.6 Sol(59) > Kimi K3(약 57, 글로벌 3위, 오픈웨이트 1위) > GLM-5.2(51) > DeepSeek V4 Pro(44).

작업당 비용 약 $0.95——Claude Fable 5($2.4) 대비 60% 저렴하지만 GLM-5.2($0.47)보다 비쌈.오픈웨이트 진영 능력 천장이지만 가성비 최적은 아님. K3는 현재 Arena.ai Frontend Code Arena 1위.

7. 라이선스: 2대 상업적 게이트

  1. Model-as-a-Service 수익 게이트: MaaS 사업 연속 12개월 누적 수익 2,000만 달러 초과 시 Moonshot AI와 별도 상업 계약 필요.
  2. 규모 표시 게이트: MAU 1억 초과 또는 월 매출 2,000만 달러 초과 시 UI에 'Kimi K3' 표기 필수.

대부분의 중소 팀에게 2대 게이트는 거의 해당되지 않습니다. 'K3로 경쟁 MaaS를 시작'하는 계획이라면 1번 게이트가 법무상 레드라인입니다.

8. API 가격과 자체 배포 요건

토큰 유형가격(100만 토큰당)
입력(캐시 히트)$0.30
입력(캐시 미스)$3.00
출력(추론 과정 포함)$15.00

API 엔드포인트: https://api.moonshot.ai/v1, 모델 ID kimi-k3, OpenAI SDK 호환. Mooncake 분리형 추론 아키텍처에서 프로그래밍 워크로드 캐시 히트율 90%+, 실제 비용은 $0.30대에 근접. 자체 배포는 64 GPU 이상 슈퍼노드 권장; 개인 사용자에게는 OpenRouter(7개 프로바이더)가 현실적입니다.

9. 5단계 연동: 평가부터 K3 접속까지

  1. 이용 경로 명확화: API 호출 vs 제3자 호스팅 vs 자체 배포——99% 팀은 전자 2가지를 선택해야 합니다.
  2. 라이선스 검토: MaaS 수익과 MAU 게이트 대조, 추가 상업 계약 필요 여부 확인.
  3. OpenAI 호환 클라이언트 설정: Cursor / OpenClaw / 자체 Agent는 base URL과 API Key만 변경하면 연결 가능.
  4. 캐시 전략 활성화: 반복 코드 컨텍스트는 Mooncake 캐시 히트 경로 우선, 실제 토큰 비용 절감.
  5. 폴백 체인 구축: K3로 고난이도 작업, 일상 트래픽은 GLM-5.2 또는 DeepSeek V4 Flash로 다운그레이드해 청구서 관리.

10. 심층 분석: WAIC 2026 윈도우와 '3T 클럽' 경쟁

K3 오픈소스 시점은 WAIC 2026 기간과 겹치며 미중 '모델 증류' 분쟁과 중첩——미국은 Moonshot AI가 Anthropic Fable을 '산업 규모 증류'해 K3를 학습했다고 혐의하며 제재 위협; 중국 상무부는 7/28 미국의 'AI 패권주의'를 비난하며 반격 경고. Moonshot AI가 가중치·기술 보고서·3 Infra를 공개한 것은 완전한 엔지니어링 세부로 기술 경로 독립성을 자증하려는 의도도 있습니다.

3일 후, 알리바바(Moonshot AI 투자자 중 하나)가 24조 파라미터 Qwen3.8-Max-Preview를 공개해 K3에 대한 직접 대응으로 해석됐습니다. 중국산 대규모 언어 모델 경쟁은 '3T 클럽' 단계에 진입——파라미터 규모, 아키텍처 혁신, Infra 오픈소스의 삼위일체가 단순 벤치마크 경쟁보다 장기적 의미를 갖습니다.

Mac 개발자에게 K3 자체 배포는 비현실적이지만 API로 연결 가능; 로컬 폴백이 필요하면 GLM-5.2 등 소형 오픈소스 모델을 Apple Silicon에서 MLX 양자화 버전으로 실행할 수 있습니다. K3의 가치는 오픈웨이트 모델이 클로즈드 소스 최전선에 근접할 수 있음을 증명하고 생태계 전체의 가격·능력 기준을 끌어올린다는 점에 있습니다.

11. 자주 묻는 질문 FAQ

Kimi K3는 정말 오픈소스 모델인가요? 엄밀히는 아닙니다. open weight 분류: 가중치, 기술 보고서, 일부 Infra는 공개되지만 학습 데이터와 완전한 학습 코드는 비공개, OSI 기준 미충족.

무료 상업 이용 가능한가요? 대부분 시나리오에서 제한 없음; MaaS 연간 매출 2,000만 달러 초과 또는 MAU 1억 초과/월 매출 2,000만 달러 초과 시 라이선스 특정 조항 준수 필요.

자체 배포에 필요한 GPU 수는? 공식 권장 64 GPU 이상 슈퍼노드; 개인·기업 모두 공식 API 또는 OpenRouter가 현실적.

Kimi K2와 차이점은? K3는 K2.5의 약 3배 파라미터, AttnRes와 Per-Head Muon 신규 추가, 컨텍스트와 멀티모달 대폭 향상; 라이선스에 MaaS 수익 게이트 추가.

12. 마무리: API 연동 + Mac 로컬 폴백 하이브리드 아키텍처

Windows/Linux 클라우드 서버에서도 Kimi K3 API는 호출 가능하지만, Cursor 툴체인 연동, OpenClaw Agent 상주, 로컬 MLX 양자화 폴백, 그래픽 워크플로에서는 Apple Silicon Mac이 더 원활합니다. K3 자체 배포는 64 GPU 슈퍼노드가 필요하지만 API 연동은 base URL 변경만; 로컬 GLM-5.2 오프라인 백업, 장컨텍스트 Agent 분류, 7×24 안정 운영도 필요하다면 3단계 아키텍처를 권장합니다: 로컬 MLX로 양자화 OSS 모델이 일상 처리; Kimi K3 API가 고난이도 코딩·추론 담당; MACGPU 원격 Mac 노드가 OpenClaw/Hermes 상주와 통합 메모리 부족 장컨텍스트 작업 처리——3T 클럽 경쟁이 과열되는 가운데, 통제 가능한 연산 자원이 최선의 헤지입니다.