KIMI K3
2.8T_
OPEN_
WEIGHT.
7月27日晚23點左右,月之暗面正式發布 Kimi K3 完整模型權重與技術報告,並同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施。痛點:K3 是 2.8 兆參數的 MoE 模型,但「開源」與「開放權重」語義不同,授權條款裡還藏著兩道商業門檻。結論:它是開源陣營能力天花板(AA Index 全球第3),卻不是性價比最優選項。結構預告:時間線 → 參數表 → KDA/AttnRes 架構 → 三大 Infra → 跑分對比 → 授權條款 → API/自部署 → 地緣背景 → 五步接入 → FAQ。
1. 痛點拆解:為什麼 7/27 這次發布值得重新評估
1)「開源」翻譯陷阱:官方從未使用 open source,一直稱 open weight——訓練資料與完整訓練程式碼未公開。2)授權兩道門檻:MaaS 年收入超 2000 萬美元、或月活超 1 億/月收入超 2000 萬美元,觸發額外條款。3)自部署幾乎不現實:1.56TB 權重、官方建議 64 卡超節點——個人開發者更現實的路徑是 API 或 OpenRouter。4)成本並非最優:每任務約 $0.95,比 GLM-5.2($0.47)貴近一倍。5)地緣爭議疊加:美方指控「工業化蒸餾」、中方 7/28 回應「AI 霸權主義」——選型需兼顧合規與輿論風險。
2. 時間線:從 API 首發到全面開源,只用了 11 天
| 日期 | 事件 |
|---|---|
| 7/16 夜 | K3 在 kimi.com、Kimi Work、Kimi Code、API 首發,權重未公開 |
| 7/17 | 業界密集分析架構;新華社稱「全球參數最大開源模型」 |
| 7/22–23 | 美方指控月之暗面「工業化蒸餾」Anthropic Fable 訓練 K3,威脅制裁 |
| 7/27 23:00 | 完整權重、技術報告發布;MoonEP、AgentEnv 開源(FlashKDA 此前已開源) |
| 7/28 | 中國商務部公開回應;國內媒體跟進報導開源細節 |
權重檔案約 1.56TB,Hugging Face 上線半小時登頂趨勢榜第一。距 API 首發僅 11 天。
3. Kimi K3 核心參數一覽
| 項目 | 參數 |
|---|---|
| 總參數量 | 2.8 兆(2.8T) |
| 啟用參數量 | 約 1040 億 |
| 架構類型 | 混合專家模型(MoE) |
| 專家配置 | 896 路由專家,每 token 啟用 16 個 + 共享專家 |
| 注意力機制 | Kimi Delta Attention(KDA)+ 門控 MLA |
| 上下文視窗 | 100 萬 token |
| 多模態 | 原生視覺理解(ViT-V2,27 層) |
| 權重格式 | MXFP4 權重 + MXFP8 啟用(SFT 起量化感知訓練) |
| 權重體積 | 約 1.56TB(Hugging Face) |
| License | 自訂授權(open weight,非 open source) |
4. 三大架構創新:KDA、AttnRes 與 Per-Head Muon
Kimi Delta Attention(KDA)
傳統 Gated DeltaNet 用標量級遺忘門;KDA 改為逐通道獨立衰減率,某些特徵長期保留、另一些快速遺忘。採用 chunkwise DPLR 公式實現線性時間遞迴,與少量 Gated MLA 全局注意力層交替混合——支撐 100 萬 token 上下文同時壓低 KV Cache 記憶體開銷的核心原因。
Attention Residuals(AttnRes)
傳統殘差連接逐層均勻累加,深層早期資訊易被稀釋。AttnRes 改為選擇性、輸入依賴的動態聚合——每層僅新增一個 RMSNorm 和一個偽查詢向量,帶來約 25% 訓練效率提升,參數開銷不到 2%。
Per-Head Muon 與 Stable LatentMoE
Muon 優化器擴展為逐注意力頭獨立優化;MoE 層 896 選 16(稀疏度約 1.8%),配合 Quantile Balancing 與 MoonEP 解決專家負載不均衡。
5. 三大開源 Infra 技術
| 技術 | 定位 | 關鍵能力 |
|---|---|---|
| MoonEP | 超大規模細粒度 MoE 通訊函式庫 | 臨時複製過載專家,數學證明冗餘專家數理論上界,負載均衡下維持高通訊效率 |
| FlashKDA | 基於 CUTLASS 的 KDA 高效能算子 | H20 上 prefill 比 flash-linear-attention 基線快 1.72–2.22×;可作為 chunk_kda 直接替代後端 |
| AgentEnv | 與 KVCache.ai 聯合的 Agent 沙箱(Firecracker microVM) | checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5×(官方資料,待第三方複現) |
6. 跑分對比:和 GPT-5.6、Claude、GLM-4.5 比一比
SWE-bench Verified(Vals AI 獨立複測,2026年7月)
| 模型 | 分數 | 發布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指數(max 推理檔):Claude Fable 5(60)> GPT-5.6 Sol(59)> Kimi K3(約57,全球第3,開源第1) > GLM-5.2(51)> DeepSeek V4 Pro(44)。
每任務成本約 $0.95——比 Claude Fable 5($2.4)便宜 60%,但比 GLM-5.2($0.47)更貴。開源陣營能力天花板,非性價比最優。 K3 目前在 Arena.ai Frontend Code Arena 排名第一。
7. 授權條款:兩道商業門檻
- Model-as-a-Service 收入門檻:MaaS 業務連續 12 個月累計收入超 2000 萬美元,須與月之暗面另行簽署商業協議。
- 規模展示門檻:月活超 1 億或月收入超 2000 萬美元,須在介面顯著展示「Kimi K3」字樣。
對絕大多數中小團隊,兩道門檻幾乎不會觸發;若商業計劃是「拿 K3 開競爭的模型服務」,第一道門檻是法務紅線。
8. API 定價與自部署門檻
| Token 類型 | 價格(每百萬 token) |
|---|---|
| 輸入(快取命中) | $0.30 |
| 輸入(快取未命中) | $3.00 |
| 輸出(含推理過程) | $15.00 |
API 端點:https://api.moonshot.ai/v1,模型 ID kimi-k3,相容 OpenAI SDK。Mooncake 分離式推理架構在程式開發類工作負載上快取命中率可達 90%+,實際成本更接近 $0.30 檔。自部署建議 64 卡及以上超節點;個人使用者更現實路徑是 OpenRouter(已有 7 家服務商)。
9. 五步落地:從評估到接入 K3
- 明確使用路徑:API 呼叫 vs 第三方託管 vs 自部署——99% 團隊應選前兩者。
- 審查授權條款:對照 MaaS 收入與 MAU 門檻,確認是否需要額外商業協議。
- 設定 OpenAI 相容用戶端:Cursor / OpenClaw / 自建 Agent 改 base URL 與 API Key 即可接入。
- 啟用快取策略:重複程式碼上下文場景優先走 Mooncake 快取命中路徑,壓低實際 token 成本。
- 建立 fallback 鏈:K3 處理高難度任務,日常流量降級到 GLM-5.2 或 DeepSeek V4 Flash,控制帳單。
10. 深度洞察:WAIC 2026 窗口與「3T 俱樂部」競賽
K3 開源節點卡在 WAIC 2026 窗口期,疊加中美「模型蒸餾」爭端——美方指控月之暗面「工業化蒸餾」Anthropic Fable 訓練 K3 並威脅制裁;中國商務部 7/28 指責美方「AI 霸權主義」並威脅反制。月之暗面選擇公開權重、技術報告與三項 Infra,某種程度上是用完整工程細節自證技術路徑獨立性。
三天後,阿里巴巴(月之暗面投資方之一)發布 24 兆參數 Qwen3.8-Max-Preview,被外界解讀為對 K3 的直接回應。國產大模型競爭正式進入「3T 俱樂部」階段——參數規模、架構創新、Infra 開源三位一體,比單純刷榜更有長期意義。
對 Mac 開發者而言,K3 自部署不現實,但可透過 API 接入;若需本地兜底,GLM-5.2 等更小開源模型可在 Apple Silicon 上用 MLX 跑量化版。K3 的價值在於:證明開放權重模型可以逼近閉源前沿,推動整個生態的定價與能力基準上移。
11. 常見問題 FAQ
Kimi K3 真的是開源模型嗎? 嚴格來說不是。屬於 open weight:權重、技術報告、部分 Infra 公開,訓練資料與完整訓練程式碼未公開,不符合 OSI 標準。
可以免費商用嗎? 絕大多數場景不受限制;MaaS 年收入超 2000 萬美元或 MAU 超 1 億/月收入超 2000 萬美元需滿足授權特定條款。
需要多少 GPU 自部署? 官方建議 64 卡及以上超節點;個人與企業更現實方式是官方 API 或 OpenRouter。
和 Kimi K2 有什麼區別? K3 參數約為 K2.5 的 3 倍,新增 AttnRes 與 Per-Head Muon,上下文與多模態大幅提升;授權新增 MaaS 收入門檻。
12. 收束:API 接入 + Mac 本地兜底的混合架構
純 Windows/Linux 雲主機可以調 Kimi K3 API,卻在Cursor 工具鏈協同、OpenClaw Agent 常駐、本地 MLX 量化兜底與圖形工作流上不如 Apple Silicon Mac 順滑。K3 自部署需 64 卡超節點,但 API 接入只需改 base URL;若你還需要本地 GLM-5.2 離線備份、長上下文 Agent 分流與 7×24 穩定運行,推薦三檔架構:本機 MLX 跑量化開源模型處理日常量;Kimi K3 API 承接高難度程式開發與推理;MACGPU 遠端 Mac 節點 承接 OpenClaw/Hermes 常駐與統一記憶體吃緊的長上下文任務——在 3T 俱樂部競賽白熱化之際,可控算力就是最好的對沖。