KIMI K3
2.8T_
OPEN_
WEIGHT.

Kimi K3 2.8兆參數開放權重模型架構

7月27日晚23點左右,月之暗面正式發布 Kimi K3 完整模型權重與技術報告,並同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施。痛點:K3 是 2.8 兆參數的 MoE 模型,但「開源」與「開放權重」語義不同,授權條款裡還藏著兩道商業門檻。結論:它是開源陣營能力天花板(AA Index 全球第3),卻不是性價比最優選項。結構預告:時間線 → 參數表 → KDA/AttnRes 架構 → 三大 Infra → 跑分對比 → 授權條款 → API/自部署 → 地緣背景 → 五步接入 → FAQ。

1. 痛點拆解:為什麼 7/27 這次發布值得重新評估

1)「開源」翻譯陷阱:官方從未使用 open source,一直稱 open weight——訓練資料與完整訓練程式碼未公開。2)授權兩道門檻:MaaS 年收入超 2000 萬美元、或月活超 1 億/月收入超 2000 萬美元,觸發額外條款。3)自部署幾乎不現實:1.56TB 權重、官方建議 64 卡超節點——個人開發者更現實的路徑是 API 或 OpenRouter。4)成本並非最優:每任務約 $0.95,比 GLM-5.2($0.47)貴近一倍。5)地緣爭議疊加:美方指控「工業化蒸餾」、中方 7/28 回應「AI 霸權主義」——選型需兼顧合規與輿論風險。

2. 時間線:從 API 首發到全面開源,只用了 11 天

日期事件
7/16 夜K3 在 kimi.com、Kimi Work、Kimi Code、API 首發,權重未公開
7/17業界密集分析架構;新華社稱「全球參數最大開源模型」
7/22–23美方指控月之暗面「工業化蒸餾」Anthropic Fable 訓練 K3,威脅制裁
7/27 23:00完整權重、技術報告發布;MoonEP、AgentEnv 開源(FlashKDA 此前已開源)
7/28中國商務部公開回應;國內媒體跟進報導開源細節

權重檔案約 1.56TB,Hugging Face 上線半小時登頂趨勢榜第一。距 API 首發僅 11 天

3. Kimi K3 核心參數一覽

項目參數
總參數量2.8 兆(2.8T)
啟用參數量1040 億
架構類型混合專家模型(MoE)
專家配置896 路由專家,每 token 啟用 16 個 + 共享專家
注意力機制Kimi Delta Attention(KDA)+ 門控 MLA
上下文視窗100 萬 token
多模態原生視覺理解(ViT-V2,27 層)
權重格式MXFP4 權重 + MXFP8 啟用(SFT 起量化感知訓練)
權重體積約 1.56TB(Hugging Face)
License自訂授權(open weight,非 open source)

4. 三大架構創新:KDA、AttnRes 與 Per-Head Muon

Kimi Delta Attention(KDA)

傳統 Gated DeltaNet 用標量級遺忘門;KDA 改為逐通道獨立衰減率,某些特徵長期保留、另一些快速遺忘。採用 chunkwise DPLR 公式實現線性時間遞迴,與少量 Gated MLA 全局注意力層交替混合——支撐 100 萬 token 上下文同時壓低 KV Cache 記憶體開銷的核心原因。

Attention Residuals(AttnRes)

傳統殘差連接逐層均勻累加,深層早期資訊易被稀釋。AttnRes 改為選擇性、輸入依賴的動態聚合——每層僅新增一個 RMSNorm 和一個偽查詢向量,帶來約 25% 訓練效率提升,參數開銷不到 2%

Per-Head Muon 與 Stable LatentMoE

Muon 優化器擴展為逐注意力頭獨立優化;MoE 層 896 選 16(稀疏度約 1.8%),配合 Quantile Balancing 與 MoonEP 解決專家負載不均衡。

5. 三大開源 Infra 技術

技術定位關鍵能力
MoonEP超大規模細粒度 MoE 通訊函式庫臨時複製過載專家,數學證明冗餘專家數理論上界,負載均衡下維持高通訊效率
FlashKDA基於 CUTLASS 的 KDA 高效能算子H20 上 prefill 比 flash-linear-attention 基線快 1.72–2.22×;可作為 chunk_kda 直接替代後端
AgentEnv與 KVCache.ai 聯合的 Agent 沙箱(Firecracker microVM)checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5×(官方資料,待第三方複現)

6. 跑分對比:和 GPT-5.6、Claude、GLM-4.5 比一比

SWE-bench Verified(Vals AI 獨立複測,2026年7月)

模型分數發布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 智能指數(max 推理檔):Claude Fable 5(60)> GPT-5.6 Sol(59)> Kimi K3(約57,全球第3,開源第1) > GLM-5.2(51)> DeepSeek V4 Pro(44)。

每任務成本約 $0.95——比 Claude Fable 5($2.4)便宜 60%,但比 GLM-5.2($0.47)更貴。開源陣營能力天花板,非性價比最優。 K3 目前在 Arena.ai Frontend Code Arena 排名第一。

7. 授權條款:兩道商業門檻

  1. Model-as-a-Service 收入門檻:MaaS 業務連續 12 個月累計收入超 2000 萬美元,須與月之暗面另行簽署商業協議。
  2. 規模展示門檻:月活超 1 億或月收入超 2000 萬美元,須在介面顯著展示「Kimi K3」字樣。

對絕大多數中小團隊,兩道門檻幾乎不會觸發;若商業計劃是「拿 K3 開競爭的模型服務」,第一道門檻是法務紅線。

8. API 定價與自部署門檻

Token 類型價格(每百萬 token)
輸入(快取命中)$0.30
輸入(快取未命中)$3.00
輸出(含推理過程)$15.00

API 端點:https://api.moonshot.ai/v1,模型 ID kimi-k3,相容 OpenAI SDK。Mooncake 分離式推理架構在程式開發類工作負載上快取命中率可達 90%+,實際成本更接近 $0.30 檔。自部署建議 64 卡及以上超節點;個人使用者更現實路徑是 OpenRouter(已有 7 家服務商)。

9. 五步落地:從評估到接入 K3

  1. 明確使用路徑:API 呼叫 vs 第三方託管 vs 自部署——99% 團隊應選前兩者。
  2. 審查授權條款:對照 MaaS 收入與 MAU 門檻,確認是否需要額外商業協議。
  3. 設定 OpenAI 相容用戶端:Cursor / OpenClaw / 自建 Agent 改 base URL 與 API Key 即可接入。
  4. 啟用快取策略:重複程式碼上下文場景優先走 Mooncake 快取命中路徑,壓低實際 token 成本。
  5. 建立 fallback 鏈:K3 處理高難度任務,日常流量降級到 GLM-5.2 或 DeepSeek V4 Flash,控制帳單。

10. 深度洞察:WAIC 2026 窗口與「3T 俱樂部」競賽

K3 開源節點卡在 WAIC 2026 窗口期,疊加中美「模型蒸餾」爭端——美方指控月之暗面「工業化蒸餾」Anthropic Fable 訓練 K3 並威脅制裁;中國商務部 7/28 指責美方「AI 霸權主義」並威脅反制。月之暗面選擇公開權重、技術報告與三項 Infra,某種程度上是用完整工程細節自證技術路徑獨立性。

三天後,阿里巴巴(月之暗面投資方之一)發布 24 兆參數 Qwen3.8-Max-Preview,被外界解讀為對 K3 的直接回應。國產大模型競爭正式進入「3T 俱樂部」階段——參數規模、架構創新、Infra 開源三位一體,比單純刷榜更有長期意義。

對 Mac 開發者而言,K3 自部署不現實,但可透過 API 接入;若需本地兜底,GLM-5.2 等更小開源模型可在 Apple Silicon 上用 MLX 跑量化版。K3 的價值在於:證明開放權重模型可以逼近閉源前沿,推動整個生態的定價與能力基準上移。

11. 常見問題 FAQ

Kimi K3 真的是開源模型嗎? 嚴格來說不是。屬於 open weight:權重、技術報告、部分 Infra 公開,訓練資料與完整訓練程式碼未公開,不符合 OSI 標準。

可以免費商用嗎? 絕大多數場景不受限制;MaaS 年收入超 2000 萬美元或 MAU 超 1 億/月收入超 2000 萬美元需滿足授權特定條款。

需要多少 GPU 自部署? 官方建議 64 卡及以上超節點;個人與企業更現實方式是官方 API 或 OpenRouter。

和 Kimi K2 有什麼區別? K3 參數約為 K2.5 的 3 倍,新增 AttnRes 與 Per-Head Muon,上下文與多模態大幅提升;授權新增 MaaS 收入門檻。

12. 收束:API 接入 + Mac 本地兜底的混合架構

純 Windows/Linux 雲主機可以調 Kimi K3 API,卻在Cursor 工具鏈協同、OpenClaw Agent 常駐、本地 MLX 量化兜底與圖形工作流上不如 Apple Silicon Mac 順滑。K3 自部署需 64 卡超節點,但 API 接入只需改 base URL;若你還需要本地 GLM-5.2 離線備份、長上下文 Agent 分流與 7×24 穩定運行,推薦三檔架構:本機 MLX 跑量化開源模型處理日常量;Kimi K3 API 承接高難度程式開發與推理;MACGPU 遠端 Mac 節點 承接 OpenClaw/Hermes 常駐與統一記憶體吃緊的長上下文任務——在 3T 俱樂部競賽白熱化之際,可控算力就是最好的對沖。