KIMI K3 開源權重
JULY_27_
RELEASE.

Kimi K3 2.8T 開源權重 7 月 27 日 Hugging Face 發布架構與基準對比

導語:2026 年 7 月,AI 圈最關注的時間線不是「又一家模型發布」,而是兩段式釋出:7 月 16 日 API 低調上線、7 月 27 日完整權重以 Modified MIT 落地 Hugging Face。本文是 Kimi K3 開源權重支柱文章,涵蓋 2.8T Stable LatentMoE 架構、定價與 AA 智能指數、基準勝負全景、自託管硬體門檻、開放權重 vs 開源辨析、產業地緣脈絡、5 步發布清單5 項可執行行動,以及 Mac 開發者的 MACGPU 實戰建議。架構與 API 深度評測請見 7/17 Kimi K3 深度評測

30 秒讀懂 · TL;DR

API 上線2026-07-16 · 模型 ID kimi-k3 · 無發布會
權重釋出2026-07-27 · Hugging Face · Modified MIT
規模2.8T 參數 · Stable LatentMoE · 896 專家 / 16 激活
上下文1,048,576 token(1M) · KDA 解碼最高 6.3× 加速
定價輸入 $3/M · 快取 $0.30/M · 輸出 $15/M
AA 智能指數K3 57.1 · 排 #3/189 · 落後 Fable 5(59.9)約 2.8 分
自託管4-bit 約 1.4TB · 生產推理需 64+ 加速卡

1. 兩段式發布:7/16 API vs 7/27 權重

月之暗面(Moonshot AI)採用罕見的先 API、後權重策略。7 月 16 日深夜,platform.kimi.ai 文件頂部掛上「Kimi K3 已上線」,開發者即可用 OpenAI 相容端點呼叫 kimi-k3;同時 kimi.com 免費帳號也可體驗。

7 月 27 日才是開源權重里程碑:完整 checkpoint 上 Hugging Face,授權為 Modified MIT(非純 MIT)。這意味著權重可下載、可微調、可在企業內網部署,但 LICENSE 附加條款需逐條審閱——尤其涉及大規模商用與衍生模型命名時。

時間點釋出內容適用對象
2026-07-16API、Web/App、OpenRouter 路由絕大多數開發者與產品團隊
2026-07-27HF 權重、技術報告、vLLM KDA/prefix caching有算力基礎設施的企業、研究機構、量化社群
7/27 後數日Ollama、GGUF 社群轉換、MLX 實驗分支邊緣部署與 Apple Silicon 愛好者

Modified MIT 重點:權重開放 ≠ 訓練堆疊開放。月之暗面釋出的是推理可用的 checkpoint + 架構說明,而非完整 pretrain pipeline。這也是下文「open weights vs open source」辨析的核心。

2. 架構速覽:2.8T 為何能塞進 1M 上下文

Kimi K3 以 2.8 萬億(2.8T) 參數成為迄今最大可下載開源權重模型。核心架構堆疊:

元件規格 / 作用
Stable LatentMoE896 個專家,每 forward 激活 16 個(1.8% 稀疏度)
Kimi Delta Attention (KDA)3:1 線性/全注意力混合 · KV 快取記憶體降 75% · 1M 解碼 6.3× 加速
Attention Residuals (AttnRes)跨層選擇性檢索,訓練效率約 +25%,額外算力 <2%
Gated MLA增強注意力選擇性,配合 MoE 路由穩定
Quantile Balancing依 router 分位數分配專家,消除脆弱 heuristic
Per-Head Muon各注意力頭獨立優化,大規模訓練更自適應
Sigmoid Tanh Unit (SiTU)改進激活控制,穩定極稀疏 MoE
量化原生訓練MXFP4 權重 + MXFP8 激活,day-0 支援 NVFP4 推論
上下文1,048,576 token · 原生視覺(文字/圖像/影片)
一句話:K3 不是單純堆參數,而是用 KDA + Stable LatentMoE 把「百萬 token 長記憶」從論文規格變成可計費、可部署的工程能力。

3. 定價與 AA 智能指數:API 仍是多數人的預設

項目Kimi K3Claude Fable 5GPT-5.6 Sol
輸入($/M token)$3.00$3.00$5.00
快取命中輸入$0.30
輸出($/M token)$15.00$15.00$30.00
AA 單任務成本$0.94$2.75
相對 Fable 5 節省65.8%(AA 標準化單任務測試)
AA Intelligence Index v4.157.1(#3/189)59.9(#1)58.9(#2)
上下文1M200K400K
  • 定價對標 Claude Sonnet 5($3/$15),但上下文為其 5 倍
  • Mooncake 分離式推理架構在編程工作流中快取命中率 90%+,實際平均輸入成本可壓至約 $0.55/M
  • 資料來源:Artificial Analysisplatform.kimi.ai

4. 基準全景:贏在哪、輸在哪

4.1 領先項目(Moonshot 自報 + AA 交叉驗證方向)

基準Kimi K3備註
Frontend Code Arena#1前端 Agent 實戰
Automation Bench30.8(#1)自動化工作流
SpreadsheetBench 2#1試算表推理
BrowseComp91.2瀏覽器 Agent
SWE Marathon42.0長時程編程(> Fable 35.0、Sol 39.0)
Terminal Bench 2.188.3終端工具鏈(Sol 88.8 略高)
Program Bench77.8程式生成
FrontierSWE81.2複雜 repo 修復(Fable 86.6 領先)

4.2 落後與風險(月之暗面亦公開承認)

項目K3 表現對比
GDPval v2 Elo落後通用知識經濟價值評估
DeepSWE67.5Fable 5 70.0 · Sol 73.0
幻覺率較 K2.6 上升長上下文場景需額外驗證
輸出打磨 / 穩定度落後 Fable / Sol正式文件、對外文案場景
AA 總排名#3/189月之暗面承認仍 trailing Fable 5 與 Sol

免責:多數基準為 Moonshot 自報,harness 各異(K3 用 Kimi Code、GPT 用 Codex、Claude 用 Claude Code)。VentureBeatr/LocalLLaMA 的獨立復現仍在進行,請作方向性參考。

5. 7/27 發布清單:5 步追蹤指南

  1. 確認 LICENSE:下載前閱讀 Modified MIT 全文,法務/合規簽核商用邊界
  2. 鎖定 Hugging Face repo:關注 moonshotai/Kimi-K3(預期命名),訂閱 release notification
  3. 準備推理框架:優先部署 vLLM(day-0 KDA + prefix caching);備選 SGLang、transformers
  4. 硬體預算評估:4-bit 約 1.4TB 儲存 + 64+ 加速卡;對照 K2.7 Code INT4(577GB)理解縮放曲線
  5. 社群轉換時間表:Ollama / GGUF / llama.cpp 通常 lag 數日;Mac 端 MLX 分支需追蹤社群 PR,勿假設 day-0 可用

6. 自託管現實檢查:誰該下載、誰該留 API

部署方式硬體 / 成本適合場景
官方 API按 token 計費 · 零硬體多數 SaaS、Cursor 路由、快速驗證
4-bit 自託管~1.4TB 儲存 · 64+ GPU 超節點金融/政企內網、無外連合規、大規模微調
參考:K2.7 Code INT4~577GB理解 K 系列量化後體積曲線
Mac / 筆電本地不可行(2.8T 級)等社群 distill / 小模型,或走 API + 遠端節點

務實結論:7/27 權重釋出是產業里程碑,但對 99% 開發者,API 仍是預設路徑。自託管留給有現成算力叢集、合規隔離需求、或研究微調的團隊。

7. 產業脈絡:開源追近閉源、地緣與 WAIC 敘事

  • 智能差距收窄:AA 指數顯示 open weights 與 closed frontier 差距約 2–3 分——K3(57.1)距 Fable 5(59.9)僅 2.8 分
  • 地緣敘事:2026 WAIC 上海開幕前夕釋出 K3;同期美國市場 Claude Fable 5 相關出口/部署限制話題升溫,推動部分團隊評估可自託管開源權重作為 Plan B
  • 中國模型浪潮:GLM-5.2、DeepSeek V4、MiniMax M3 等同期競爭,參數、定價、Agent 基準全面內卷
  • 月之暗面 comeback 弧線:K2 → K2.5 → K3,從「最大開源參數」標籤 reclaimed,到 Agent 基準多項 #1,但仍誠實承認 trailing Fable 5 與 Sol 的綜合智能與穩定度

8. Open Weights vs Open Source:別混用

概念包含內容K3 7/27 狀態
Open weights可下載 checkpoint、LICENSE、推理文件✅ Modified MIT 權重
Open source(嚴格)+ 訓練程式碼、資料管線、可完全重現❌ 未承諾
實務影響可微調、內網部署、研究 ablation✅ 適用
實務限制無法從零 pretrain 復現需接受黑盒起點

媒體常寫「全球最大開源模型」,技術上更精確的說法是最大開放權重(open weights)模型。合規審計、論文引用、採購招標時,這個區別會直接影響表述。

9. 五項可執行行動(今天就能做)

  1. 開通 API 做 A/B:在 platform.kimi.ai 取 Key,用同一 prompt 集對比 Fable 5 / Sol 路由(OpenRouter 亦可)
  2. 啟用 prefix caching:重複 system prompt + 大型 codebase 前綴場景,鎖定 $0.30/M 快取價
  3. 場景分流:K3 負責 SWE Marathon / BrowseComp / Spreadsheet 類長 Agent;Fable 5 負責 FrontierSWE / 高打磨文案
  4. 7/27 前寫好部署 runbook:若計畫自託管,預先申請 GPU 叢集配額、儲存頻寬、HF token
  5. Mac 端 Agent 壓測隔離:Cursor + 1M context 會吃爆本機記憶體與磁碟——用 MACGPU 遠端 Mac 節點跑回歸,主力機保持穩定(見下文)

10. 場景選型矩陣

使用場景首選原因
長時程 Agent 編程Kimi K3SWE Marathon 42.0 領先 · 1M 防中斷
前端 / 試算表 AgentKimi K3Frontend Code Arena、SpreadsheetBench 2 #1
複雜 repo 級 bug 修復Claude Fable 5FrontierSWE 86.6 大幅領先
終端 / 工具鏈 AgentGPT-5.6 SolTerminal Bench 2.1 88.8
成本敏感量產DeepSeek V4 Pro輸出 $3.48/M
7/27 後最強自託管Kimi K32.8T 開放權重新標竿
合規隔離 + 可審 LICENSEKimi K3 權重Modified MIT · 內網部署

11. API 快速接入

from openai import OpenAI client = OpenAI( api_key="YOUR_MOONSHOT_API_KEY", base_url="https://api.moonshot.ai/v1" ) response = client.chat.completions.create( model="kimi-k3", messages=[{"role": "user", "content": "分析此 codebase 的效能瓶頸..."}] ) print(response.choices[0].message.content)

OpenRouter 模型 ID:moonshotai/kimi-k3(官方定價、無加價、完整 1M 上下文)。

12. 常見問題 FAQ

Q:7/16 API 與 7/27 權重有什麼區別?
A:API 是雲端即用;7/27 才是 Hugging Face 完整權重 + Modified MIT,供自託管與微調。

Q:Modified MIT 能商用嗎?
A:視 LICENSE 附加條款而定。下載前必讀全文,勿假設等同標準 MIT。

Q:自託管要多少硬體?
A:4-bit 約 1.4TB 儲存;生產推理通常 64+ 加速卡。參考 K2.7 Code INT4 577GB。

Q:K3 比 Fable 5 / Sol 差多少?
A:AA 指數 K3 57.1 vs Sol 58.9 vs Fable 59.9;差距約 2–3 分,Agent 子項互有勝負。

Q:open weights 等於 open source 嗎?
A:不等於。K3 釋出權重與技術報告,非完整訓練開源。

Q:7/27 當天會有 Ollama 嗎?
A:通常不會 day-0。vLLM/transformers 優先;Ollama/GGUF 社群轉換 lag 數日。

13. 資料來源

14. 結語:API 隨處可用,Agent 壓測仍該上 Mac

註冊 kimi.com、複製 API Key、在 OpenRouter 切路由——Windows 或 Linux 都能完成。但若你要跑 Cursor + Kimi K3 百萬 token 長上下文編程、Xcode 側 Agent 整合、或追蹤 MLX/GGUF 量化進度,Apple Silicon 統一記憶體 + Metal 仍是摩擦最低的路徑。

務實分工:日常開發走 API;Kimi Code 壓測、多 repo SWE Marathon 回歸、1M token 文件批次任務,丟到 MACGPU 遠端 Mac mini M4 節點——按需租用、SSH 安全連線。7/27 權重落地前,先把 Agent 工作負載隔離,避免主力機被 1M 上下文拖垮記憶體與磁碟 I/O。