KIMI K3 開源權重
JULY_27_
RELEASE.
導語:2026 年 7 月,AI 圈最關注的時間線不是「又一家模型發布」,而是兩段式釋出:7 月 16 日 API 低調上線、7 月 27 日完整權重以 Modified MIT 落地 Hugging Face。本文是 Kimi K3 開源權重支柱文章,涵蓋 2.8T Stable LatentMoE 架構、定價與 AA 智能指數、基準勝負全景、自託管硬體門檻、開放權重 vs 開源辨析、產業地緣脈絡、5 步發布清單、5 項可執行行動,以及 Mac 開發者的 MACGPU 實戰建議。架構與 API 深度評測請見 7/17 Kimi K3 深度評測。
30 秒讀懂 · TL;DR
| API 上線 | 2026-07-16 · 模型 ID kimi-k3 · 無發布會 |
| 權重釋出 | 2026-07-27 · Hugging Face · Modified MIT |
| 規模 | 2.8T 參數 · Stable LatentMoE · 896 專家 / 16 激活 |
| 上下文 | 1,048,576 token(1M) · KDA 解碼最高 6.3× 加速 |
| 定價 | 輸入 $3/M · 快取 $0.30/M · 輸出 $15/M |
| AA 智能指數 | K3 57.1 · 排 #3/189 · 落後 Fable 5(59.9)約 2.8 分 |
| 自託管 | 4-bit 約 1.4TB · 生產推理需 64+ 加速卡 |
1. 兩段式發布:7/16 API vs 7/27 權重
月之暗面(Moonshot AI)採用罕見的先 API、後權重策略。7 月 16 日深夜,platform.kimi.ai 文件頂部掛上「Kimi K3 已上線」,開發者即可用 OpenAI 相容端點呼叫 kimi-k3;同時 kimi.com 免費帳號也可體驗。
7 月 27 日才是開源權重里程碑:完整 checkpoint 上 Hugging Face,授權為 Modified MIT(非純 MIT)。這意味著權重可下載、可微調、可在企業內網部署,但 LICENSE 附加條款需逐條審閱——尤其涉及大規模商用與衍生模型命名時。
| 時間點 | 釋出內容 | 適用對象 |
|---|---|---|
| 2026-07-16 | API、Web/App、OpenRouter 路由 | 絕大多數開發者與產品團隊 |
| 2026-07-27 | HF 權重、技術報告、vLLM KDA/prefix caching | 有算力基礎設施的企業、研究機構、量化社群 |
| 7/27 後數日 | Ollama、GGUF 社群轉換、MLX 實驗分支 | 邊緣部署與 Apple Silicon 愛好者 |
Modified MIT 重點:權重開放 ≠ 訓練堆疊開放。月之暗面釋出的是推理可用的 checkpoint + 架構說明,而非完整 pretrain pipeline。這也是下文「open weights vs open source」辨析的核心。
2. 架構速覽:2.8T 為何能塞進 1M 上下文
Kimi K3 以 2.8 萬億(2.8T) 參數成為迄今最大可下載開源權重模型。核心架構堆疊:
| 元件 | 規格 / 作用 |
|---|---|
| Stable LatentMoE | 896 個專家,每 forward 激活 16 個(1.8% 稀疏度) |
| Kimi Delta Attention (KDA) | 3:1 線性/全注意力混合 · KV 快取記憶體降 75% · 1M 解碼 6.3× 加速 |
| Attention Residuals (AttnRes) | 跨層選擇性檢索,訓練效率約 +25%,額外算力 <2% |
| Gated MLA | 增強注意力選擇性,配合 MoE 路由穩定 |
| Quantile Balancing | 依 router 分位數分配專家,消除脆弱 heuristic |
| Per-Head Muon | 各注意力頭獨立優化,大規模訓練更自適應 |
| Sigmoid Tanh Unit (SiTU) | 改進激活控制,穩定極稀疏 MoE |
| 量化原生訓練 | MXFP4 權重 + MXFP8 激活,day-0 支援 NVFP4 推論 |
| 上下文 | 1,048,576 token · 原生視覺(文字/圖像/影片) |
一句話:K3 不是單純堆參數,而是用 KDA + Stable LatentMoE 把「百萬 token 長記憶」從論文規格變成可計費、可部署的工程能力。
3. 定價與 AA 智能指數:API 仍是多數人的預設
| 項目 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| 輸入($/M token) | $3.00 | $3.00 | $5.00 |
| 快取命中輸入 | $0.30 | — | — |
| 輸出($/M token) | $15.00 | $15.00 | $30.00 |
| AA 單任務成本 | $0.94 | $2.75 | — |
| 相對 Fable 5 節省 | 65.8%(AA 標準化單任務測試) | ||
| AA Intelligence Index v4.1 | 57.1(#3/189) | 59.9(#1) | 58.9(#2) |
| 上下文 | 1M | 200K | 400K |
- 定價對標 Claude Sonnet 5($3/$15),但上下文為其 5 倍
- Mooncake 分離式推理架構在編程工作流中快取命中率 90%+,實際平均輸入成本可壓至約 $0.55/M
- 資料來源:Artificial Analysis、platform.kimi.ai
4. 基準全景:贏在哪、輸在哪
4.1 領先項目(Moonshot 自報 + AA 交叉驗證方向)
| 基準 | Kimi K3 | 備註 |
|---|---|---|
| Frontend Code Arena | #1 | 前端 Agent 實戰 |
| Automation Bench | 30.8(#1) | 自動化工作流 |
| SpreadsheetBench 2 | #1 | 試算表推理 |
| BrowseComp | 91.2 | 瀏覽器 Agent |
| SWE Marathon | 42.0 | 長時程編程(> Fable 35.0、Sol 39.0) |
| Terminal Bench 2.1 | 88.3 | 終端工具鏈(Sol 88.8 略高) |
| Program Bench | 77.8 | 程式生成 |
| FrontierSWE | 81.2 | 複雜 repo 修復(Fable 86.6 領先) |
4.2 落後與風險(月之暗面亦公開承認)
| 項目 | K3 表現 | 對比 |
|---|---|---|
| GDPval v2 Elo | 落後 | 通用知識經濟價值評估 |
| DeepSWE | 67.5 | Fable 5 70.0 · Sol 73.0 |
| 幻覺率 | 較 K2.6 上升 | 長上下文場景需額外驗證 |
| 輸出打磨 / 穩定度 | 落後 Fable / Sol | 正式文件、對外文案場景 |
| AA 總排名 | #3/189 | 月之暗面承認仍 trailing Fable 5 與 Sol |
免責:多數基準為 Moonshot 自報,harness 各異(K3 用 Kimi Code、GPT 用 Codex、Claude 用 Claude Code)。VentureBeat 與 r/LocalLLaMA 的獨立復現仍在進行,請作方向性參考。
5. 7/27 發布清單:5 步追蹤指南
- 確認 LICENSE:下載前閱讀 Modified MIT 全文,法務/合規簽核商用邊界
- 鎖定 Hugging Face repo:關注
moonshotai/Kimi-K3(預期命名),訂閱 release notification - 準備推理框架:優先部署 vLLM(day-0 KDA + prefix caching);備選 SGLang、transformers
- 硬體預算評估:4-bit 約 1.4TB 儲存 + 64+ 加速卡;對照 K2.7 Code INT4(577GB)理解縮放曲線
- 社群轉換時間表:Ollama / GGUF / llama.cpp 通常 lag 數日;Mac 端 MLX 分支需追蹤社群 PR,勿假設 day-0 可用
6. 自託管現實檢查:誰該下載、誰該留 API
| 部署方式 | 硬體 / 成本 | 適合場景 |
|---|---|---|
| 官方 API | 按 token 計費 · 零硬體 | 多數 SaaS、Cursor 路由、快速驗證 |
| 4-bit 自託管 | ~1.4TB 儲存 · 64+ GPU 超節點 | 金融/政企內網、無外連合規、大規模微調 |
| 參考:K2.7 Code INT4 | ~577GB | 理解 K 系列量化後體積曲線 |
| Mac / 筆電本地 | 不可行(2.8T 級) | 等社群 distill / 小模型,或走 API + 遠端節點 |
務實結論:7/27 權重釋出是產業里程碑,但對 99% 開發者,API 仍是預設路徑。自託管留給有現成算力叢集、合規隔離需求、或研究微調的團隊。
7. 產業脈絡:開源追近閉源、地緣與 WAIC 敘事
- 智能差距收窄:AA 指數顯示 open weights 與 closed frontier 差距約 2–3 分——K3(57.1)距 Fable 5(59.9)僅 2.8 分
- 地緣敘事:2026 WAIC 上海開幕前夕釋出 K3;同期美國市場 Claude Fable 5 相關出口/部署限制話題升溫,推動部分團隊評估可自託管開源權重作為 Plan B
- 中國模型浪潮:GLM-5.2、DeepSeek V4、MiniMax M3 等同期競爭,參數、定價、Agent 基準全面內卷
- 月之暗面 comeback 弧線:K2 → K2.5 → K3,從「最大開源參數」標籤 reclaimed,到 Agent 基準多項 #1,但仍誠實承認 trailing Fable 5 與 Sol 的綜合智能與穩定度
8. Open Weights vs Open Source:別混用
| 概念 | 包含內容 | K3 7/27 狀態 |
|---|---|---|
| Open weights | 可下載 checkpoint、LICENSE、推理文件 | ✅ Modified MIT 權重 |
| Open source(嚴格) | + 訓練程式碼、資料管線、可完全重現 | ❌ 未承諾 |
| 實務影響 | 可微調、內網部署、研究 ablation | ✅ 適用 |
| 實務限制 | 無法從零 pretrain 復現 | 需接受黑盒起點 |
媒體常寫「全球最大開源模型」,技術上更精確的說法是最大開放權重(open weights)模型。合規審計、論文引用、採購招標時,這個區別會直接影響表述。
9. 五項可執行行動(今天就能做)
- 開通 API 做 A/B:在 platform.kimi.ai 取 Key,用同一 prompt 集對比 Fable 5 / Sol 路由(OpenRouter 亦可)
- 啟用 prefix caching:重複 system prompt + 大型 codebase 前綴場景,鎖定 $0.30/M 快取價
- 場景分流:K3 負責 SWE Marathon / BrowseComp / Spreadsheet 類長 Agent;Fable 5 負責 FrontierSWE / 高打磨文案
- 7/27 前寫好部署 runbook:若計畫自託管,預先申請 GPU 叢集配額、儲存頻寬、HF token
- Mac 端 Agent 壓測隔離:Cursor + 1M context 會吃爆本機記憶體與磁碟——用 MACGPU 遠端 Mac 節點跑回歸,主力機保持穩定(見下文)
10. 場景選型矩陣
| 使用場景 | 首選 | 原因 |
|---|---|---|
| 長時程 Agent 編程 | Kimi K3 | SWE Marathon 42.0 領先 · 1M 防中斷 |
| 前端 / 試算表 Agent | Kimi K3 | Frontend Code Arena、SpreadsheetBench 2 #1 |
| 複雜 repo 級 bug 修復 | Claude Fable 5 | FrontierSWE 86.6 大幅領先 |
| 終端 / 工具鏈 Agent | GPT-5.6 Sol | Terminal Bench 2.1 88.8 |
| 成本敏感量產 | DeepSeek V4 Pro | 輸出 $3.48/M |
| 7/27 後最強自託管 | Kimi K3 | 2.8T 開放權重新標竿 |
| 合規隔離 + 可審 LICENSE | Kimi K3 權重 | Modified MIT · 內網部署 |
11. API 快速接入
OpenRouter 模型 ID:moonshotai/kimi-k3(官方定價、無加價、完整 1M 上下文)。
12. 常見問題 FAQ
Q:7/16 API 與 7/27 權重有什麼區別?
A:API 是雲端即用;7/27 才是 Hugging Face 完整權重 + Modified MIT,供自託管與微調。
Q:Modified MIT 能商用嗎?
A:視 LICENSE 附加條款而定。下載前必讀全文,勿假設等同標準 MIT。
Q:自託管要多少硬體?
A:4-bit 約 1.4TB 儲存;生產推理通常 64+ 加速卡。參考 K2.7 Code INT4 577GB。
Q:K3 比 Fable 5 / Sol 差多少?
A:AA 指數 K3 57.1 vs Sol 58.9 vs Fable 59.9;差距約 2–3 分,Agent 子項互有勝負。
Q:open weights 等於 open source 嗎?
A:不等於。K3 釋出權重與技術報告,非完整訓練開源。
Q:7/27 當天會有 Ollama 嗎?
A:通常不會 day-0。vLLM/transformers 優先;Ollama/GGUF 社群轉換 lag 數日。
13. 資料來源
- kimi.com — 產品體驗與公告
- platform.kimi.ai — API 文件與定價
- Artificial Analysis — Intelligence Index、單任務成本
- VentureBeat — 產業報導
- r/LocalLLaMA — 本地部署社群動態
14. 結語:API 隨處可用,Agent 壓測仍該上 Mac
註冊 kimi.com、複製 API Key、在 OpenRouter 切路由——Windows 或 Linux 都能完成。但若你要跑 Cursor + Kimi K3 百萬 token 長上下文編程、Xcode 側 Agent 整合、或追蹤 MLX/GGUF 量化進度,Apple Silicon 統一記憶體 + Metal 仍是摩擦最低的路徑。
務實分工:日常開發走 API;Kimi Code 壓測、多 repo SWE Marathon 回歸、1M token 文件批次任務,丟到 MACGPU 遠端 Mac mini M4 節點——按需租用、SSH 安全連線。7/27 權重落地前,先把 Agent 工作負載隔離,避免主力機被 1M 上下文拖垮記憶體與磁碟 I/O。