KIMI K3
开源权重
7月27日.
导语:如果你在等「史上最大开源权重模型」的完整下载链接,核心答案是:月之暗面将于 2026 年 7 月 27 日在 Hugging Face 公开 Kimi K3 全部 2.8 万亿参数权重(Modified MIT 许可),同步发布技术报告。API 已于 7 月 16 日上线。本文按调研文档全部要点展开:两阶段发布时间线、完整规格表、与 Claude Fable 5 / GPT-5.6 Sol 的跑分对比、API 定价与缓存真实成本、open weights 与 open source 区别、1.4TB 自部署门槛、7 月 27 日核对清单、行业意义与 FAQ。架构细节可参考姊妹篇 7 月 17 日 K3 深度评测。
30 秒读懂 · TL;DR
| 定位 | 全球首个 2.8T 级开源权重模型 · 综合智能排 第三 · 约 1/3 成本接近前沿 |
| 两阶段发布 | 7/16 API + Kimi 全家桶 · 7/27 完整权重 + 技术报告 |
| 独特优势 | 开源权重 + 100 万 token 上下文 · 闭源给不了的两样东西 |
| 关键结论 | 不是「Fable 5 杀手」· AA Index 57.1 · 但前端/自动化/长会话编码极强 |
| 自部署 | 4-bit 约 1.4 TB · 官方建议 64+ 加速器 · 多数人应走 API |
1. 痛点拆解:为什么 7 月 27 日值得盯紧
- 「API 已上线」≠「权重已开源」。 7 月 16 日起可通过 Kimi App、Kimi Work、Kimi Code 和 API 调用 K3,但完整权重要到 7 月 27 日。这是当前搜索量最大的困惑点——本文专门用时间线澄清。
- 闭源溢价正在被「两三分差距 + 三分之一成本」挤压。 K3 综合智能仍排第三,但开源与闭源的能力差距已缩到约 2–3 分(AA Index)。闭源厂商很难再纯靠能力证明溢价。
- 自部署预期需要立刻降温。 英文社区最常被标题党误导「笔记本能跑」。4-bit 权重约 1.4 TB、需 64+ 加速器——诚实写清楚,反而能建立 E-E-A-T 与外链信任。
2. 发布时间线:API 上线 vs 权重公开
| 日期 | 事件 |
|---|---|
| 2026-07-16 | Kimi K3 通过 API / Kimi 全家桶上线;Artificial Analysis 同日发布独立评测 |
| 2026-07-17 | 上海世界人工智能大会(WAIC)开幕;新华社将 K3 定调为「国家级里程碑」 |
| 2026-07-27 | 完整权重公开下载(Hugging Face,Modified MIT)+ 技术报告(架构、训练、评估细节) |
3. 模型规格一览
| 项目 | 数据 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) · 史上最大开源权重模型 |
| 架构 | 稀疏 MoE:Stable LatentMoE,896 专家中每 token 激活 16 个 |
| 注意力 | Kimi Delta Attention(KDA,混合线性注意力)+ Attention Residuals(AttnRes)+ Gated MLA |
| 上下文 | 1,048,576 tokens(约 100 万) |
| 模态 | 原生视觉理解(文本 + 图像;产品端还支持视频),输出为文本 |
| 权重格式 | MXFP4 权重 + MXFP8 激活(原生低精度训练) |
| 扩展效率 | 官方称比 K2 提升约 2.5×(同等算力换更多智能) |
| 训练稳定性 | Quantile Balancing(专家路由)、Per-Head Muon 优化器、SiTU 激活函数 |
| 长上下文解码 | KDA 在百万 token 上下文中最高 6.3 倍解码加速 |
4. 跑分对比:K3 赢在哪、输在哪
4.1 综合智能(Artificial Analysis Intelligence Index)
| 模型 | 分数 |
|---|---|
| Claude Fable 5 | 59.9 |
| GPT-5.6 Sol | 58.9 |
| Kimi K3 | 57.1(第 3 / 189) |
月之暗面在发布时罕见地主动承认综合性能仍落后 Fable 5 和 GPT-5.6 Sol,并列出已知短板(对 harness 传回推理内容敏感、意图模糊时过于主动等)。这种诚实态度值得引用——比「Claude 杀手」口号更经得起 Reddit/HN 审视。
4.2 K3 领先或打平
| 基准 | K3 表现 |
|---|---|
| Frontend Code Arena | 第 1(盲测 UI 代码偏好超 Fable/Sol) |
| Automation Bench / SpreadsheetBench 2 | 第 1 |
| BrowseComp | 91.2(第 1;配合 1M 上下文无压缩策略) |
| SWE Marathon(超长编码会话) | 42.0(GPT-5.5 / GLM-5.2 崩到十几分) |
| Terminal Bench 2.1 | 88.3(与 Sol 88.8 基本打平) |
| Program Bench | 77.8(微超 Sol 77.6) |
| FrontierSWE | 81.2(大幅超 Sol 71.3;落后 Fable 5 的 86.6) |
4.3 K3 仍落后
- GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748(长程判断力仍是 Fable 天下)
- DeepSWE:67.5 vs Sol 的 73.0
- 幻觉率比 K2.6 有所上升(官方承认);Reddit 有用户反馈接入自建应用后幻觉明显多于顶级闭源
- 对话打磨度、单次会话方差仍逊于 Fable 5 / Sol
5. API 定价与真实成本
| 项目 | 价格(每百万 tokens) |
|---|---|
| 输入(缓存未命中) | $3.00 |
| 输入(缓存命中,自动缓存) | $0.30 |
| 输出 | $15.00 |
定价刻意对齐西方标准(走「质量牌」而非「低价牌」),是目前中国大模型厂商中最高的,但仍显著低于 Claude Opus 4.8 单任务成本。Artificial Analysis 实测单任务成本 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%。编码类工作负载缓存命中率据称超 90%,实际成本远低于表面单价。
6. 开源权重 vs 开源:K3 到底算不算「开源」?
英文社区严格区分 open weights(只放权重)和 open source(含训练代码/数据)。K3 属于前者:7 月 27 日公开的是完整 2.8T 权重 + Modified MIT 许可证(具体条款以发布日 LICENSE 原文为准),并非 fully open source。
这本身是好内容——准确用词能拿到 「kimi k3 open weights」「is kimi k3 open source」等精准搜索词,也避免被 LocalLLaMA 读者视为外行。
7. 7 月 27 日会发生什么
- 完整 2.8T 权重上架 Moonshot Hugging Face 组织
- 同步发布技术报告(架构、训练、评估细节)
- vLLM 对 KDA / prefix caching 的支持将随权重落地
- 预期后续:Ollama、GGUF 量化版本会像 K2 系列一样陆续跟进
8. 本地部署真相:1.4TB 与 64+ 加速器
不是消费级硬件能跑的。4-bit 权重约 1.4 TB,官方建议 64+ 加速器的「超节点」部署,需要专家并行 + 张量并行的分布式推理。参照:上一代 1T 参数的 K2.7 Code,INT4 也要约 577 GB 显存;K3 是它的 2.8 倍。
对绝大多数人,正确答案是 API($3/$15)。自部署只在三种场景成立:严格数据驻留/离线要求、需要在自有数据上微调、调用量大到自建硬件反而便宜。
9. 7 月 27 日发布日核对清单(5 步)
- 检查 Hugging Face 仓库文件是否齐全(config、tokenizer、分片权重索引)
- 阅读 LICENSE 原文——确认 Modified MIT 具体限制条款
- 确认量化版本(MXFP4/NVFP4/GGUF 是否同步放出)
- 验证 vLLM / SGLang 启动命令与 KDA prefix caching 支持状态
- 对照最低可行硬件清单,并对百万 token 长上下文做独立复测(勿只看官方 harness)
10. 五条落地建议
- 7/27 前:在 API 上跑通你的核心工作负载(编码/自动化/长文档),建立缓存命中率基线。
- 7/27 当天 2 小时内:更新文档与内链——把「scheduled for release」改为「now available」,加上 HF 直链(Google 对时效内容重排极快)。
- 选型:前端/UI 代码、Spreadsheet 自动化、SWE Marathon 类长会话 → 优先 K3;长程战略判断、低幻觉对话 → 仍看 Fable 5 / Sol。
- 自托管决策:没有 64+ 卡集群就别硬上;数据合规场景可先等社区 GGUF 与蒸馏版(8 月起关注 Ollama 支持进度)。
- 多模型路由:OpenRouter / LiteLLM 把 K3 作 coding 主力、Fable/Sol 作 reasoning fallback——比单模型押注更稳。
11. 行业意义:开源追平闭源的新论据
① 能力差距在前沿基本闭合:从「数百分」缩到「两三分」,闭源溢价叙事承压。
② 地缘背景:发布赶在 WAIC 前;一个月前美国政府曾短暂下架 Anthropic Fable/Mythos(7 月 1 日恢复)——「监管可以关掉闭源模型,但关不掉已发布的开源权重」成为新论据。
③ 中国厂商梯队集体逼近:Z.ai GLM-5.2、DeepSeek V4 Pro(1.6T)、MiniMax 等;K3 是这波浪潮的最高点。
④ 月之暗面翻身仗:2025 年初被 DeepSeek R1 冲击后排名跌至国内第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的开源路线重建地位。
12. 深度案例:K3 对 Mac 开发者的实际含义
K3 不是参数堆砌的 vanity project。KDA + Stable LatentMoE 解决的是百万 token 工程可行问题——这让 Cursor 接 K3 API 做全库分析、Kimi Code 跑 SWE Marathon 级压力测试,在 Mac 上成为可落地的日常路径。
权重落地后,社区会复刻 DeepSeek 生态路径:vLLM 先行 → GGUF/Ollama 跟进 → MLX 爱好者尝试量化。Mac 开发者应跟踪 transformers、vLLM 与 r/LocalLLaMA 的首批独立复测——benchmarks run through different harnesses 的 caveat 必须写进你的验收文档。
信源:官方 kimi.com/en/blog/kimi-k3、platform.kimi.ai;独立评测 Artificial Analysis(7 月 16 日);深度报道 VentureBeat、Northflank;社区 r/LocalLLaMA、Hacker News。
13. 常见问题 FAQ
Q:K3 权重什么时候发布?
A:2026 年 7 月 27 日 Hugging Face 完整下载 + 技术报告。API 已于 7 月 16 日可用。
Q:K3 免费吗?
A:Kimi App 有免费额度;API 按 token 计费($3/$15),编码场景缓存命中后实际成本低很多。
Q:K3 和 DeepSeek 哪个强?
A:K3 参数与上下文更大(2.8T vs 1.6T,1M vs 128K),多项编码基准领先;DeepSeek V4 输出单价更低(约 $3.48/M vs $15/M),性价比路线不同。
Q:K3 能本地跑吗?
A:需约 1.4TB(4-bit)与 64+ 加速器,消费级 GPU 不现实。
Q:Modified MIT 是什么?
A:修改版 MIT,具体限制以 7 月 27 日 LICENSE 原文为准。
Q:比 Claude Fable 5 强吗?
A:综合智能略逊(57.1 vs 59.9),但单任务成本低 65.8%,前端/自动化/长会话编码多项领先。
14. 收束:API 随处可用,Agent 压测仍建议隔离到 Mac 节点
注册 Kimi API、在 OpenRouter 改路由——Windows/Linux 都能做。但若你要跑 Cursor + K3 百万 token 编码、Kimi Code 长会话回归、或多仓库 SWE Marathon 压测,Apple Silicon 统一内存 + Metal 工具链仍是日常开发摩擦最小的路径。
务实分工:主机器走 API,把 Agent 压测、1M token 批处理与量化验证丢到 MACGPU 远程 Mac mini M4 节点——按需租用、SSH 隔离。7 月 27 日权重落地前,先把 Agent 工作负载与日常环境分开,避免主 Mac 被长上下文拖垮。