KIMI K3
2.8T_
OPEN_
WEIGHT.
7月27日晚23点左右,月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施。痛点:K3 是 2.8 万亿参数的 MoE 模型,但「开源」与「开放权重」语义不同,许可证里还藏着两道商业门槛。结论:它是开源阵营能力天花板(AA Index 全球第3),却不是性价比最优选项。结构预告:时间线 → 参数表 → KDA/AttnRes 架构 → 三大 Infra → 跑分对比 → 许可证 → API/自部署 → 地缘背景 → 五步接入 → FAQ。
1. 痛点拆解:为什么 7/27 这次发布值得重新评估
1)「开源」翻译陷阱:官方从未使用 open source,一直称 open weight——训练数据与完整训练代码未公开。2)许可证两道门槛:MaaS 年收入超 2000 万美元、或月活超 1 亿/月收入超 2000 万美元,触发额外条款。3)自部署几乎不现实:1.56TB 权重、官方建议 64 卡超节点——个人开发者更现实的路径是 API 或 OpenRouter。4)成本并非最优:每任务约 $0.95,比 GLM-5.2($0.47)贵近一倍。5)地缘争议叠加:美方指控「工业化蒸馏」、中方 7/28 回应「AI 霸权主义」——选型需兼顾合规与舆论风险。
2. 时间线:从 API 首发到全面开源,只用了 11 天
| 日期 | 事件 |
|---|---|
| 7/16 夜 | K3 在 kimi.com、Kimi Work、Kimi Code、API 首发,权重未公开 |
| 7/17 | 行业密集分析架构;新华社称「全球参数最大开源模型」 |
| 7/22–23 | 美方指控月之暗面「工业化蒸馏」Anthropic Fable 训练 K3,威胁制裁 |
| 7/27 23:00 | 完整权重、技术报告发布;MoonEP、AgentEnv 开源(FlashKDA 此前已开源) |
| 7/28 | 中国商务部公开回应;国内媒体跟进报道开源细节 |
权重文件约 1.56TB,Hugging Face 上线半小时登顶趋势榜第一。距 API 首发仅 11 天。
3. Kimi K3 核心参数一览
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 架构类型 | 混合专家模型(MoE) |
| 专家配置 | 896 路由专家,每 token 激活 16 个 + 共享专家 |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控 MLA |
| 上下文窗口 | 100 万 token |
| 多模态 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(SFT 起量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(open weight,非 open source) |
4. 三大架构创新:KDA、AttnRes 与 Per-Head Muon
Kimi Delta Attention(KDA)
传统 Gated DeltaNet 用标量级遗忘门;KDA 改为逐通道独立衰减率,某些特征长期保留、另一些快速遗忘。采用 chunkwise DPLR 公式实现线性时间递归,与少量 Gated MLA 全局注意力层交替混合——支撑 100 万 token 上下文同时压低 KV Cache 开销的核心原因。
Attention Residuals(AttnRes)
传统残差连接逐层均匀累加,深层早期信息易被稀释。AttnRes 改为选择性、输入依赖的动态聚合——每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,参数开销不到 2%。
Per-Head Muon 与 Stable LatentMoE
Muon 优化器扩展为逐注意力头独立优化;MoE 层 896 选 16(稀疏度约 1.8%),配合 Quantile Balancing 与 MoonEP 解决专家负载不均衡。
5. 三大开源 Infra 技术
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 超大规模细粒度 MoE 通信库 | 临时复制过载专家,数学证明冗余专家数理论上界,负载均衡下维持高通信效率 |
| FlashKDA | 基于 CUTLASS 的 KDA 高性能算子 | H20 上 prefill 比 flash-linear-attention 基线快 1.72–2.22×;可作为 chunk_kda 直接替代后端 |
| AgentEnv | 与 KVCache.ai 联合的 Agent 沙箱(Firecracker microVM) | checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5×(官方数据,待第三方复现) |
6. 跑分对比:和 GPT-5.6、Claude、GLM-4.5 比一比
SWE-bench Verified(Vals AI 独立复测,2026年7月)
| 模型 | 分数 | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指数(max 推理档):Claude Fable 5(60)> GPT-5.6 Sol(59)> Kimi K3(约57,全球第3,开源第1) > GLM-5.2(51)> DeepSeek V4 Pro(44)。
每任务成本约 $0.95——比 Claude Fable 5($2.4)便宜 60%,但比 GLM-5.2($0.47)更贵。开源阵营能力天花板,非性价比最优。 K3 目前在 Arena.ai Frontend Code Arena 排名第一。
7. 许可证:两道商业门槛
- Model-as-a-Service 收入门槛:MaaS 业务连续 12 个月累计收入超 2000 万美元,须与月之暗面另行签署商业协议。
- 规模展示门槛:月活超 1 亿或月收入超 2000 万美元,须在界面显著展示「Kimi K3」字样。
对绝大多数中小团队,两道门槛几乎不会触发;若商业计划是「拿 K3 开竞争的模型服务」,第一道门槛是法务红线。
8. API 定价与自部署门槛
| Token 类型 | 价格(每百万 token) |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
API 端点:https://api.moonshot.ai/v1,模型 ID kimi-k3,兼容 OpenAI SDK。Mooncake 分离式推理架构在编程类工作负载上缓存命中率可达 90%+,实际成本更接近 $0.30 档。自部署建议 64 卡及以上超节点;个人用户更现实路径是 OpenRouter(已有 7 家服务商)。
9. 五步落地:从评估到接入 K3
- 明确使用路径:API 调用 vs 第三方托管 vs 自部署——99% 团队应选前两者。
- 审查许可证:对照 MaaS 收入与 MAU 门槛,确认是否需要额外商业协议。
- 配置 OpenAI 兼容客户端:Cursor / OpenClaw / 自建 Agent 改 base URL 与 API Key 即可接入。
- 启用缓存策略:重复代码上下文场景优先走 Mooncake 缓存命中路径,压低实际 token 成本。
- 建立 fallback 链:K3 处理高难度任务,日常流量降级到 GLM-5.2 或 DeepSeek V4 Flash,控制账单。
10. 深度洞察:WAIC 2026 窗口与「3T 俱乐部」竞赛
K3 开源节点卡在 WAIC 2026 窗口期,叠加中美「模型蒸馏」争端——美方指控月之暗面「工业化蒸馏」Anthropic Fable 训练 K3 并威胁制裁;中国商务部 7/28 指责美方「AI 霸权主义」并威胁反制。月之暗面选择公开权重、技术报告与三项 Infra,某种程度上是用完整工程细节自证技术路径独立性。
三天后,阿里巴巴(月之暗面投资方之一)发布 24 万亿参数 Qwen3.8-Max-Preview,被外界解读为对 K3 的直接回应。国产大模型竞争正式进入「3T 俱乐部」阶段——参数规模、架构创新、Infra 开源三位一体,比单纯刷榜更有长期意义。
对 Mac 开发者而言,K3 自部署不现实,但可通过 API 接入;若需本地兜底,GLM-5.2 等更小开源模型可在 Apple Silicon 上用 MLX 跑量化版。K3 的价值在于:证明开源权重模型可以逼近闭源前沿,推动整个生态的定价与能力基准上移。
11. 常见问题 FAQ
Kimi K3 真的是开源模型吗? 严格来说不是。属于 open weight:权重、技术报告、部分 Infra 公开,训练数据与完整训练代码未公开,不符合 OSI 标准。
可以免费商用吗? 绝大多数场景不受限制;MaaS 年收入超 2000 万美元或 MAU 超 1 亿/月收入超 2000 万美元需满足许可证特定条款。
需要多少显卡自部署? 官方建议 64 卡及以上超节点;个人与企业更现实方式是官方 API 或 OpenRouter。
和 Kimi K2 有什么区别? K3 参数约为 K2.5 的 3 倍,新增 AttnRes 与 Per-Head Muon,上下文与多模态大幅提升;许可证新增 MaaS 收入门槛。
12. 收束:API 接入 + Mac 本地兜底的混合架构
纯 Windows/Linux 云主机可以调 Kimi K3 API,却在Cursor 工具链协同、OpenClaw Agent 常驻、本地 MLX 量化兜底与图形工作流上不如 Apple Silicon Mac 顺滑。K3 自部署需 64 卡超节点,但 API 接入只需改 base URL;若你还需要本地 GLM-5.2 离线备份、长上下文 Agent 分流与 7×24 稳定运行,推荐三档架构:本机 MLX 跑量化开源模型处理日常量;Kimi K3 API 承接高难度编程与推理;MACGPU 远程 Mac 节点 承接 OpenClaw/Hermes 常驻与统一内存吃紧的长上下文任务——在 3T 俱乐部竞赛白热化之际,可控算力就是最好的对冲。