KIMI K3
2.8T_
OPEN_
WEIGHT.

Kimi K3 2.8万亿参数开放权重模型架构

7月27日晚23点左右,月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施。痛点:K3 是 2.8 万亿参数的 MoE 模型,但「开源」与「开放权重」语义不同,许可证里还藏着两道商业门槛。结论:它是开源阵营能力天花板(AA Index 全球第3),却不是性价比最优选项。结构预告:时间线 → 参数表 → KDA/AttnRes 架构 → 三大 Infra → 跑分对比 → 许可证 → API/自部署 → 地缘背景 → 五步接入 → FAQ。

1. 痛点拆解:为什么 7/27 这次发布值得重新评估

1)「开源」翻译陷阱:官方从未使用 open source,一直称 open weight——训练数据与完整训练代码未公开。2)许可证两道门槛:MaaS 年收入超 2000 万美元、或月活超 1 亿/月收入超 2000 万美元,触发额外条款。3)自部署几乎不现实:1.56TB 权重、官方建议 64 卡超节点——个人开发者更现实的路径是 API 或 OpenRouter。4)成本并非最优:每任务约 $0.95,比 GLM-5.2($0.47)贵近一倍。5)地缘争议叠加:美方指控「工业化蒸馏」、中方 7/28 回应「AI 霸权主义」——选型需兼顾合规与舆论风险。

2. 时间线:从 API 首发到全面开源,只用了 11 天

日期事件
7/16 夜K3 在 kimi.com、Kimi Work、Kimi Code、API 首发,权重未公开
7/17行业密集分析架构;新华社称「全球参数最大开源模型」
7/22–23美方指控月之暗面「工业化蒸馏」Anthropic Fable 训练 K3,威胁制裁
7/27 23:00完整权重、技术报告发布;MoonEP、AgentEnv 开源(FlashKDA 此前已开源)
7/28中国商务部公开回应;国内媒体跟进报道开源细节

权重文件约 1.56TB,Hugging Face 上线半小时登顶趋势榜第一。距 API 首发仅 11 天

3. Kimi K3 核心参数一览

项目参数
总参数量2.8 万亿(2.8T)
激活参数量1040 亿
架构类型混合专家模型(MoE)
专家配置896 路由专家,每 token 激活 16 个 + 共享专家
注意力机制Kimi Delta Attention(KDA)+ 门控 MLA
上下文窗口100 万 token
多模态原生视觉理解(ViT-V2,27 层)
权重格式MXFP4 权重 + MXFP8 激活(SFT 起量化感知训练)
权重体积约 1.56TB(Hugging Face)
License自定义许可证(open weight,非 open source)

4. 三大架构创新:KDA、AttnRes 与 Per-Head Muon

Kimi Delta Attention(KDA)

传统 Gated DeltaNet 用标量级遗忘门;KDA 改为逐通道独立衰减率,某些特征长期保留、另一些快速遗忘。采用 chunkwise DPLR 公式实现线性时间递归,与少量 Gated MLA 全局注意力层交替混合——支撑 100 万 token 上下文同时压低 KV Cache 开销的核心原因。

Attention Residuals(AttnRes)

传统残差连接逐层均匀累加,深层早期信息易被稀释。AttnRes 改为选择性、输入依赖的动态聚合——每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,参数开销不到 2%

Per-Head Muon 与 Stable LatentMoE

Muon 优化器扩展为逐注意力头独立优化;MoE 层 896 选 16(稀疏度约 1.8%),配合 Quantile Balancing 与 MoonEP 解决专家负载不均衡。

5. 三大开源 Infra 技术

技术定位关键能力
MoonEP超大规模细粒度 MoE 通信库临时复制过载专家,数学证明冗余专家数理论上界,负载均衡下维持高通信效率
FlashKDA基于 CUTLASS 的 KDA 高性能算子H20 上 prefill 比 flash-linear-attention 基线快 1.72–2.22×;可作为 chunk_kda 直接替代后端
AgentEnv与 KVCache.ai 联合的 Agent 沙箱(Firecracker microVM)checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5×(官方数据,待第三方复现)

6. 跑分对比:和 GPT-5.6、Claude、GLM-4.5 比一比

SWE-bench Verified(Vals AI 独立复测,2026年7月)

模型分数发布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 智能指数(max 推理档):Claude Fable 5(60)> GPT-5.6 Sol(59)> Kimi K3(约57,全球第3,开源第1) > GLM-5.2(51)> DeepSeek V4 Pro(44)。

每任务成本约 $0.95——比 Claude Fable 5($2.4)便宜 60%,但比 GLM-5.2($0.47)更贵。开源阵营能力天花板,非性价比最优。 K3 目前在 Arena.ai Frontend Code Arena 排名第一。

7. 许可证:两道商业门槛

  1. Model-as-a-Service 收入门槛:MaaS 业务连续 12 个月累计收入超 2000 万美元,须与月之暗面另行签署商业协议。
  2. 规模展示门槛:月活超 1 亿或月收入超 2000 万美元,须在界面显著展示「Kimi K3」字样。

对绝大多数中小团队,两道门槛几乎不会触发;若商业计划是「拿 K3 开竞争的模型服务」,第一道门槛是法务红线。

8. API 定价与自部署门槛

Token 类型价格(每百万 token)
输入(缓存命中)$0.30
输入(缓存未命中)$3.00
输出(含推理过程)$15.00

API 端点:https://api.moonshot.ai/v1,模型 ID kimi-k3,兼容 OpenAI SDK。Mooncake 分离式推理架构在编程类工作负载上缓存命中率可达 90%+,实际成本更接近 $0.30 档。自部署建议 64 卡及以上超节点;个人用户更现实路径是 OpenRouter(已有 7 家服务商)。

9. 五步落地:从评估到接入 K3

  1. 明确使用路径:API 调用 vs 第三方托管 vs 自部署——99% 团队应选前两者。
  2. 审查许可证:对照 MaaS 收入与 MAU 门槛,确认是否需要额外商业协议。
  3. 配置 OpenAI 兼容客户端:Cursor / OpenClaw / 自建 Agent 改 base URL 与 API Key 即可接入。
  4. 启用缓存策略:重复代码上下文场景优先走 Mooncake 缓存命中路径,压低实际 token 成本。
  5. 建立 fallback 链:K3 处理高难度任务,日常流量降级到 GLM-5.2 或 DeepSeek V4 Flash,控制账单。

10. 深度洞察:WAIC 2026 窗口与「3T 俱乐部」竞赛

K3 开源节点卡在 WAIC 2026 窗口期,叠加中美「模型蒸馏」争端——美方指控月之暗面「工业化蒸馏」Anthropic Fable 训练 K3 并威胁制裁;中国商务部 7/28 指责美方「AI 霸权主义」并威胁反制。月之暗面选择公开权重、技术报告与三项 Infra,某种程度上是用完整工程细节自证技术路径独立性。

三天后,阿里巴巴(月之暗面投资方之一)发布 24 万亿参数 Qwen3.8-Max-Preview,被外界解读为对 K3 的直接回应。国产大模型竞争正式进入「3T 俱乐部」阶段——参数规模、架构创新、Infra 开源三位一体,比单纯刷榜更有长期意义。

对 Mac 开发者而言,K3 自部署不现实,但可通过 API 接入;若需本地兜底,GLM-5.2 等更小开源模型可在 Apple Silicon 上用 MLX 跑量化版。K3 的价值在于:证明开源权重模型可以逼近闭源前沿,推动整个生态的定价与能力基准上移。

11. 常见问题 FAQ

Kimi K3 真的是开源模型吗? 严格来说不是。属于 open weight:权重、技术报告、部分 Infra 公开,训练数据与完整训练代码未公开,不符合 OSI 标准。

可以免费商用吗? 绝大多数场景不受限制;MaaS 年收入超 2000 万美元或 MAU 超 1 亿/月收入超 2000 万美元需满足许可证特定条款。

需要多少显卡自部署? 官方建议 64 卡及以上超节点;个人与企业更现实方式是官方 API 或 OpenRouter。

和 Kimi K2 有什么区别? K3 参数约为 K2.5 的 3 倍,新增 AttnRes 与 Per-Head Muon,上下文与多模态大幅提升;许可证新增 MaaS 收入门槛。

12. 收束:API 接入 + Mac 本地兜底的混合架构

纯 Windows/Linux 云主机可以调 Kimi K3 API,却在Cursor 工具链协同、OpenClaw Agent 常驻、本地 MLX 量化兜底与图形工作流上不如 Apple Silicon Mac 顺滑。K3 自部署需 64 卡超节点,但 API 接入只需改 base URL;若你还需要本地 GLM-5.2 离线备份、长上下文 Agent 分流与 7×24 稳定运行,推荐三档架构:本机 MLX 跑量化开源模型处理日常量;Kimi K3 API 承接高难度编程与推理;MACGPU 远程 Mac 节点 承接 OpenClaw/Hermes 常驻与统一内存吃紧的长上下文任务——在 3T 俱乐部竞赛白热化之际,可控算力就是最好的对冲。