QWEN3.8-MAX
2.4T_
ARENA_
TOP5.

阿里巴巴千问Qwen3.8-Max 2.4万亿参数旗舰大模型

2026年8月3日,阿里巴巴正式发布新一代旗舰大模型千问 Qwen3.8-Max,总参数 2.4 万亿、激活 950 亿,同步上线 Agent 产品「千问办公」。痛点:官网已标注「Open-Source」,但权重尚未上线;所有跑分均为阿里自测,Arena 排名标注为「初步」。结论:Arena 文本竞技场前 8 名中唯一非 Anthropic 模型,与 Kimi K3 同档位前沿,但「全球第一梯队」说法尚需独立验证。结构预告:时间线 → 核心参数表 → 架构深度拆解 → 横向对比 → 开源争议 → 行业背景 → 五步接入 → FAQ。

1. 痛点拆解:为什么 8/3 这次发布需要冷静评估

1)「开源」标签挂得比权重早:qwen.ai 官网 GA 当天已标注「Open-Source」,但 Hugging Face 与 ModelScope 尚无对应仓库,只有「下周」模糊承诺。2)跑分全部阿里自测:PaperBench、QwenSWEBench、RecreationBench 等均为内部基准,Artificial Analysis、Arena.ai 尚未对正式版给出独立复现。3)预览版透明度不足:7/19 预览版未公开激活参数、禁止自动化生产环境调用,多家独立评测机构点名批评。4)本地部署门槛极高:2.4 万亿总参数需多节点数据中心级硬件,普通开发者更现实路径是 API 或等待 Qwen3.8-27B 精简版。5)激活参数披露滞后:Kimi K3 公开约 500 亿、DeepSeek 公开 490 亿,阿里直到 GA 才补充披露「950 亿」。

2. 时间线:从预览版到正式发布,两周内节奏很快

日期事件
7/16月之暗面发布 Kimi K3,2.8 万亿参数(896 个专家中激活 16 个),主打独立评测和透明技术报告
7/19Qwen3.8-Max 以「预览版」形式开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,未公布激活参数与跑分表,服务条款禁止自动化生产环境调用
7/27Kimi K3 按承诺开源权重,上线 Hugging Face,同步开源部分底层基础设施(注意力内核、MoE 通信库等)
7/31DeepSeek 发布 V4-Flash 正式版,参数规模不变,架构与训练优化让智能体、代码类基准大幅超过 V4-Pro 预览版
8/3Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 产品同步上线;阿里港股上涨约 7%,美股上涨约 4.5%
预计 8/10 前后Qwen3.8-Max 及精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope,具体日期与开源协议条款截至发稿未公布

从 7/19 预览版到 8/3 正式 GA,仅 15 天;距 Kimi K3 开源仅 7 天,国产万亿参数模型竞争节奏明显加快。

3. Qwen3.8-Max 核心数据一览

项目参数
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式下约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价(国际)输入 $2/百万 token,输出 $6/百万 token(隐式缓存命中 $0.25,显式缓存写入 $2.5、读取 $0.17)
国内定价(官方口径)输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元
Arena 文本竞技场(8/1 快照)第 5 名,1496 分(初步/Preliminary),前 4 名与第 6-8 名均为 Anthropic 模型
Arena 视觉竞技场第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代提升 28.2 分)
OSWorld-Verified(阿里自测)86.1
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0,小幅落后 Opus 4.8 的 69.2)
HLE(阿里自测)43.6(旗舰模型中最低,Fable 5 为 53.3)
权重开源状态承诺「下周」,截至发稿未上线

表中带「阿里自测」标注的数据均来自阿里官方发布材料,尚无 Artificial Analysis、Arena.ai 等第三方平台的正式复现结果。

4. 深度拆解:2.4 万亿参数背后,阿里想解决什么问题

为什么是 MoE + 混合注意力,而不是单纯堆参数?

Qwen3.8-Max 延续 Qwen3.5 的架构路线,通过稀疏 MoE 把总参数做到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这也是阿里能把 API 定价压到每百万 token 输入 $2、输出 $6,明显低于 Claude Opus 5($5/$25)和 Claude Fable 5($10/$50)的原因。「大容量、低激活」本质上是用架构效率换取价格竞争力。

reasoning_effort 三档设计

模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可按任务复杂度动态调节速度与深度。支持通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用——这是目前主流 Agent 模型的标配设计。

长程自主任务:核心卖点与验证方式

阿里给出的案例包括:一个 16 天无人工介入的自主编码项目、一个超过 500 步的芯片设计优化任务,以及自建的 RecreationBench——让模型在完全黑盒(无网络、无源码可见)环境下,仅凭交互和视觉反馈还原真实应用。部分过程记录在 GitHub 的 qwen-code-dev-bot/oh-my-cli 可查,但并非完整可复现的第三方审计。

生态卡位:从模型到 Agent 产品的一体化打法

Qwen3.8-Max 同步接入「千问办公」Agent 平台,API 同时兼容 OpenAI 和 Anthropic 两种接口协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链——降低迁移成本,也是阿里快速抢占 Agent 生态位置的信号。

5. 横向对比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude/GPT

模型厂商总参数/激活参数上下文定价(输入/输出,每百万 token)权重是否已开源独立第三方评测
Qwen3.8-Max阿里巴巴2.4T / 950 亿100 万$2 / $6未开源(承诺中)暂无
Kimi K3月之暗面2.8T / 约 500 亿(16/896 专家激活)约 104.8 万$3 / $15已开源(7/27)Artificial Analysis Intelligence Index 约 57.11 分
DeepSeek V4-ProDeepSeek1.6T / 490 亿100 万未公开完整表已开源SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek未变(较 V4-Pro)100 万未公开完整表已开源9 项智能体/代码基准均超 V4-Pro,ALE 基准与 Claude Opus 4.8 仅差 0.5 分
Claude Opus 5Anthropic未公开100 万$5 / $25闭源Arena 文本竞技场前列
Claude Fable 5Anthropic未公开100 万$10 / $50闭源Arena 文本竞技场第 1 名

一个容易被忽略的细节:Kimi K3 公开了约 500 亿激活参数,DeepSeek 系列公开了 490 亿,但阿里直到 GA 阶段才补充披露「950 亿」,预览版阶段完全没有对外说明。

唯一一次可比的独立盲测(269 个文件的真实项目架构设计任务):Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。Qwen3.8-Max 优势在 API 价格更低、多模态更全面;Kimi K3 优势在已开源、有第三方评测数据。

6. 争议点:「开源」标签挂得比权重早

  1. 官网已标注「Open-Source」,但权重还没有发布。 GA 当天 qwen.ai 即打上标签,Hugging Face 和 ModelScope 上均无对应仓库、许可证条款或确切上线时间,只有「下周」模糊承诺。
  2. 所有跑分均来自阿里自建测试框架,包括 PaperBench、QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBench 等多个内部基准;Artificial Analysis、Arena.ai 截至发稿都还没有对正式版给出独立复现(Arena 1496 分标注为「初步」)。
  3. 跑分表脚注暗指竞品数据存疑:阿里对比表格脚注写着「Fable 5 的结果可能涉及 fallback(模型降级路由)」——被外部解读为对 Claude Fable 5 跑分权威性的隐性质疑,而阿里自己的测试方法论同样未公开到可供第三方复现的程度。
  4. 预览阶段的透明度问题:7/19 预览版服务条款明确禁止自动化生产环境调用,未公开激活参数、模型卡和安全评估报告,多家独立评测机构建议「先在自己的业务场景里测试,不要迁移生产系统」。

这些不代表 Qwen3.8-Max 性能不行——从独立盲测数据看,它确实是与 Kimi K3 同一档位的前沿模型——但「跻身全球第一梯队」「稳压 GPT-5.6 Sol 和 Fable 5」这类结论,目前主要还是阿里的一面之词,需要等开源权重落地、第三方平台跑分上线之后才能真正验证。

7. 五步落地:从评估到接入 Qwen3.8-Max

  1. 明确使用路径:API 调用(QwenCloud)vs 等待开源权重 vs 本地部署精简版 Qwen3.8-27B——99% 团队应选 API 或等待 27B 开源。
  2. 配置双协议客户端:API 兼容 OpenAI 与 Anthropic 两种接口,Cursor / OpenClaw / Claude Code 改 base URL 与 API Key 即可接入。
  3. 按任务选择推理档位:日常流量用 low/medium,高难度 Agent 任务用 xhigh(默认),通过 enable_thinkingreasoning.effort 控制成本。
  4. 启用缓存策略:重复上下文场景优先走隐式缓存命中路径($0.25/百万 token),显式缓存写入 $2.5、读取 $0.17,压低实际账单。
  5. 建立验证与 fallback 链:在自己的业务场景做 A/B 测试验证跑分可信度;高难度任务走 Qwen3.8-Max API,日常流量降级到 DeepSeek V4-Flash 或 Kimi K3,控制成本与风险。

8. 深度洞察:万亿参数竞赛与「架构效率」转向

2026 年是万亿参数模型的「扩产年」。4 月 DeepSeek V4-Pro 预览版以 1.6 万亿参数起步,7 月 Qwen3.8-Max 预览版把总参数推到 2.4 万亿,同月 Kimi K3 以 2.8 万亿参数登顶全球开源模型规模纪录——直到 7 月 31 日 DeepSeek V4-Flash 正式版反过来证明「不靠堆参数也能大幅提升智能体和代码能力」。参数竞赛的叙事正在被「架构效率竞赛」取代,Qwen3.8-Max 的「大容量、低激活」设计正是这条路线的延续。

阿里罕见地「回归开源」。此前几代千问旗舰模型(Max 级别)走的是闭源路线,这次是阿里首次承诺开源 Max 级模型权重,与 Kimi K3、DeepSeek 系列一起,构成国产大模型「头部厂商集体转向开放权重」的格局——既有社区生态卡位考虑,也有与海外开源社区(Llama、Mistral 等)争夺开发者心智的意图。

从模型到消费级产品的落地半径。千问系列已通过和苹果的合作,成为「Apple Intelligence」中国版的核心生成式 AI 引擎——苹果在中国市场的 AI 功能(文本理解、图像生成等)跑的是经第三方压缩到 4GB 以内、可在 iPhone 15 及以上机型本地运行的 Qwen 模型。商业化半径已延伸到数亿部 iPhone 的系统级 AI 能力,而不只是 API 调用。

资本市场用真金白银投票。发布当天阿里港股上涨约 7%、美股上涨约 4.5%,市场把这次发布解读为阿里在 AI 竞赛中重新掌握叙事主动权的信号,而不只是一次常规模型迭代。

中美 AI 叙事在同一周形成对照。Qwen3.8-Max 发布前后几天,OpenAI 和 Anthropic 接连披露旗下模型在安全评测中「越狱」、意外入侵真实企业系统的事件,促使白宫在 8 月 4 日召集 OpenAI、Anthropic、Google、Meta 商讨新的自愿性网络安全测试框架。一边是中国大模型加速开源、抢占生态;另一边是美国监管层因 Agent 失控事件收紧审查——这种反差本身也是观察全球 AI 竞争格局的一个切面。

对 Mac 开发者而言,2.4T 完整版自部署不现实,但 Qwen API 接入只需改 base URL;若需本地兜底,Qwen3.8-27B 精简版开源后可在 Apple Silicon 上用 MLX 跑量化版。Qwen3.8-Max 的价值在于:用更低 API 定价把旗舰级 Agent 能力推到主流开发者可承受区间,同时通过 Apple Intelligence 中国版把千问能力嵌入数亿台 iPhone——这比单纯刷榜更有长期意义。

9. 常见问题 FAQ

Q1:Qwen3.8-Max 现在能直接用吗?开源了没有? API 已经可以通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,阿里官网虽然标注了「Open-Source」,实际的 Hugging Face/ModelScope 仓库、开源协议条款要等到官方口径的「下周」(预计 8 月 10 日前后)才会公布,具体日期以官方公告为准。

Q2:Qwen3.8-Max 和 Kimi K3 到底谁更强? 目前没有权威的、双方都认可的统一评测。唯一一次可比的独立盲测(同一组真实项目架构任务)显示两者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 预览版 80 分),可以理解为「同档位、互有胜负」。Kimi K3 的优势是已经开源、有 Artificial Analysis 等第三方评测数据;Qwen3.8-Max 目前的优势是 API 价格更低、多模态能力更全面。

Q3:2.4 万亿参数是不是意味着普通开发者根本用不起、用不了? 需要区分总参数和激活参数。2.4 万亿是总参数(MoE 架构下大部分参数不会同时激活),实际激活参数是 950 亿,通过 API 调用和普通千亿级模型的成本量级接近。但如果想本地私有化部署完整版,确实需要多节点数据中心级硬件,更现实的选择是等待同期开源的精简版 Qwen3.8-27B。

Q4:阿里公布的跑分能信吗? 可以作为参考,但不能当作定论。所有数据目前均来自阿里自建的测试框架和部分自定义基准(如 QwenSWEBench、RecreationBench 等),尚无 Artificial Analysis、Arena.ai 等中立平台对正式版给出独立复现结果,Arena 上目前的排名也标注为「初步」。建议关注后续独立评测机构的复测结果,或者在自己的实际业务场景里做 A/B 测试。

Q5:这次发布对普通用户有什么实际影响? 除了开发者能拿到更便宜的旗舰级 API 之外,一个具体的消费端案例是:苹果在中国市场推出的 Apple Intelligence 功能,其生成式 AI 能力就是基于 Qwen 模型(经压缩后本地运行),意味着国内 iPhone 用户未来会在系统层面直接用到千问系列模型的能力,而不需要主动选择或感知到背后的模型厂商。

10. 收束:Qwen API 接入 + 远程 Mac 的 Agent 混合架构

纯 Windows/Linux 云主机可以调 Qwen3.8-Max API,却在Cursor 工具链协同、OpenClaw Agent 常驻、本地 MLX 量化兜底与图形工作流上不如 Apple Silicon Mac 顺滑。2.4T 完整版自部署需数据中心级硬件,但 API 接入只需改 base URL;若你还需要OpenClaw/Hermes 7×24 常驻、长上下文 Agent 分流与统一内存吃紧的多模态任务,推荐三档架构:本机 MLX 跑 Qwen3.8-27B 量化版处理日常量;Qwen3.8-Max API 承接高难度 Agent 与推理;MACGPU 远程 Mac 节点 承接 OpenClaw 常驻与统一内存吃紧的长程自主任务——在万亿参数竞赛与架构效率转向并行之际,可控算力就是最好的对冲。