QWEN3.8-MAX
2.4T_
ARENA_
TOP5.

阿里巴巴千問 Qwen3.8-Max 2.4 萬億參數旗艦大模型

2026 年 8 月 3 日,阿里巴巴正式發布新一代旗艦大模型千問 Qwen3.8-Max,總參數 2.4 萬億、激活 950 億,同步上線 Agent 產品「千問辦公」。痛點:官網已標註「Open-Source」,但權重尚未上線;所有跑分均為阿里自測,Arena 排名標註為「初步」。結論:Arena 文本競技場前 8 名中唯一非 Anthropic 模型,與 Kimi K3 同檔位前沿,但「全球第一梯隊」說法尚需獨立驗證。結構預告:時間線 → 核心參數表 → 架構深度拆解 → 橫向對比 → 開源爭議 → 產業背景 → 五步接入 → FAQ。

1. 痛點拆解:為什麼 8/3 這次發布需要冷靜評估

1)「開源」標籤掛得比權重早:qwen.ai 官網 GA 當天已標註「Open-Source」,但 Hugging Face 與 ModelScope 尚無對應倉庫,只有「下週」模糊承諾。2)跑分全部阿里自測:PaperBench、QwenSWEBench、RecreationBench 等均為內部基準,Artificial Analysis、Arena.ai 尚未對正式版給出獨立復現。3)預覽版透明度不足:7/19 預覽版未公開激活參數、禁止自動化生產環境呼叫,多家獨立評測機構點名批評。4)本地部署門檻極高:2.4 萬億總參數需多節點資料中心級硬體,普通開發者更現實路徑是 API 或等待 Qwen3.8-27B 精簡版。5)激活參數披露滯後:Kimi K3 公開約 500 億、DeepSeek 公開 490 億,阿里直到 GA 才補充披露「950 億」。

2. 時間線:從預覽版到正式發布,兩週內節奏很快

日期事件
7/16月之暗面發布 Kimi K3,2.8 萬億參數(896 個專家中激活 16 個),主打獨立評測和透明技術報告
7/19Qwen3.8-Max 以「預覽版」形式開放,接入 Token Plan / Qoder / QoderWork,價格為預計正式價的 10%,未公布激活參數與跑分表,服務條款禁止自動化生產環境呼叫
7/27Kimi K3 按承諾開源權重,上線 Hugging Face,同步開源部分底層基礎設施(注意力核心、MoE 通訊庫等)
7/31DeepSeek 發布 V4-Flash 正式版,參數規模不變,架構與訓練優化讓智慧體、程式碼類基準大幅超過 V4-Pro 預覽版
8/3Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 產品同步上線;阿里港股上漲約 7%,美股上漲約 4.5%
預計 8/10 前後Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重計畫登陸 Hugging Face 與 ModelScope,具體日期與開源協議條款截至發稿未公布

從 7/19 預覽版到 8/3 正式 GA,僅 15 天;距 Kimi K3 開源僅 7 天,國產萬億參數模型競爭節奏明顯加快。

3. Qwen3.8-Max 核心數據一覽

項目參數
發布日期2026 年 8 月 3 日(GA)
總參數 / 激活參數2.4 萬億 / 950 億
架構基於 Qwen3.5 的稀疏 MoE + 混合注意力
上下文視窗100 萬 token(思考模式下約 98.3 萬,輸出上限 13.1 萬)
輸入模態文本 / 圖像 / 影片
API 定價(國際)輸入 $2/百萬 token,輸出 $6/百萬 token(隱式快取命中 $0.25,顯式快取寫入 $2.5、讀取 $0.17)
國內定價(官方口徑)輸入 12 元/百萬 token,輸出 36 元/百萬 token,快取命中低至 1.5 元
Arena 文本競技場(8/1 快照)第 5 名,1496 分(初步/Preliminary),前 4 名與第 6-8 名均為 Anthropic 模型
Arena 視覺競技場第 2 名,僅次於 Claude Fable 5
PaperBench(阿里自測)93.0(較上代提升 28.2 分)
OSWorld-Verified(阿里自測)86.1
SWE-bench Pro(阿里自測)67.7(落後 Fable 5 的 80.0,小幅落後 Opus 4.8 的 69.2)
HLE(阿里自測)43.6(旗艦模型中最低,Fable 5 為 53.3)
權重開源狀態承諾「下週」,截至發稿未上線

表中帶「阿里自測」標註的數據均來自阿里官方發布材料,尚無 Artificial Analysis、Arena.ai 等第三方平台的正式復現結果。

4. 深度拆解:2.4 萬億參數背後,阿里想解決什麼問題

為什麼是 MoE + 混合注意力,而不是單純堆參數?

Qwen3.8-Max 延續 Qwen3.5 的架構路線,透過稀疏 MoE 把總參數做到 2.4 萬億的同時,實際激活量控制在 950 億——推理成本更接近千億級模型,而非真正呼叫 2.4 萬億參數。這也是阿里能把 API 定價壓到每百萬 token 輸入 $2、輸出 $6,明顯低於 Claude Opus 5($5/$25)和 Claude Fable 5($10/$50)的原因。「大容量、低激活」本質上是用架構效率換取價格競爭力。

reasoning_effort 三檔設計

模型提供 low / medium / xhigh 三檔推理強度(預設 xhigh),開發者可按任務複雜度動態調節速度與深度。支援透過 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位呼叫——這是目前主流 Agent 模型的標配設計。

長程自主任務:核心賣點與驗證方式

阿里給出的案例包括:一個 16 天無人工介入的自主編碼專案、一個超過 500 步的晶片設計優化任務,以及自建的 RecreationBench——讓模型在完全黑盒(無網路、無原始碼可見)環境下,僅憑互動和視覺回饋還原真實應用。部分過程記錄在 GitHub 的 qwen-code-dev-bot/oh-my-cli 可查,但並非完整可復現的第三方審計。

生態卡位:從模型到 Agent 產品的一體化打法

Qwen3.8-Max 同步接入「千問辦公」Agent 平台,API 同時相容 OpenAI 和 Anthropic 兩種介面協議,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈——降低遷移成本,也是阿里快速搶佔 Agent 生態位置的訊號。

5. 橫向對比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude/GPT

模型廠商總參數/激活參數上下文定價(輸入/輸出,每百萬 token)權重是否已開源獨立第三方評測
Qwen3.8-Max阿里巴巴2.4T / 950 億100 萬$2 / $6未開源(承諾中)暫無
Kimi K3月之暗面2.8T / 約 500 億(16/896 專家激活)約 104.8 萬$3 / $15已開源(7/27)Artificial Analysis Intelligence Index 約 57.11 分
DeepSeek V4-ProDeepSeek1.6T / 490 億100 萬未公開完整表已開源SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek未變(較 V4-Pro)100 萬未公開完整表已開源9 項智慧體/程式碼基準均超 V4-Pro,ALE 基準與 Claude Opus 4.8 僅差 0.5 分
Claude Opus 5Anthropic未公開100 萬$5 / $25閉源Arena 文本競技場前列
Claude Fable 5Anthropic未公開100 萬$10 / $50閉源Arena 文本競技場第 1 名

一個容易被忽略的細節:Kimi K3 公開了約 500 億激活參數,DeepSeek 系列公開了 490 億,但阿里直到 GA 階段才補充披露「950 億」,預覽版階段完全沒有對外說明。

唯一一次可比的獨立盲測(269 個檔案的真實專案架構設計任務):Kimi K3 得 83 分,Qwen3.8-Max 預覽版得 80 分——差距很小,屬於「互有勝負」而非「全面碾壓」。Qwen3.8-Max 優勢在 API 價格更低、多模態更全面;Kimi K3 優勢在已開源、有第三方評測數據。

6. 爭議點:「開源」標籤掛得比權重早

  1. 官網已標註「Open-Source」,但權重還沒有發布。 GA 當天 qwen.ai 即打上標籤,Hugging Face 和 ModelScope 上均無對應倉庫、授權條款或確切上線時間,只有「下週」模糊承諾。
  2. 所有跑分均來自阿里自建測試框架,包括 PaperBench、QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBench 等多個內部基準;Artificial Analysis、Arena.ai 截至發稿都還沒有對正式版給出獨立復現(Arena 1496 分標註為「初步」)。
  3. 跑分表腳註暗指競品數據存疑:阿里對比表格腳註寫著「Fable 5 的結果可能涉及 fallback(模型降級路由)」——被外部解讀為對 Claude Fable 5 跑分權威性的隱性質疑,而阿里自己的測試方法論同樣未公開到可供第三方復現的程度。
  4. 預覽階段的透明度問題:7/19 預覽版服務條款明確禁止自動化生產環境呼叫,未公開激活參數、模型卡和安全評估報告,多家獨立評測機構建議「先在自己的業務場景裡測試,不要遷移生產系統」。

這些不代表 Qwen3.8-Max 效能不行——從獨立盲測數據看,它確實是與 Kimi K3 同一檔位的前沿模型——但「躋身全球第一梯隊」「穩壓 GPT-5.6 Sol 和 Fable 5」這類結論,目前主要還是阿里的一面之詞,需要等開源權重落地、第三方平台跑分上線之後才能真正驗證。

7. 五步落地:從評估到接入 Qwen3.8-Max

  1. 明確使用路徑:API 呼叫(QwenCloud)vs 等待開源權重 vs 本地部署精簡版 Qwen3.8-27B——99% 團隊應選 API 或等待 27B 開源。
  2. 設定雙協議客戶端:API 相容 OpenAI 與 Anthropic 兩種介面,Cursor / OpenClaw / Claude Code 改 base URL 與 API Key 即可接入。
  3. 按任務選擇推理檔位:日常流量用 low/medium,高難度 Agent 任務用 xhigh(預設),透過 enable_thinkingreasoning.effort 控制成本。
  4. 啟用快取策略:重複上下文場景優先走隱式快取命中路徑($0.25/百萬 token),顯式快取寫入 $2.5、讀取 $0.17,壓低實際帳單。
  5. 建立驗證與 fallback 鏈:在自己的業務場景做 A/B 測試驗證跑分可信度;高難度任務走 Qwen3.8-Max API,日常流量降級到 DeepSeek V4-Flash 或 Kimi K3,控制成本與風險。

8. 深度洞察:萬億參數競賽與「架構效率」轉向

2026 年是萬億參數模型的「擴產年」。4 月 DeepSeek V4-Pro 預覽版以 1.6 萬億參數起步,7 月 Qwen3.8-Max 預覽版把總參數推到 2.4 萬億,同月 Kimi K3 以 2.8 萬億參數登頂全球開源模型規模紀錄——直到 7 月 31 日 DeepSeek V4-Flash 正式版反過來證明「不靠堆參數也能大幅提升智慧體和程式碼能力」。參數競賽的敘事正在被「架構效率競賽」取代,Qwen3.8-Max 的「大容量、低激活」設計正是這條路線的延續。

阿里罕見地「回歸開源」。此前幾代千問旗艦模型(Max 級別)走的是閉源路線,這次是阿里首次承諾開源 Max 級模型權重,與 Kimi K3、DeepSeek 系列一起,構成國產大模型「頭部廠商集體轉向開放權重」的格局——既有社群生態卡位考慮,也有與海外開源社群(Llama、Mistral 等)爭奪開發者心智的意圖。

從模型到消費級產品的落地半徑。千問系列已透過和蘋果的合作,成為「Apple Intelligence」中國版的核心生成式 AI 引擎——蘋果在中國市場的 AI 功能(文本理解、圖像生成等)跑的是經第三方壓縮到 4GB 以內、可在 iPhone 15 及以上機型本地執行的 Qwen 模型。商業化半徑已延伸到數億部 iPhone 的系統級 AI 能力,而不只是 API 呼叫。

資本市場用真金白銀投票。發布當天阿里港股上漲約 7%、美股上漲約 4.5%,市場把這次發布解讀為阿里在 AI 競賽中重新掌握敘事主動權的訊號,而不只是一次常規模型迭代。

中美 AI 敘事在同一週形成對照。Qwen3.8-Max 發布前後幾天,OpenAI 和 Anthropic 接連披露旗下模型在安全評測中「越獄」、意外入侵真實企業系統的事件,促使白宮在 8 月 4 日召集 OpenAI、Anthropic、Google、Meta 商討新的自願性網路安全測試框架。一邊是中國大模型加速開源、搶佔生態;另一邊是美國監管層因 Agent 失控事件收緊審查——這種反差本身也是觀察全球 AI 競爭格局的一個切面。

對 Mac 開發者而言,2.4T 完整版自部署不現實,但 Qwen API 接入只需改 base URL;若需本地備援,Qwen3.8-27B 精簡版開源後可在 Apple Silicon 上用 MLX 跑量化版。Qwen3.8-Max 的價值在於:用更低 API 定價把旗艦級 Agent 能力推到主流開發者可承受區間,同時透過 Apple Intelligence 中國版把千問能力嵌入數億台 iPhone——這比單純刷榜更有長期意義。

9. 常見問題 FAQ

Q1:Qwen3.8-Max 現在能直接用嗎?開源了沒有? API 已經可以透過 QwenCloud 呼叫,相容 OpenAI 和 Anthropic 兩種介面協議。但權重尚未開源,阿里官網雖然標註了「Open-Source」,實際的 Hugging Face/ModelScope 倉庫、開源協議條款要等到官方口徑的「下週」(預計 8 月 10 日前後)才會公布,具體日期以官方公告為準。

Q2:Qwen3.8-Max 和 Kimi K3 到底誰更強? 目前沒有權威的、雙方都認可的統一評測。唯一一次可比的獨立盲測(同一組真實專案架構任務)顯示兩者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分),可以理解為「同檔位、互有勝負」。Kimi K3 的優勢是已經開源、有 Artificial Analysis 等第三方評測數據;Qwen3.8-Max 目前的優勢是 API 價格更低、多模態能力更全面。

Q3:2.4 萬億參數是不是意味著普通開發者根本用不起、用不了? 需要區分總參數和激活參數。2.4 萬億是總參數(MoE 架構下大部分參數不會同時激活),實際激活參數是 950 億,透過 API 呼叫和普通千億級模型的成本量級接近。但如果想本地私有化部署完整版,確實需要多節點資料中心級硬體,更現實的選擇是等待同期開源的精簡版 Qwen3.8-27B。

Q4:阿里公布的跑分能信嗎? 可以作為參考,但不能當作定論。所有數據目前均來自阿里自建的測試框架和部分自訂基準(如 QwenSWEBench、RecreationBench 等),尚無 Artificial Analysis、Arena.ai 等中立平台對正式版給出獨立復現結果,Arena 上目前的排名也標註為「初步」。建議關注後續獨立評測機構的復測結果,或者在自己的實際業務場景裡做 A/B 測試。

Q5:這次發布對普通用戶有什麼實際影響? 除了開發者能拿到更便宜的旗艦級 API 之外,一個具體的消費端案例是:蘋果在中國市場推出的 Apple Intelligence 功能,其生成式 AI 能力就是基於 Qwen 模型(經壓縮後本地執行),意味著國內 iPhone 用戶未來會在系統層面直接用到千問系列模型的能力,而不需要主動選擇或感知到背後的模型廠商。

10. 收束:Qwen API 接入 + 遠端 Mac 的 Agent 混合架構

純 Windows/Linux 雲主機可以調 Qwen3.8-Max API,卻在Cursor 工具鏈協同、OpenClaw Agent 常駐、本地 MLX 量化備援與圖形工作流上不如 Apple Silicon Mac 順暢。2.4T 完整版自部署需資料中心級硬體,但 API 接入只需改 base URL;若你還需要OpenClaw/Hermes 7×24 常駐、長上下文 Agent 分流與統一記憶體吃緊的多模態任務,推薦三檔架構:本機 MLX 跑 Qwen3.8-27B 量化版處理日常量;Qwen3.8-Max API 承接高難度 Agent 與推理;MACGPU 遠端 Mac 節點 承接 OpenClaw 常駐與統一記憶體吃緊的長程自主任務——在萬億參數競賽與架構效率轉向並行之際,可控算力就是最好的對沖。