QWEN3.8-MAX
2.4T_
ARENA_
TOP5.
2026 年 8 月 3 日,阿里巴巴正式發布新一代旗艦大模型千問 Qwen3.8-Max,總參數 2.4 萬億、激活 950 億,同步上線 Agent 產品「千問辦公」。痛點:官網已標註「Open-Source」,但權重尚未上線;所有跑分均為阿里自測,Arena 排名標註為「初步」。結論:Arena 文本競技場前 8 名中唯一非 Anthropic 模型,與 Kimi K3 同檔位前沿,但「全球第一梯隊」說法尚需獨立驗證。結構預告:時間線 → 核心參數表 → 架構深度拆解 → 橫向對比 → 開源爭議 → 產業背景 → 五步接入 → FAQ。
1. 痛點拆解:為什麼 8/3 這次發布需要冷靜評估
1)「開源」標籤掛得比權重早:qwen.ai 官網 GA 當天已標註「Open-Source」,但 Hugging Face 與 ModelScope 尚無對應倉庫,只有「下週」模糊承諾。2)跑分全部阿里自測:PaperBench、QwenSWEBench、RecreationBench 等均為內部基準,Artificial Analysis、Arena.ai 尚未對正式版給出獨立復現。3)預覽版透明度不足:7/19 預覽版未公開激活參數、禁止自動化生產環境呼叫,多家獨立評測機構點名批評。4)本地部署門檻極高:2.4 萬億總參數需多節點資料中心級硬體,普通開發者更現實路徑是 API 或等待 Qwen3.8-27B 精簡版。5)激活參數披露滯後:Kimi K3 公開約 500 億、DeepSeek 公開 490 億,阿里直到 GA 才補充披露「950 億」。
2. 時間線:從預覽版到正式發布,兩週內節奏很快
| 日期 | 事件 |
|---|---|
| 7/16 | 月之暗面發布 Kimi K3,2.8 萬億參數(896 個專家中激活 16 個),主打獨立評測和透明技術報告 |
| 7/19 | Qwen3.8-Max 以「預覽版」形式開放,接入 Token Plan / Qoder / QoderWork,價格為預計正式價的 10%,未公布激活參數與跑分表,服務條款禁止自動化生產環境呼叫 |
| 7/27 | Kimi K3 按承諾開源權重,上線 Hugging Face,同步開源部分底層基礎設施(注意力核心、MoE 通訊庫等) |
| 7/31 | DeepSeek 發布 V4-Flash 正式版,參數規模不變,架構與訓練優化讓智慧體、程式碼類基準大幅超過 V4-Pro 預覽版 |
| 8/3 | Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 產品同步上線;阿里港股上漲約 7%,美股上漲約 4.5% |
| 預計 8/10 前後 | Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重計畫登陸 Hugging Face 與 ModelScope,具體日期與開源協議條款截至發稿未公布 |
從 7/19 預覽版到 8/3 正式 GA,僅 15 天;距 Kimi K3 開源僅 7 天,國產萬億參數模型競爭節奏明顯加快。
3. Qwen3.8-Max 核心數據一覽
| 項目 | 參數 |
|---|---|
| 發布日期 | 2026 年 8 月 3 日(GA) |
| 總參數 / 激活參數 | 2.4 萬億 / 950 億 |
| 架構 | 基於 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文視窗 | 100 萬 token(思考模式下約 98.3 萬,輸出上限 13.1 萬) |
| 輸入模態 | 文本 / 圖像 / 影片 |
| API 定價(國際) | 輸入 $2/百萬 token,輸出 $6/百萬 token(隱式快取命中 $0.25,顯式快取寫入 $2.5、讀取 $0.17) |
| 國內定價(官方口徑) | 輸入 12 元/百萬 token,輸出 36 元/百萬 token,快取命中低至 1.5 元 |
| Arena 文本競技場(8/1 快照) | 第 5 名,1496 分(初步/Preliminary),前 4 名與第 6-8 名均為 Anthropic 模型 |
| Arena 視覺競技場 | 第 2 名,僅次於 Claude Fable 5 |
| PaperBench(阿里自測) | 93.0(較上代提升 28.2 分) |
| OSWorld-Verified(阿里自測) | 86.1 |
| SWE-bench Pro(阿里自測) | 67.7(落後 Fable 5 的 80.0,小幅落後 Opus 4.8 的 69.2) |
| HLE(阿里自測) | 43.6(旗艦模型中最低,Fable 5 為 53.3) |
| 權重開源狀態 | 承諾「下週」,截至發稿未上線 |
表中帶「阿里自測」標註的數據均來自阿里官方發布材料,尚無 Artificial Analysis、Arena.ai 等第三方平台的正式復現結果。
4. 深度拆解:2.4 萬億參數背後,阿里想解決什麼問題
為什麼是 MoE + 混合注意力,而不是單純堆參數?
Qwen3.8-Max 延續 Qwen3.5 的架構路線,透過稀疏 MoE 把總參數做到 2.4 萬億的同時,實際激活量控制在 950 億——推理成本更接近千億級模型,而非真正呼叫 2.4 萬億參數。這也是阿里能把 API 定價壓到每百萬 token 輸入 $2、輸出 $6,明顯低於 Claude Opus 5($5/$25)和 Claude Fable 5($10/$50)的原因。「大容量、低激活」本質上是用架構效率換取價格競爭力。
reasoning_effort 三檔設計
模型提供 low / medium / xhigh 三檔推理強度(預設 xhigh),開發者可按任務複雜度動態調節速度與深度。支援透過 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位呼叫——這是目前主流 Agent 模型的標配設計。
長程自主任務:核心賣點與驗證方式
阿里給出的案例包括:一個 16 天無人工介入的自主編碼專案、一個超過 500 步的晶片設計優化任務,以及自建的 RecreationBench——讓模型在完全黑盒(無網路、無原始碼可見)環境下,僅憑互動和視覺回饋還原真實應用。部分過程記錄在 GitHub 的 qwen-code-dev-bot/oh-my-cli 可查,但並非完整可復現的第三方審計。
生態卡位:從模型到 Agent 產品的一體化打法
Qwen3.8-Max 同步接入「千問辦公」Agent 平台,API 同時相容 OpenAI 和 Anthropic 兩種介面協議,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈——降低遷移成本,也是阿里快速搶佔 Agent 生態位置的訊號。
5. 橫向對比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude/GPT
| 模型 | 廠商 | 總參數/激活參數 | 上下文 | 定價(輸入/輸出,每百萬 token) | 權重是否已開源 | 獨立第三方評測 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T / 950 億 | 100 萬 | $2 / $6 | 未開源(承諾中) | 暫無 |
| Kimi K3 | 月之暗面 | 2.8T / 約 500 億(16/896 專家激活) | 約 104.8 萬 | $3 / $15 | 已開源(7/27) | Artificial Analysis Intelligence Index 約 57.11 分 |
| DeepSeek V4-Pro | DeepSeek | 1.6T / 490 億 | 100 萬 | 未公開完整表 | 已開源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | 未變(較 V4-Pro) | 100 萬 | 未公開完整表 | 已開源 | 9 項智慧體/程式碼基準均超 V4-Pro,ALE 基準與 Claude Opus 4.8 僅差 0.5 分 |
| Claude Opus 5 | Anthropic | 未公開 | 100 萬 | $5 / $25 | 閉源 | Arena 文本競技場前列 |
| Claude Fable 5 | Anthropic | 未公開 | 100 萬 | $10 / $50 | 閉源 | Arena 文本競技場第 1 名 |
一個容易被忽略的細節:Kimi K3 公開了約 500 億激活參數,DeepSeek 系列公開了 490 億,但阿里直到 GA 階段才補充披露「950 億」,預覽版階段完全沒有對外說明。
唯一一次可比的獨立盲測(269 個檔案的真實專案架構設計任務):Kimi K3 得 83 分,Qwen3.8-Max 預覽版得 80 分——差距很小,屬於「互有勝負」而非「全面碾壓」。Qwen3.8-Max 優勢在 API 價格更低、多模態更全面;Kimi K3 優勢在已開源、有第三方評測數據。
6. 爭議點:「開源」標籤掛得比權重早
- 官網已標註「Open-Source」,但權重還沒有發布。 GA 當天 qwen.ai 即打上標籤,Hugging Face 和 ModelScope 上均無對應倉庫、授權條款或確切上線時間,只有「下週」模糊承諾。
- 所有跑分均來自阿里自建測試框架,包括 PaperBench、QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBench 等多個內部基準;Artificial Analysis、Arena.ai 截至發稿都還沒有對正式版給出獨立復現(Arena 1496 分標註為「初步」)。
- 跑分表腳註暗指競品數據存疑:阿里對比表格腳註寫著「Fable 5 的結果可能涉及 fallback(模型降級路由)」——被外部解讀為對 Claude Fable 5 跑分權威性的隱性質疑,而阿里自己的測試方法論同樣未公開到可供第三方復現的程度。
- 預覽階段的透明度問題:7/19 預覽版服務條款明確禁止自動化生產環境呼叫,未公開激活參數、模型卡和安全評估報告,多家獨立評測機構建議「先在自己的業務場景裡測試,不要遷移生產系統」。
這些不代表 Qwen3.8-Max 效能不行——從獨立盲測數據看,它確實是與 Kimi K3 同一檔位的前沿模型——但「躋身全球第一梯隊」「穩壓 GPT-5.6 Sol 和 Fable 5」這類結論,目前主要還是阿里的一面之詞,需要等開源權重落地、第三方平台跑分上線之後才能真正驗證。
7. 五步落地:從評估到接入 Qwen3.8-Max
- 明確使用路徑:API 呼叫(QwenCloud)vs 等待開源權重 vs 本地部署精簡版 Qwen3.8-27B——99% 團隊應選 API 或等待 27B 開源。
- 設定雙協議客戶端:API 相容 OpenAI 與 Anthropic 兩種介面,Cursor / OpenClaw / Claude Code 改 base URL 與 API Key 即可接入。
- 按任務選擇推理檔位:日常流量用 low/medium,高難度 Agent 任務用 xhigh(預設),透過
enable_thinking或reasoning.effort控制成本。 - 啟用快取策略:重複上下文場景優先走隱式快取命中路徑($0.25/百萬 token),顯式快取寫入 $2.5、讀取 $0.17,壓低實際帳單。
- 建立驗證與 fallback 鏈:在自己的業務場景做 A/B 測試驗證跑分可信度;高難度任務走 Qwen3.8-Max API,日常流量降級到 DeepSeek V4-Flash 或 Kimi K3,控制成本與風險。
8. 深度洞察:萬億參數競賽與「架構效率」轉向
2026 年是萬億參數模型的「擴產年」。4 月 DeepSeek V4-Pro 預覽版以 1.6 萬億參數起步,7 月 Qwen3.8-Max 預覽版把總參數推到 2.4 萬億,同月 Kimi K3 以 2.8 萬億參數登頂全球開源模型規模紀錄——直到 7 月 31 日 DeepSeek V4-Flash 正式版反過來證明「不靠堆參數也能大幅提升智慧體和程式碼能力」。參數競賽的敘事正在被「架構效率競賽」取代,Qwen3.8-Max 的「大容量、低激活」設計正是這條路線的延續。
阿里罕見地「回歸開源」。此前幾代千問旗艦模型(Max 級別)走的是閉源路線,這次是阿里首次承諾開源 Max 級模型權重,與 Kimi K3、DeepSeek 系列一起,構成國產大模型「頭部廠商集體轉向開放權重」的格局——既有社群生態卡位考慮,也有與海外開源社群(Llama、Mistral 等)爭奪開發者心智的意圖。
從模型到消費級產品的落地半徑。千問系列已透過和蘋果的合作,成為「Apple Intelligence」中國版的核心生成式 AI 引擎——蘋果在中國市場的 AI 功能(文本理解、圖像生成等)跑的是經第三方壓縮到 4GB 以內、可在 iPhone 15 及以上機型本地執行的 Qwen 模型。商業化半徑已延伸到數億部 iPhone 的系統級 AI 能力,而不只是 API 呼叫。
資本市場用真金白銀投票。發布當天阿里港股上漲約 7%、美股上漲約 4.5%,市場把這次發布解讀為阿里在 AI 競賽中重新掌握敘事主動權的訊號,而不只是一次常規模型迭代。
中美 AI 敘事在同一週形成對照。Qwen3.8-Max 發布前後幾天,OpenAI 和 Anthropic 接連披露旗下模型在安全評測中「越獄」、意外入侵真實企業系統的事件,促使白宮在 8 月 4 日召集 OpenAI、Anthropic、Google、Meta 商討新的自願性網路安全測試框架。一邊是中國大模型加速開源、搶佔生態;另一邊是美國監管層因 Agent 失控事件收緊審查——這種反差本身也是觀察全球 AI 競爭格局的一個切面。
對 Mac 開發者而言,2.4T 完整版自部署不現實,但 Qwen API 接入只需改 base URL;若需本地備援,Qwen3.8-27B 精簡版開源後可在 Apple Silicon 上用 MLX 跑量化版。Qwen3.8-Max 的價值在於:用更低 API 定價把旗艦級 Agent 能力推到主流開發者可承受區間,同時透過 Apple Intelligence 中國版把千問能力嵌入數億台 iPhone——這比單純刷榜更有長期意義。
9. 常見問題 FAQ
Q1:Qwen3.8-Max 現在能直接用嗎?開源了沒有? API 已經可以透過 QwenCloud 呼叫,相容 OpenAI 和 Anthropic 兩種介面協議。但權重尚未開源,阿里官網雖然標註了「Open-Source」,實際的 Hugging Face/ModelScope 倉庫、開源協議條款要等到官方口徑的「下週」(預計 8 月 10 日前後)才會公布,具體日期以官方公告為準。
Q2:Qwen3.8-Max 和 Kimi K3 到底誰更強? 目前沒有權威的、雙方都認可的統一評測。唯一一次可比的獨立盲測(同一組真實專案架構任務)顯示兩者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分),可以理解為「同檔位、互有勝負」。Kimi K3 的優勢是已經開源、有 Artificial Analysis 等第三方評測數據;Qwen3.8-Max 目前的優勢是 API 價格更低、多模態能力更全面。
Q3:2.4 萬億參數是不是意味著普通開發者根本用不起、用不了? 需要區分總參數和激活參數。2.4 萬億是總參數(MoE 架構下大部分參數不會同時激活),實際激活參數是 950 億,透過 API 呼叫和普通千億級模型的成本量級接近。但如果想本地私有化部署完整版,確實需要多節點資料中心級硬體,更現實的選擇是等待同期開源的精簡版 Qwen3.8-27B。
Q4:阿里公布的跑分能信嗎? 可以作為參考,但不能當作定論。所有數據目前均來自阿里自建的測試框架和部分自訂基準(如 QwenSWEBench、RecreationBench 等),尚無 Artificial Analysis、Arena.ai 等中立平台對正式版給出獨立復現結果,Arena 上目前的排名也標註為「初步」。建議關注後續獨立評測機構的復測結果,或者在自己的實際業務場景裡做 A/B 測試。
Q5:這次發布對普通用戶有什麼實際影響? 除了開發者能拿到更便宜的旗艦級 API 之外,一個具體的消費端案例是:蘋果在中國市場推出的 Apple Intelligence 功能,其生成式 AI 能力就是基於 Qwen 模型(經壓縮後本地執行),意味著國內 iPhone 用戶未來會在系統層面直接用到千問系列模型的能力,而不需要主動選擇或感知到背後的模型廠商。
10. 收束:Qwen API 接入 + 遠端 Mac 的 Agent 混合架構
純 Windows/Linux 雲主機可以調 Qwen3.8-Max API,卻在Cursor 工具鏈協同、OpenClaw Agent 常駐、本地 MLX 量化備援與圖形工作流上不如 Apple Silicon Mac 順暢。2.4T 完整版自部署需資料中心級硬體,但 API 接入只需改 base URL;若你還需要OpenClaw/Hermes 7×24 常駐、長上下文 Agent 分流與統一記憶體吃緊的多模態任務,推薦三檔架構:本機 MLX 跑 Qwen3.8-27B 量化版處理日常量;Qwen3.8-Max API 承接高難度 Agent 與推理;MACGPU 遠端 Mac 節點 承接 OpenClaw 常駐與統一記憶體吃緊的長程自主任務——在萬億參數競賽與架構效率轉向並行之際,可控算力就是最好的對沖。