QWEN3.8-MAX
2.4T_
ARENA_
TOP5.

Alibaba 千問 Qwen3.8-Max 2.4兆パラメータ旗艦モデル

2026年8月3日、Alibaba は新世代フラッグシップ大規模言語モデル「千問 Qwen3.8-Max」を正式リリースしました。総パラメータ 2.4兆、アクティブ 950億、Agent 製品「千問オフィス」も同時公開です。論点:公式サイトにはすでに「Open-Source」と表示されていますが、ウェイトは未公開。ベンチマークはすべて Alibaba 自社計測で、Arena 順位は「Preliminary(暫定)」表記です。結論:Arena テキスト上位8位で唯一の非 Anthropic モデルであり、Kimi K3 と同格のフロンティア候補ですが、「世界トップクラス」という主張は第三者検証を待つ必要があります。構成:タイムライン → スペック表 → アーキテクチャ解説 → 横並び比較 → オープンソース論点 → 業界背景 → 5ステップ導入 → FAQ。

1. 論点整理:8/3 リリースを冷静に見る理由

1)「オープンソース」表記がウェイトより先:qwen.ai は GA 当日から「Open-Source」と表示していますが、Hugging Face・ModelScope にリポジトリはなく、「来週公開」の曖昧な約束のみです。2)ベンチマークはすべて自社計測:PaperBench、QwenSWEBench、RecreationBench などは内部ベンチで、Artificial Analysis や Arena.ai による正式版の独立再現はまだありません。3)プレビュー版の透明性不足:7/19 プレビューではアクティブパラメータ未公開、本番自動化呼び出し禁止で、複数の独立評価機関が批判しています。4)ローカル展開のハードルが極めて高い:2.4兆パラメータのフルモデルはマルチノードのデータセンター級ハードウェアが必要で、一般開発者には API か Qwen3.8-27B 軽量版待ちが現実的です。5)アクティブパラメータの開示が遅れた:Kimi K3 は約500億、DeepSeek は490億を公開済みですが、Alibaba は GA まで「950億」を明かしませんでした。

2. タイムライン:プレビューから GA までわずか2週間

日付出来事
7/16Moonshot AI が Kimi K3 を発表。2.8兆パラメータ(896エキスパート中16をアクティブ化)、独立ベンチマークと技術レポートの透明性を訴求
7/19Qwen3.8-Max プレビュー公開。Token Plan / Qoder / QoderWork に接続、正式価格の10%で提供。アクティブパラメータ・ベンチ表なし、本番自動化呼び出し禁止
7/27Kimi K3 が約束どおりオープンウェイト公開。Hugging Face 上線、注意カーネル・MoE 通信ライブラリなど一部インフラも公開
7/31DeepSeek V4-Flash 正式版。パラメータ数は据え置きながら、エージェント・コーディングベンチで V4-Pro プレビューを大きく上回る
8/3Qwen3.8-Max 正式 GA、フルベンチマーク表公開、「千問オフィス」Agent 同時ローンチ。Alibaba 株は香港で約7%、米国で約4.5%上昇
8/10 前後(予定)Qwen3.8-Max と軽量版 Qwen3.8-27B のウェイトが Hugging Face・ModelScope に登場予定。具体的日付・ライセンス条項は未発表

7/19 プレビューから 8/3 GA までわずか 15日。Kimi K3 オープンウェイトから 7日 後のリリースで、中国製兆級モデルの競争ペースが加速しています。

3. Qwen3.8-Max コアスペック一覧

項目
リリース日2026年8月3日(GA)
総パラメータ / アクティブ2.4兆 / 950億
アーキテクチャQwen3.5 ベースのスパース MoE + ハイブリッドアテンション
コンテキスト100万トークン(思考モード約98.3万、最大出力13.1万)
入力モダリティテキスト / 画像 / 動画
API 価格(国際)入力 $2/100万トークン、出力 $6/100万トークン(暗黙キャッシュ $0.25、明示キャッシュ書込 $2.5・読取 $0.17)
国内価格(公式)入力12元/100万トークン、出力36元/100万トークン、キャッシュヒット最低1.5元
Arena テキスト(8/1 スナップショット)5位、1496点(Preliminary)。上位8位中唯一の非 Anthropic モデル
Arena ビジョン2位(Claude Fable 5 に次ぐ)
PaperBench(Alibaba 自社)93.0(前世代比 +28.2)
OSWorld-Verified(Alibaba 自社)86.1
SWE-bench Pro(Alibaba 自社)67.7(Fable 5 の80.0、Opus 4.8 の69.2に僅差で劣後)
HLE(Alibaba 自社)43.6(比較対象フラッグシップ中最低、Fable 5 は53.3)
ウェイト公開状況「来週」約束、執筆時点では未公開

「Alibaba 自社」と記載の数値はすべて公式発表資料由来です。Artificial Analysis・Arena.ai による正式版の独立再現はまだありません。

4. 深掘り:2.4兆パラメータの設計思想

なぜ MoE + ハイブリッドアテンションなのか

Qwen3.8-Max は Qwen3.5 の路線を継承し、スパース MoE で総パラメータ 2.4兆を実現しつつ、アクティブは950億に抑えています。推論コストは実質的に1000億規模モデルに近く、2.4兆すべてを毎回呼び出すわけではありません。これが API 価格を入力 $2・出力 $6/100万トークンに抑え、Claude Opus 5($5/$25)や Claude Fable 5($10/$50)を大きく下回れる理由です。「大容量・低アクティブ」は、スケールではなくアーキテクチャ効率で価格競争力を取る設計です。

reasoning_effort 3段階設計

low / medium / xhigh(デフォルト xhigh)の3段階で推論深度を調整できます。enable_thinking パラメータ、または Anthropic 互換 API の reasoning.effort フィールドから呼び出せます。フロンティア Agent モデルの標準的な設計です。

長期自律タスク:訴求ポイントと検証の限界

Alibaba の事例には、16日間無人の自律コーディングプロジェクト、500ステップ超のチップ設計最適化、自社ベンチ RecreationBench(ネットワーク・ソースコード不可のブラックボックス環境で実アプリを再現)などがあります。GitHub の qwen-code-dev-bot/oh-my-cli に一部ログがありますが、第三者監査による完全再現ではありません。

エコシステム:モデルから Agent 製品への一体展開

「千問オフィス」Agent プラットフォームと同時接続。API は OpenAI・Anthropic 両互換で、Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw など主要 Agent ツールチェーンに base URL 変更だけで接続できます。移行コストを下げ、Agent エコシステムでのポジション確保を狙っています。

5. 横並び比較:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

モデル開発元総/アクティブコンテキスト価格(入/出 per 1M)ウェイト公開独立ベンチ
Qwen3.8-MaxAlibaba2.4T / 950億100万$2 / $6未公開(約束あり)なし
Kimi K3Moonshot AI2.8T / 約500億(16/896)約104.8万$3 / $15公開済(7/27)AA Intelligence Index 約57.11
DeepSeek V4-ProDeepSeek1.6T / 490億100万未公表公開済SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeekV4-Pro と同じ100万未公表公開済9項目で V4-Pro 超、ALE は Opus 4.8 と0.5点差
Claude Opus 5Anthropic非公開100万$5 / $25クローズドArena 上位
Claude Fable 5Anthropic非公開100万$10 / $50クローズドArena テキスト1位

見落としがちな点:Kimi K3・DeepSeek はアクティブパラメータを早期公開しましたが、Alibaba はプレビュー段階で一切明かさず、GA で初めて「950億」を開示しました。

唯一の独立ブラインドテスト(269ファイルの実プロジェクト設計タスク)では、Kimi K3 が 83点、Qwen3.8-Max プレビューが 80点——差は小さく「互角」です。Qwen3.8-Max の強みは API 価格とマルチモーダル、Kimi K3 の強みはオープンウェイトと第三者ベンチです。

6. 論点:「オープンソース」表記がウェイトより先に付いた理由

  1. 公式サイトは「Open-Source」だがウェイト未公開。 GA 当日 qwen.ai に表記が付きましたが、Hugging Face・ModelScope にリポジトリ・ライセンス・確定日はありません。「来週」の曖昧な約束のみです。
  2. すべてのスコアは Alibaba 自社ハーネス。 PaperBench、QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBench など内部ベンチを含み、Artificial Analysis・Arena.ai による GA 版の独立再現は未着手(Arena 1496点は「Preliminary」)。
  3. 脚注が競合スコアを暗に疑う。 比較表脚注に「Fable 5 の結果は fallback(モデル降格ルーティング)を含む可能性」とあり、Claude Fable 5 の権威性への疑念と解釈されています。一方 Alibaba 側の方法論も第三者再現可能な水準では公開されていません。
  4. プレビュー期の透明性問題。 7/19 プレビューは本番自動化禁止、アクティブパラメータ・モデルカード・安全評価未公開で、複数の評価機関が「自社シナリオで試すまで本番移行しないで」と助言しました。

これは Qwen3.8-Max の性能が低いという意味ではありません。独立盲測では Kimi K3 と同格のフロンティアです。ただし「世界トップクラス」「GPT-5.6 Sol や Fable 5 を圧倒」といった主張は、現時点では Alibaba 側の一方的な評価に依存しており、ウェイト公開と第三者ベンチ待ちが必要です。

7. 5ステップ導入ガイド:評価から本番接続まで

  1. ステップ1 — 利用経路の決定:QwenCloud API を使うか、オープンウェイト公開を待つか、軽量版 Qwen3.8-27B をローカル展開するかを決めます。99%のチームは API か 27B 待ちが最適です。2.4兆フルモデルの自前サーバー構築はデータセンター級の投資が必要です。
  2. ステップ2 — デュアルプロトコルクライアントの設定:OpenAI 互換と Anthropic 互換の両方に対応しています。Cursor、OpenClaw、Claude Code では base URL と API Key を差し替えるだけで接続できます。まず開発環境で疎通確認を行いましょう。
  3. ステップ3 — 推論強度のタスク別選択:日常トラフィックは low/medium、高難度 Agent タスクは xhigh(デフォルト)を使います。enable_thinking または reasoning.effort でコストと深度のバランスを調整してください。
  4. ステップ4 — キャッシュ戦略の有効化:繰り返しコンテキストには暗黙キャッシュ($0.25/100万トークン)を優先。明示キャッシュは書込 $2.5・読取 $0.17 で、長い system prompt やコードベース前処理に有効です。
  5. ステップ5 — 検証とフォールバックチェーンの構築:自社ワークロードで A/B テストし、ベンチの信頼性を確認します。高難度タスクは Qwen3.8-Max API、日常流量は DeepSeek V4-Flash や Kimi K3 にフォールバックし、コストとリスクを管理しましょう。

8. 深い洞察:兆級パラメータ競争とアーキテクチャ効率への転換

2026年は兆級モデルの「量産年」です。4月の DeepSeek V4-Pro(1.6兆)から始まり、7月の Qwen3.8-Max プレビュー(2.4兆)、同月の Kimi K3(2.8兆、当時最大オープンウェイト)——しかし7/31 の DeepSeek V4-Flash はパラメータを増やさずエージェント・コーディング能力を大幅向上させ、「パラメータを積むだけ」という物語は終わりつつあります。Qwen3.8-Max の「大容量・低アクティブ」はこの流れへの対応です。

Alibaba の「オープンへの回帰」。 これまで Max 級フラッグシップはクローズド路線でしたが、今回初めて Max 級ウェイトのオープン化を約束。Kimi K3・DeepSeek とともに、中国トップラボがオープンウェイトへ傾く構図が鮮明になりました。Llama・Mistral との開発者獲得競争も背景にあります。

消費者向けへの到達半径。 千問シリーズは Apple との提携により、中国版 Apple Intelligence の中核生成 AI エンジンになっています。テキスト理解・画像生成などは、第三者圧縮により4GB未満に収めた Qwen モデルが iPhone 15 以降でオンデバイス実行されます。API を呼ばなくても数億台の iPhone に組み込まれる——これはリーダーボード以上に大きな商業的インパクトです。

資本市場の反応。 リリース当日、Alibaba 株は香港で約 7%、米国で約 4.5% 上昇。単なるモデル更新ではなく、AI 競争でのナラティブ主導権回復と市場が解釈しています。

米中 AI ナラティブの同週対比。 Qwen3.8-Max 公開の前後、OpenAI・Anthropic が安全評価での「脱獄」や実企業システムへの不正侵入を相次ぎ公表。8月4日にはホワイトハウスが OpenAI、Anthropic、Google、Meta を招き、自発的サイバーセキュリティテスト枠組みを協議しました。中国側はフロンティア級ウェイトのオープン化を加速、米国側は Agent 事故後の規制強化——この対比自体がグローバル AI 競争を読む切り口になります。

Mac 開発者にとって、2.4T フルモデルの自前展開は非現実的ですが、Qwen API は base URL 変更だけで使えます。ローカルフォールバックには Qwen3.8-27B 公開後に Apple Silicon + MLX で量子化版を走らせるのが現実的です。Qwen3.8-Max の価値は、低価格 API でフラッグシップ級 Agent 能力を主流開発者の手の届く範囲に押し下げること、そして Apple Intelligence 中国版経由で数億台の iPhone に届くこと——リーダーボード争い以上に長期的な意味を持ちます。

9. よくある質問 FAQ

Q1:Qwen3.8-Max は今すぐ使えますか?オープンソースですか? API は QwenCloud 経由で利用可能で、OpenAI・Anthropic 両互換です。ただしウェイトは未公開で、公式サイトの「Open-Source」表記は意図を示すものにとどまります。Hugging Face/ModelScope のリポジトリ・ライセンスは「来週」(8/10前後予想)の公式発表を待つ必要があります。

Q2:Qwen3.8-Max と Kimi K3、どちらが強いですか? 双方が認める統一ベンチはまだありません。唯一の独立盲測では Kimi K3 83点、Qwen3.8-Max プレビュー 80点で「互角」です。Kimi K3 はオープンウェイトと第三者ベンチが強み、Qwen3.8-Max は API 価格とマルチモーダルが強みです。

Q3:2.4兆パラメータは一般開発者には使えないのでしょうか? 総パラメータとアクティブパラメータは別です。MoE では同時アクティブは950億で、API 利用のコストは1000億規模モデルに近い水準です。フルモデルのオンプレ展開にはマルチノードのデータセンターが必要で、現実的には Qwen3.8-27B 軽量版の公開を待つのが妥当です。

Q4:Alibaba 公表のベンチマークは信頼できますか? 参考にはなりますが、確定とは言えません。すべて自社ハーネスとカスタムベンチ(QwenSWEBench、RecreationBench 等)由来で、中立機関による GA 版の再現は未確認、Arena 順位も「Preliminary」です。第三者の再現か、自社 A/B テストを推奨します。

Q5:一般ユーザーへの実際の影響は? 開発者はより安価なフラッグシップ API を得られます。消費者向けには、中国版 Apple Intelligence の生成 AI が Qwen モデル(圧縮オンデバイス版)を使っており、国内 iPhone ユーザーはシステムレベルで千問の能力を間接的に利用することになります。

10. まとめ:Qwen API + リモート Mac の Agent ハイブリッド構成

Windows/Linux のクラウドサーバーでも Qwen3.8-Max API は呼べますが、Cursor ツールチェーン連携、OpenClaw Agent の常駐、ローカル MLX 量子化フォールバック、グラフィックワークフローでは Apple Silicon Mac の方がスムーズです。2.4T フルモデルの自前展開はデータセンター級ですが、API は base URL 変更だけ。さらに OpenClaw/Hermes の24時間常駐、長コンテキスト Agent のオフロード、統一メモリを食うマルチモーダルタスクが必要なら、3層構成が最適です:ローカル MLX で Qwen3.8-27B 量子化版を日常処理、Qwen3.8-Max API で高難度 Agent・推論、MACGPU リモート Mac ノード で OpenClaw 常駐と長期自律タスク——兆級競争と効率競争が並走する今、予測可能な計算資源が最良のヘッジになります。