2026 GROK
4.6_
AUG_7_
1.5T.
馬斯克於7月28日在X回覆Vercel執行長Guillermo Rauch時透露,xAI預計在8月7日前後發布參數規模達1.5萬億的Grok 4.6,並在數週內推出2.1萬億參數的Grok 4.7。痛點:開發者與企業面對「Musk time」彈性時程、零基準分數的預告規格,以及Kimi K3開源衝擊下極短的選型窗口。結論:在xAI官方模型卡落地前,應以Token效率與真實任務成本——而非參數規模 alone——作為決策依據。結構預告:時間軸 → 核心數據表 → SFT/RL深度拆解 → 競品橫評 → 爭議警示 → 8月扎堆發布月洞察 → 五步選型 → FAQ。
30 秒讀懂 · 執行摘要
| 資訊來源 | 馬斯克7月28日X回覆(非xAI官方公告) |
| Grok 4.6 | ~8月7日 · 1.5萬億參數 · SFT/RL大幅升級 |
| Grok 4.7 | 8月末-9月初 · 2.1萬億 · 全面優於4.6但推理稍慢 |
| 競爭背景 | Kimi K3開源後第10天 · 與Fable 5.1傳聞同月登場 |
| 定價/基準 | 全部空白 — 無官方模型卡或第三方評測 |
1. 痛點拆解:為什麼這次預告值得認真讀、又不能全信
- 「Musk time」有歷史彈性——xAI、Tesla、SpaceX 的公開時程表歷來可能延後數天到兩週;「大約8月7日」是目標而非承諾。
- 唯一資訊源是一則貼文——與Grok 4.5發布時附帶的15項基準、模型卡、定價頁不同,4.6/4.7目前零獨立驗證數據。
- 競爭節奏被Kimi K3拉滿——7月26日K3全面開源(2.8萬億、Frontend Code Arena 1679分登頂)後,馬斯克在相關評測下留言「令人印象深刻」,xAI壓縮發布節奏的產業壓力確實存在。
2. 時間軸:從Grok 4.5到4.6、4.7,節奏有多快
| 日期 | 事件 |
|---|---|
| 2026-07-08 | xAI正式發布Grok 4.5:程式設計與智慧體旗艦,與Cursor聯合訓練,50萬token上下文,定價輸入$2/輸出$6(每百萬token) |
| 2026-07-16 | 月之暗面Kimi K3託管服務上線 |
| 2026-07-26 | Kimi K3提前一天釋出完整開源權重(2.8萬億、100萬token上下文) |
| 2026-07-28 | 馬斯克在X回覆Rauch,首次公開Grok 4.6/4.7路線圖;同日1200+員工聯署「Pacing the Frontier」公開信 |
| ~2026-08-07 | Grok 4.6目標發布:1.5萬億參數,SFT/RL升級重點 |
| ~2026-08末-9月初 | Grok 4.7目標發布:2.1萬億參數,馬斯克稱全面優於4.6但推理稍慢、token效率更高 |
3. 核心數據一覽
| 模型 | 發布/目標時間 | 參數規模 | 定位重點 | 狀態 |
|---|---|---|---|---|
| Grok 4.3 Beta | 2026-04-17 | 未公開 | 上一代基線 | 已發布 |
| Grok 4.5 | 2026-07-08 | 未公開 | 程式設計與智慧體,Cursor聯合訓練 | 已發布 |
| Grok 4.6 | ~2026-08-07 | 1.5萬億 | SFT/RL大幅升級 | 官方預告,未發布 |
| Grok 4.7 | ~8月末-9月初 | 2.1萬億 | 全面優於4.6,token效率更高 | 官方預告,未發布 |
註:參數規模、定價、基準分數均為廠商/馬斯克自述,Grok 4.6與4.7目前均未有第三方獨立評測數據。
4. 深度拆解:這次升級的重點不是「更大」,而是「更會學」
4.1 SFT和RL到底在解決什麼問題
監督微調(SFT)用高品質標註樣本修正模型輸出習慣;強化學習(RL)用獎勵訊號讓模型在真實任務鏈路中學會多步驟智慧體行為。馬斯克強調Grok 4.6升級重點在「SFT & RL」而非參數本身——這與Grok 4.5打法延續:4.5憑藉Cursor真實開發者會話數據,在Terminal-Bench 2.1拿到83.3%、SWE-Bench Pro 64.7%,且同類任務輸出token約15,954,遠低於Claude Opus 4.8的67,020(約4.2倍效率差)。
4.2 為什麼xAI選擇「參數堆量+後訓練精修」兩條路並行
Grok 4.6的1.5萬億是明顯規模躍升,但馬斯克隨後補充Grok 4.7更大(2.1萬億)卻「推理稍慢」,暗示xAI內部用兩款不同定位模型分別滿足「更強」與「更快」,而非一個SKU通吃所有場景。對需要高頻寬、低延遲的Agent路由而言,這意味著伺服器端可能要同時部署兩套推論叢集,記憶體與GPU配置需預留彈性。
4.3 與Kimi K3同期競爭帶來的現實壓力
Grok 4.6目標日期卡在Kimi K3全面開源後約第10天。K3在Frontend Code Arena以1679分登頂,成為首個超越所有閉源模型的開源權重模型,Artificial Analysis智慧指數綜合排名全球第三。業界普遍解讀,xAI加快4.6/4.7節奏與中美競爭烈度上升直接相關。
5. 橫向對比:Grok系列 vs 同期競品
| 模型 | 廠商 | 參數規模 | 上下文 | 定價(輸入/輸出,每百萬token) | 數據來源 |
|---|---|---|---|---|---|
| Grok 4.5 | xAI | 未公開 | 50萬token | $2 / $6 | xAI官方 |
| Grok 4.6(預告) | xAI | 1.5萬億 | 未公開 | 未公開 | 馬斯克X貼文(未驗證) |
| Kimi K3 | 月之暗面 | 2.8萬億(MoE,~16/896專家激活) | 100萬token | $0.30(快取命中)/$3(未命中)輸入,$15輸出 | Moonshot官方 |
| Claude Fable 5.1(傳聞) | Anthropic | 未公開 | 未公開 | 傳聞維持Fable 5($10/$50) | 36kr、WinCentral爆料 |
| GPT-5.6 Sol | OpenAI | 未公開 | 未公開 | 未公開 | OpenAI官方 |
6. 爭議點與需要注意的細節
- 時程表未經第三方驗證:目前唯一資訊源是馬斯克X回覆,xAI官方部落格尚未同步。
- 基準分數與定價全部空白:「1.5萬億參數」和「SFT/RL大幅升級」目前都是廠商單方面說法。
- xAI內容安全爭議:7月xAI起訴用戶利用Grok繞過安全限制生成CSAM;今年1月Common Sense Media將Grok評為未成年人保護最差AI產品之一。
- 與產業「減速」呼籲的錯位:7月28日馬斯克發布路線圖同一天,OpenAI、Anthropic等1200+員工聯署「Pacing the Frontier」公開信;xAI未出現在簽署名單中。
7. 產業洞察:2026年8月會是「扎堆發布月」
若馬斯克時程表成立,Grok 4.6、Grok 4.7將與傳聞中的Claude Fable 5.1(多方爆料指向8月,且Anthropic意圖搶在GPT-6之前上線)在同月登場,疊加7月已開源的Kimi K3衝擊,2026年8月很可能成為大模型發布密度最高的月份之一。對開發者與企業用戶而言,上一代旗艦可能剛上線一個月就要面對新一代競品——這意味著「等一等再買API額度」的策略風險與「立刻鎖定長期合約」的鎖定風險同時放大。
更深層的變化在於選型維度從「跑分第一」轉向「單位任務總成本」:Grok 4.5已證明,在Agent場景裡輸出token效率可以抵消綜合智慧指數落後;Kimi K3則用開源權重把「可自部署」變成硬選項;Fable 5.1若真在8月亮相,將進一步擠壓閉源溢價空間。三類路徑——閉源API、開源自部署、混合路由——將在8月迎來一次集中壓力測試。
對台港開發者而言,Moonshot K3的Modified MIT許可與API低價快取($0.30/M命中)已經把「國產模型做主力、閉源做終審」變成可操作的預設架構;xAI若按預告節奏連推兩款萬億級模型,Cursor/OpenRouter上的路由表更新頻率將從「季度」縮短到「週」——維運側需要預設模型別名漂移與fallback鏈自動切換,否則8月的發布潮會直接變成生產事故潮。伺服器頻寬與統一記憶體配置也應預留48小時評估窗口,避免首日全量切換拖垮推論叢集。
8. 五步選型指南:在官方模型卡落地前怎麼做準備
- 鎖定資訊源:關注xAI官方部落格(x.ai/news)、Grok Build控制台與馬斯克X帳號;在模型卡發布前不把預告參數寫入SLA。
- 建立三層路由:主力(目前Grok 4.5或Kimi K3 API)→ 高精度終審(Claude/GPT)→ 離線兜底(本機MLX量化開源模型);避免單供應商鎖定。
- 預設Token效率驗收:用SWE-Bench同類任務記錄「輸出token/任務」基線;新模型上線後先跑20個真實倉庫任務再切換預設路由。
- 8月發布窗口預案:為Grok 4.6、Fable 5.1、K3微調版分別預留48小時評估窗口,禁止在生產環境首日全量切換。
- 合規與安全稽核:若企業涉及未成年人或敏感內容場景,將xAI近期安全訴訟納入供應商風險評估清單,與技術指標並列評審。
9. FAQ
Q1:Grok 4.6具體是哪天發布?
馬斯克表示「大約8月7日」,但這是非正式表態,實際時間可能提前或延後。
Q2:Grok 4.6和Grok 4.7有什麼區別?
4.6為1.5萬億參數,重點SFT/RL後訓練;4.7為2.1萬億,能力全面優於4.6但推理速度略慢、token效率更高。
Q3:Grok 4.6會比Kimi K3或Claude Fable 5.1更強嗎?
目前無法判斷。Grok 4.6無公開基準,Kimi K3已有實測數據,Fable 5.1尚未被Anthropic官方確認。
Q4:Grok 4.6大概會怎麼定價?
官方未公布。可參考Grok 4.5(輸入$2/輸出$6,每百萬token),但新一代可能調整。
Q5:一般用戶屆時能在哪裡用上Grok 4.6?
按Grok 4.5路徑推測,大概率先上線Grok Build、xAI API和控制台,隨後接入Cursor等第三方平台。
10. 收束:前沿API追逐 + Mac本地開源兜底的混合架構
純 Windows/Linux 雲端主機可以追蹤 Grok 4.6 發布動態並呼叫各類 API,卻在本地開源模型對照驗收、Cursor/OpenClaw Agent 常駐、MLX 量化 Kimi K3 兜底與長上下文分流上不如 Apple Silicon Mac 順暢。8月扎堆發布月裡,真正稀缺的不是「哪個模型跑分更高」,而是能在48小時內完成真實任務對照、且不被供應商鎖死的可審計算力環境。若你需要本機 MLX 跑 K3 量化版做離線對照、遠端節點 7×24 跑 OpenClaw 多模型路由評測、統一記憶體支撐 Agent 長會話分流,推薦三檔架構:本機 MLX 處理日常與離線兜底;前沿閉源 API 承接 Grok/Claude 高難度推理;MACGPU 遠端 Mac 節點 承接 Agent 常駐與隔離評測——在「Musk time」與「發布月」雙重不確定性下,可控算力就是最好的對沖。