2026 GROK
4.6_
AUG_7_
1.5T.
马斯克7月28日在X上回复Vercel CEO Guillermo Rauch时透露,xAI将于8月7日前后发布参数规模达1.5万亿的Grok 4.6,随后几周内还会推出2.1万亿参数的Grok 4.7。痛点:开发者与企业用户面对「Musk time」弹性时间表、零基准分数的预告参数,以及Kimi K3开源冲击下的选型窗口极短。结论:在xAI官方模型卡落地前,应以Token效率与真实任务成本——而非参数规模 alone——作为决策依据。结构预告:时间线 → 核心数据表 → SFT/RL深度拆解 → 竞品横评 → 争议警示 → 8月扎堆发布月洞察 → 五步选型 → FAQ。
30 秒读懂 · 执行摘要
| 信息来源 | 马斯克7月28日X回复(非xAI官方公告) |
| Grok 4.6 | ~8月7日 · 1.5万亿参数 · SFT/RL大幅升级 |
| Grok 4.7 | 8月末-9月初 · 2.1万亿 · 全面优于4.6但推理稍慢 |
| 竞争背景 | Kimi K3开源后第10天 · 与Fable 5.1传闻同月登场 |
| 定价/基准 | 全部空白 — 无官方模型卡或第三方评测 |
1. 痛点拆解:为什么这次预告值得认真读、又不能全信
- 「Musk time」有历史弹性——xAI、Tesla、SpaceX 的公开时间表历来可能延后数天到两周;「大约8月7日」是目标而非承诺。
- 唯一信息源是一条推文——与Grok 4.5发布时附带的15项基准、模型卡、定价页不同,4.6/4.7目前零独立验证数据。
- 竞争节奏被Kim K3拉满——7月26日K3全面开源(2.8万亿、Frontend Code Arena 1679分登顶)后,马斯克在相关评测下留言「令人印象深刻」,xAI压缩发布节奏的行业压力真实存在。
2. 时间线:从Grok 4.5到4.6、4.7,节奏有多快
| 日期 | 事件 |
|---|---|
| 2026-07-08 | xAI正式发布Grok 4.5:编程与智能体旗舰,与Cursor联合训练,50万token上下文,定价输入$2/输出$6(每百万token) |
| 2026-07-16 | 月之暗面Kimi K3托管服务上线 |
| 2026-07-26 | Kimi K3提前一天放出完整开源权重(2.8万亿、100万token上下文) |
| 2026-07-28 | 马斯克在X回复Rauch,首次公开Grok 4.6/4.7路线图;同日1200+员工联署「Pacing the Frontier」公开信 |
| ~2026-08-07 | Grok 4.6目标发布:1.5万亿参数,SFT/RL升级重点 |
| ~2026-08末-9月初 | Grok 4.7目标发布:2.1万亿参数,马斯克称全面优于4.6但推理稍慢、token效率更高 |
3. 核心数据一览
| 模型 | 发布/目标时间 | 参数规模 | 定位重点 | 状态 |
|---|---|---|---|---|
| Grok 4.3 Beta | 2026-04-17 | 未公开 | 上一代基线 | 已发布 |
| Grok 4.5 | 2026-07-08 | 未公开 | 编程与智能体,Cursor联合训练 | 已发布 |
| Grok 4.6 | ~2026-08-07 | 1.5万亿 | SFT/RL大幅升级 | 官方预告,未发布 |
| Grok 4.7 | ~8月末-9月初 | 2.1万亿 | 全面优于4.6,token效率更高 | 官方预告,未发布 |
注:参数规模、定价、基准分数均为厂商/马斯克自述,Grok 4.6与4.7目前均未有第三方独立评测数据。
4. 深度拆解:这次升级的重点不是「更大」,而是「更会学」
4.1 SFT和RL到底在解决什么问题
监督微调(SFT)用高质量标注样本纠正模型输出习惯;强化学习(RL)用奖励信号让模型在真实任务链路中学会多步骤智能体行为。马斯克强调Grok 4.6升级重点在「SFT & RL」而非参数本身——这与Grok 4.5打法延续:4.5凭借Cursor真实开发者会话数据,在Terminal-Bench 2.1拿到83.3%、SWE-Bench Pro 64.7%,且同类任务输出token约15,954,远低于Claude Opus 4.8的67,020(约4.2倍效率差)。
4.2 为什么xAI选择「参数堆量+后训练精修」两条腿走路
Grok 4.6的1.5万亿是明显规模跃升,但马斯克随后补充Grok 4.7更大(2.1万亿)却「推理稍慢」,暗示xAI内部用两款不同定位模型分别满足「更强」与「更快」,而非一个SKU通吃所有场景。
4.3 与Kimi K3同期竞争带来的现实压力
Grok 4.6目标日期卡在Kimi K3全面开源后约第10天。K3在Frontend Code Arena以1679分登顶,成为首个超越所有闭源模型的开源权重模型,Artificial Analysis智能指数综合排名全球第三。业内普遍解读,xAI加快4.6/4.7节奏与中美竞争烈度上升直接相关。
5. 横向对比:Grok系列 vs 同期竞品
| 模型 | 厂商 | 参数规模 | 上下文 | 定价(输入/输出,每百万token) | 数据来源 |
|---|---|---|---|---|---|
| Grok 4.5 | xAI | 未公开 | 50万token | $2 / $6 | xAI官方 |
| Grok 4.6(预告) | xAI | 1.5万亿 | 未公开 | 未公开 | 马斯克X帖子(未验证) |
| Kimi K3 | 月之暗面 | 2.8万亿(MoE,~16/896专家激活) | 100万token | $0.30(缓存命中)/$3(未命中)输入,$15输出 | Moonshot官方 |
| Claude Fable 5.1(传闻) | Anthropic | 未公开 | 未公开 | 传闻维持Fable 5($10/$50) | 36kr、WinCentral爆料 |
| GPT-5.6 Sol | OpenAI | 未公开 | 未公开 | 未公开 | OpenAI官方 |
6. 争议点与需要注意的细节
- 时间表未经第三方验证:目前唯一信息源是马斯克X回复,xAI官方博客尚未同步。
- 基准分数与定价全部空白:「1.5万亿参数」和「SFT/RL大幅升级」目前都是厂商单方面说法。
- xAI内容安全争议:7月xAI起诉用户利用Grok绕过安全限制生成CSAM;今年1月Common Sense Media将Grok评为未成年人保护最差AI产品之一。
- 与行业「减速」呼吁的错位:7月28日马斯克发布路线图同一天,OpenAI、Anthropic等1200+员工联署「Pacing the Frontier」公开信;xAI未出现在签署名单中。
7. 行业洞察:2026年8月会是「扎堆发布月」
若马斯克时间表成立,Grok 4.6、Grok 4.7将与传闻中的Claude Fable 5.1(多方爆料指向8月,且Anthropic意图抢在GPT-6之前上线)在同月登场,叠加7月已开源的Kimi K3冲击,2026年8月很可能成为大模型发布密度最高的月份之一。对开发者和企业用户而言,上一代旗舰可能刚上线一个月就要面对新一代竞品——这意味着「等一等再买API额度」的策略风险与「立刻锁定长期合同」的锁定风险同时放大。
更深层的变化在于选型维度从「跑分第一」转向「单位任务总成本」:Grok 4.5已证明,在Agent场景里输出token效率可以抵消综合智能指数落后;Kimi K3则用开源权重把「可自部署」变成硬选项;Fable 5.1若真在8月亮相,将进一步挤压闭源溢价空间。三类路径——闭源API、开源自部署、混合路由——将在8月迎来一次集中压力测试。
对中国开发者而言,Moonshot K3的Modified MIT许可与API低价缓存($0.30/M命中)已经把「国产模型做主力、闭源做终审」变成可操作的默认架构;xAI若按预告节奏连推两款万亿级模型,Cursor/OpenRouter上的路由表更新频率将从「季度」缩短到「周」——运维侧需要预设模型别名漂移与fallback链自动切换,否则8月的发布潮会直接变成生产事故潮。
8. 五步选型指南:在官方模型卡落地前怎么做准备
- 锁定信息源:关注xAI官方博客(x.ai/news)、Grok Build控制台与马斯克X账号;在模型卡发布前不把预告参数写入SLA。
- 建立三层路由:主力(当前Grok 4.5或Kimi K3 API)→ 高精度终审(Claude/GPT)→ 离线兜底(本地MLX量化开源模型);避免单供应商锁定。
- 预设Token效率验收:用SWE-Bench同类任务记录「输出token/任务」基线;新模型上线后先跑20个真实仓库任务再切换默认路由。
- 8月发布窗口预案:为Grok 4.6、Fable 5.1、K3微调版分别预留48小时评估窗口,禁止在生产环境首日全量切换。
- 合规与安全审计:若企业涉及未成年人或敏感内容场景,将xAI近期安全诉讼纳入供应商风险评估清单,与技术指标并列评审。
9. FAQ
Q1:Grok 4.6具体是哪天发布?
马斯克表示「大约8月7日」,但这是非正式表态,实际时间可能提前或延后。
Q2:Grok 4.6和Grok 4.7有什么区别?
4.6为1.5万亿参数,重点SFT/RL后训练;4.7为2.1万亿,能力全面优于4.6但推理速度略慢、token效率更高。
Q3:Grok 4.6会比Kimi K3或Claude Fable 5.1更强吗?
目前无法判断。Grok 4.6无公开基准,Kimi K3已有实测数据,Fable 5.1尚未被Anthropic官方确认。
Q4:Grok 4.6大概会怎么定价?
官方未公布。可参考Grok 4.5(输入$2/输出$6,每百万token),但新一代可能调整。
Q5:普通用户届时能在哪里用上Grok 4.6?
按Grok 4.5路径推测,大概率先上线Grok Build、xAI API和控制台,随后接入Cursor等第三方平台。
10. 收束:前沿API追逐 + Mac本地开源兜底的混合架构
纯 Windows/Linux 云主机可以追踪 Grok 4.6 发布动态并调用各类 API,却在本地开源模型对照验收、Cursor/OpenClaw Agent 常驻、MLX 量化 Kimi K3 兜底与长上下文分流上不如 Apple Silicon Mac 顺滑。8月扎堆发布月里,真正稀缺的不是「哪个模型跑分更高」,而是能在48小时内完成真实任务对照、且不被供应商锁死的可审计算力环境。若你需要本机 MLX 跑 K3 量化版做离线对照、远程节点 7×24 跑 OpenClaw 多模型路由评测、统一内存支撑 Agent 长会话分流,推荐三档架构:本机 MLX 处理日常与离线兜底;前沿闭源 API 承接 Grok/Claude 高难度推理;MACGPU 远程 Mac 节点 承接 Agent 常驻与隔离评测——在「Musk time」与「发布月」双重不确定性下,可控算力就是最好的对冲。