GROK 4.6
AUG_7_
1.5T_
TARGET.
일론 머스크는 2026년 7월 28일 Vercel CEO Guillermo Rauch에게 X 답글로 xAI가 8월 7일 전후 1.5조 파라미터 Grok 4.6을, 수주 내 2.1조 Grok 4.7을 출시할 것이라 밝혔습니다. xAI 공식 발표가 아닌 개인 SNS 게시입니다. 핵심 문제: 「Musk time」 일정 변동, 벤치마크 없는 예고 스펙, Kimi K3 오픈웨이트 충격으로 모델 선정 창이 극단적으로 짧아졌습니다. 결론: xAI 모델 카드 공개 전까지는 파라미터 수가 아니라 토큰 효율과 실제 태스크 비용이 의사결정 기준입니다. 구성: 타임라인 → 스펙표 → SFT/RL → 경쟁 비교 → 논란 → 8월 출시 병목 → 5단계 가이드 → FAQ.
30초 요약 · 핵심 정리
| 정보 출처 | 머스크 7월 28일 X 답글 (xAI 공식 아님) |
| Grok 4.6 | ~8월 7일 · 1.5조 파라 · SFT/RL 대폭 강화 |
| Grok 4.7 | 8월 말~9월 초 · 2.1조 · 4.6 전반 우위, 추론은 다소 느림 |
| 경쟁 맥락 | Kimi K3 오픈웨이트 약 10일 후 · Fable 5.1 루머 동월 |
| 가격/벤치마크 | 전부 공백 — 모델 카드·제3자 점수 없음 |
1. 왜 이번 예고를 진지하게 읽되, 전부 믿으면 안 되는가
- 「Musk time」은 지연 전례가 있습니다. xAI·Tesla·SpaceX 공개 일정은 역사적으로 수일~2주 밀린 적이 있습니다. 「약 8월 7일」은 목표일 뿐 약속이 아닙니다.
- 유일한 출처는 트윗 1건입니다. Grok 4.5의 15개 벤치마크·모델 카드·가격 페이지와 달리 4.6/4.7은 독립 검증 데이터가 0입니다.
- Kimi K3가 경쟁 압력을 극대화했습니다. 7월 26일 K3 전체 오픈웨이트(2.8조, Frontend Code Arena 1,679점) 이후 머스크도 「인상적」이라 댓글을 달았고, xAI 출시 가속은 업계 현실적 대응으로 해석됩니다.
2. 타임라인: Grok 4.5 → 4.6 → 4.7
| 날짜 | 이벤트 |
|---|---|
| 2026-07-08 | xAI Grok 4.5 공식 출시: 코딩·에이전트 플래그십, Cursor 공동 훈련, 50만 토큰 컨텍스트, 입력 $2/출력 $6(백만 토큰) |
| 2026-07-16 | 월지암면(Moonshot AI) Kimi K3 호스팅 프리뷰 시작 |
| 2026-07-26 | Kimi K3 전체 오픈웨이트 공개(2.8조, 100만 토큰 컨텍스트) |
| 2026-07-28 | 머스크 Grok 4.6/4.7 로드맵 게시; 동일일 OpenAI·Anthropic 등 1,200+명 「Pacing the Frontier」 연서 |
| ~2026-08-07 | Grok 4.6 목표 출시: 1.5조 파라, SFT/RL 강화 중심 |
| ~2026-08말-9월초 | Grok 4.7 목표 출시: 2.1조 파라, 4.6 전반 우위·추론 속도는 다소 느림·토큰 효율 향상 |
3. 핵심 스펙표
| 모델 | 출시/목표일 | 파라미터 | 포지셔닝 | 상태 |
|---|---|---|---|---|
| Grok 4.3 Beta | 2026-04-17 | 미공개 | 이전 세대 기준선 | 출시 완료 |
| Grok 4.5 | 2026-07-08 | 미공개 | 코딩·에이전트, Cursor 공동 훈련 | 출시 완료 |
| Grok 4.6 | ~2026-08-07 | 1.5조 | SFT/RL 대폭 강화 | 예고만, 미출시 |
| Grok 4.7 | ~8월말-9월초 | 2.1조 | 4.6 전반 우위, 토큰 효율↑ | 예고만, 미출시 |
참고: 파라미터·가격·벤치마크는 벤더/머스크 발언 기준이며, Grok 4.6·4.7 모두 제3자 독립 평가 없음.
4. 심층 분석: 이번 업그레이드의 핵심은 「더 크게」가 아니라 「더 잘 배우기」
4.1 SFT와 RL이 해결하는 문제
지도 미세조정(SFT)은 고품질 라벨 샘플로 출력 습관을 교정합니다. 강화학습(RL)은 보상 신호로 실제 태스크 체인에서 다단계 에이전트 행동을 학습시킵니다. 머스크가 Grok 4.6 강조점을 「SFT & RL」로 둔 것은 Grok 4.5 전략의 연장입니다. 4.5는 Cursor 실제 개발자 세션 데이터로 Terminal-Bench 2.1 83.3%, SWE-Bench Pro 64.7%를 기록했고, 동급 태스크 출력 토큰은 약 15,954로 Claude Opus 4.8의 67,020(약 4.2배 효율 격차)보다 훨씬 적습니다.
4.2 xAI가 「파라미터 확대 + 사후훈련 정밀화」 이중 전략을 택한 이유
Grok 4.6 1.5조는 명확한 규모 도약이지만, 머스크는 Grok 4.7을 2.1조로 두면서 「추론은 다소 느리다」고 보완했습니다. xAI 내부에서 「더 강함」과 「더 빠름」 SKU를 분리해 단일 모델로 모든 시나리오를 커버하지 않는 전략을 시사합니다. Anthropic Sonnet/Opus 분리·OpenAI mini/full 티어와 동형입니다.
4.3 Kimi K3 동시기 경쟁 압력
Grok 4.6 목표일은 Kimi K3 전체 오픈웨이트 약 10일 후입니다. K3는 Frontend Code Arena 1,679점으로 해당 보드 최초 오픈웨이트 전 폐쇄 모델 초과 기록, Artificial Analysis Intelligence Index 종합 3위입니다. xAI 4.6/4.7 가속은 미중 AI 경쟁 격화와 직결된 업계 해석이 지배적입니다.
5. 경쟁 모델 횡단 비교
| 모델 | 벤더 | 파라미터 | 컨텍스트 | 가격(입/출, 백만 토큰) | 출처 |
|---|---|---|---|---|---|
| Grok 4.5 | xAI | 미공개 | 50만 토큰 | $2 / $6 | xAI 공식 |
| Grok 4.6(예고) | xAI | 1.5조 | 미공개 | 미공개 | 머스크 X 게시(미검증) |
| Kimi K3 | Moonshot AI | 2.8조(MoE, ~16/896 활성) | 100만 토큰 | $0.30(캐시 히트)/$3(미스) 입력, $15 출력 | Moonshot 공식 |
| Claude Fable 5.1(루머) | Anthropic | 미공개 | 미공개 | 루머 Fable 5 유지($10/$50) | 36kr, WinCentral 유출 |
| GPT-5.6 Sol | OpenAI | 미공개 | 미공개 | 미공개 | OpenAI 공식 |
6. 논란·주의사항
- 일정 미검증: 현재 유일 출처는 머스크 X 답글, xAI 공식 블로그 미동기화.
- 벤치마크·가격 전부 공백: 「1.5조 파라」「SFT/RL 대폭 강화」는 현재 벤더 단독 주장.
- xAI 콘텐츠 안전 논란: 2026년 7월 Grok 안전 제한 우회 CSAM 생성 관련 사용자 소송; 2026년 1월 Common Sense Media가 Grok을 미성년자 보호 최악급 AI로 평가.
- 업계 「감속」 호소와의 괴리: 7월 28일 로드맵 공개 당일 OpenAI·Anthropic 등 1,200+명 「Pacing the Frontier」 연서; xAI는 서명 목록에 없음.
7. 업계 인사이트: 2026년 8월 「출시 병목月」
머스크 일정이 성립하면 Grok 4.6·4.7은 루머의 Claude Fable 5.1(다수 유출 8월, Anthropic GPT-6 선행 의도)과 동월 등장하고, 7월 Kimi K3 오픈웨이트 충격까지 겹칩니다. 2026년 8월은 프론티어 모델 출시 밀도가 기록적일 가능성이 큽니다. 팀 입장에서 단일 플래그십 유효기간은 분기가 아니라 수주로 압축됩니다.
더 깊은 변화는 선정 기준이 「리더보드 1위」에서 「태스크당 총비용」으로 이동하는 것입니다. Grok 4.5는 출력 토큰 효율이 지능 지수 격차를 상쇄할 수 있음을 증명했고, Kimi K3는 셀프호스팅을 현실 옵션으로 만들었으며, Fable 5.1 8월 등장 시 폐쇄 프리미엄은 추가 압박을 받습니다. 폐쇄 API·오픈 셀프호스트·하이브리드 라우팅 3경로가 8월 집중 스트레스 테스트를 받습니다.
엔지니어링 현장의 핵심 운영 리스크는 라우팅 테이블 드리프트입니다. 모델 별칭·폴백 체인·비용 상한 유지보수가 분기 단위에서 주간 인시던트로 바뀔 수 있습니다. 30일 내 3개 조(兆)급 모델 출시 시 Cursor/OpenRouter 기본 라우트 업데이트는 「기다리면 싸진다」와 「지금 계약 잠금」 전략 모두에 리스크를 키웁니다. 48시간 평가 창·모델 별칭 drift 대응·fallback 자동 전환을 사전에 설계하지 않으면 8월 출시 물결은 곧바로 프로덕션 장애로 이어집니다.
8. 5단계 선정 가이드: 모델 카드 공개 전 준비
- 정보 출처 고정: xAI 공식 블로그(x.ai/news), Grok Build 콘솔, 머스크 X 계정 모니터링. 모델 카드 전 예고 스펙을 SLA에 기입 금지.
- 3계층 라우트 구축: 주력(현 Grok 4.5 또는 Kimi K3 API) → 고정밀 검수(Claude/GPT) → 오프라인 폴백(로컬 MLX 양자화 오픈웨이트).
- 토큰 효율 베이스라인: SWE-Bench 동급 태스크로 「출력 토큰/태스크」 기록. 신규 모델은 프로덕션 유사 20태스크 후 기본 라우트 전환.
- 8월 출시 윈도우 플레이북: Grok 4.6, Fable 5.1, K3 파인튜닝판 각각 48시간 평가 창 확보. 출시 당일 프로덕션 전량 전환 금지.
- 컴플라이언스·보안 감사: 미성년·민감 콘텐츠 기업은 xAI 최근 안전 소송을 기술 벤치마크와 병렬 평가.
9. FAQ
Q1: Grok 4.6 정확한 출시일은?
머스크는 X에서 「약 8월 7일」이라 했으나 xAI 공식 확인 없음. 앞당김·연기 가능.
Q2: Grok 4.6과 4.7 차이는?
4.6은 1.5조·SFT/RL 후훈련 중심. 4.7은 2.1조·4.6 전반 우위·추론 속도는 다소 느림·토큰 효율↑.
Q3: Grok 4.6이 Kimi K3나 Claude Fable 5.1보다 강한가?
판단 불가. Grok 4.6 공개 벤치마크 없음, K3는 검증 점수 있음, Fable 5.1은 Anthropic 미확인.
Q4: Grok 4.6 예상 가격은?
미공개. 참고 Grok 4.5 입력 $2/출력 $6(백만 토큰), 차세대는 조정 가능.
Q5: 일반 사용자는 어디서 Grok 4.6을 쓸 수 있나?
Grok 4.5 경로 추정: Grok Build·xAI API·콘솔 선행, 이후 Cursor 등 서드파티 연동.
10. 마무리: 프론티어 API 추적 + Mac 로컬 오픈웨이트 헤지
Windows/Linux 클라우드만으로도 Grok 4.6 동향 추적·API 호출은 가능하지만, 로컬 오픈웨이트 기준선, Cursor/OpenClaw 에이전트 상주, MLX 양자화 Kimi K3 폴백, 통합 메모리 장컨텍스트 분류에서는 Apple Silicon Mac이 운영이 더 매끄럽습니다. 8월 출시 병목에서 희소한 자원은 「최고 점수 모델」이 아니라 48시간 내 실태스크 대조·벤더 락인 없는 감사 가능 연산 환경입니다. 로컬 MLX K3 양자화 대조, 원격 노드 7×24 OpenClaw 다중 모델 라우팅 평가, 통합 메모리 에이전트 장세션 분류가 필요하면 3계층을 권장합니다: 로컬 MLX 일상·오프라인 폴백, 프론티어 폐쇄 API Grok/Claude 고난도 추론, MACGPU 원격 Mac 노드 에이전트 상주·격리 평가 — 「Musk time」과 「출시月」 이중 불확실성에 대한 최선의 헤지입니다.