OPENROUTER 7월 랭킹
XIAOMI_
TOP1_
CHINA_46%.
7월 막바지, 몇 달 전 기준으로 LLM을 고르고 있다면 이미 뒤처진 상태일 수 있습니다.핵심 문제: OpenRouter 랭킹은 벤치마크가 아니라 실제 유료 토큰 소비량입니다. 1위≠최고 품질.결론: 7월 25일 기준 중국 벤더 합산 46%, 샤오미 Mimo V2.5 일 1.4T 토큰 1위. 시장은 「저가 대량 처리」와 「폐쇄형 고난도 태스크」의 이중구조로 분화 중입니다.구성: Top12 → 벤더 점유율 → 사용량≠품질 → Agent 앱 → 가격 → 8월 전망 → 5단계 라우팅 → Mac 3단계 아키텍처.
1. 문제 정의: 7월 랭킹이 라우팅 전략을 뒤흔드는 이유
1)사용량≠품질: 저가 모델이 고트래픽 앱 뒤에서 랭킹을 끌어올리지만, 복잡 추론에서는 폐쇄형 플래그십이 지출 점유율을 유지합니다. 2)월간 1위 빈번 교체: DeepSeek 벤더 점유율은 가장 안정적(약 16%–18%)이나, 모델 1위는 MiniMax M2.5 → MiMo-V2-Pro → 현 Mimo V2.5로 교체됩니다. 3)숨은 시장: 롤플레이/컴패니언 앱이 OSS 모델 트래픽 상당 부분을 차지하나 엔터프라이즈 보도에서는 거의 다루지 않습니다. 4)최대 35배 가격 차: DeepSeek V4 Flash 입력 약 $0.05–0.14/M vs GPT-5.5 약 $5/M. 5)보안이 새 변수: OpenAI 샌드박스 탈출 이후 벤더 보안 기록이 선정 기준에 필수 편입됩니다.
2. 7월 모델 토큰 사용량 Top 12 (2026-07-25 기준)
| 순위 | 모델 | 벤더 | 일일 토큰 | 최근 30일 누적 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 샤오미 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 텐센트 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B (무료) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智譜 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 階躍星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 월之暗面 | 157.6B | 1.6T (신규) |
| 10 | Ling 3.0 Flash | Ant InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
상위 10위 중 중국 벤더 모델 7석. 미국 진영은 Nemotron, Claude, Gemini가 방어선 유지. Kimi K3 급등이 7월 최대 관심 변수.
3. 벤더 점유율: 중국 합산 약 46%, 1년 전 2% 미만
| 벤더 | 지역 | 토큰 점유율 (추정) |
|---|---|---|
| DeepSeek | 🇨🇳 중국 | 16%–18% (대부분 1위) |
| 샤오미 | 🇨🇳 중국 | 8%–18% (Mimo V2.5 급등, 변동 최대) |
| Anthropic | 🇺🇸 미국 | 10%–15% |
| 텐센트 | 🇨🇳 중국 | 8%–13% |
| 🇺🇸 미국 | 8%–13% | |
| 智譜 Z.ai | 🇨🇳 중국 | 4%–7% |
| OpenAI | 🇺🇸 미국 | 6%–8% |
중국 벤더 합산 약 46% (1년 전 <2%). 미국 3대 합산 약 30%–36% (1년 전 약 70%). 지난 12개월 가장 가파른 점유율 이동 곡선 중 하나.
4. 랭킹 이면: 고사용량≠고품질, 이중구조 시장 확립
태스크 유형별 지출 금액 점유율(토큰량 아님): 일반 대화 35.7%, Agent 워크플로 30.4%, 코드 26.5%, 데이터 처리 7.5%. 그러나 「분류/복잡 추론」 고난도 영역에서는 Claude Sonnet 4.6·Claude Opus 4.7 각 13.5% 공동 1위, GPT-5.5 11.6% 3위. 총량 랭킹 저가 OSS 모델은 여기서 거의 보이지 않습니다.
7월 24일 Anthropic Claude Opus 5 출시: FrontierBench v0.1 43.3% (GPT-5.6 Sol 37.5% 역전), 가격 Opus급 $5/$25 per M 유지.
| 모델 | 입력/M | 출력/M | 포지션 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 가성비 1위, Agentic Coding |
| MiniMax M3 | $0.10 | $1.21 | 장문맥 멀티모달 예산형 |
| GLM 5.2 | $0.45 | $3.31 | OSS 내 Opus급 플래닝 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB OSS 가중치 |
| Claude Opus 5 | $5 (고속 $10) | $25 (고속 $50) | 폐쇄형 플래그십, 7월 최고 벤치 |
5. 앱 레이어: 코딩 Agent 독주, 보이지 않는 절반은 롤플레이
| 순위 | 앱 | 유형 | 점유율 (추정) |
|---|---|---|---|
| 1 | Hermes Agent | 개인 에이전트/CLI Agent | ~45% |
| 2 | Kilo Code | 코딩 Agent | ~13% |
| 3 | OpenClaw | 범용 Agent | ~9% |
| 4 | Claude Code | 코딩 Agent | ~6% |
| 5 | Descript | 콘텐츠 제작 | ~4.5% |
| 7 | Lemonade | 컴패니언/게임 | ~2.1% (신규) |
| 8 | ISEKAI ZERO | 롤플레이 | ~2.0% (신규) |
| 10 | Cline | 코딩 Agent (IDE 확장) | ~1.7% |
Cline → Roo Code → Kilo Code 동일 코드 계보 3차 포크. 「손자」 Kilo Code가 조상 트래픽을 역전. OpenRouter × a16z 보고서: 창작 롤플레이가 OSS 모델 총 사용량 50% 이상.
6. 8월 트렌드 전망: 주목할 5가지 시그널
- 중국 OSS 모델 합산 점유율 50% 돌파 가능 — 미국 벤더 적극적 가격 인하 없이는.
- 월간 챔피언 교체 지속 — 샤오미, DeepSeek, 텐센트, 智譜, MiniMax, 월之暗面 가격전·반복 속도 유지.
- Anthropic 저가형 모델 출시 가능 — Opus 5는 2개월 내 4번째 플래그십.
- Kimi K3 1.4TB 가중치 2–4주 내 커뮤니티 양자화판 등장 가능 — 중소팀 본격 도입은 그 이후.
- 보안·컴플라이언스가 선정 변수로 — OpenAI 샌드박스 탈출, 미국 AI 킬스위치 법안, 백악관 사전심사 프레임워크.
7. 5단계 실행: 태스크 유형별 계층 라우팅
- 체인 분해·매핑: 잡담/창작/롤플레이 → DeepSeek V4 Flash / Mimo V2.5. 분류/복잡 추론/고위험 Agent → Claude Opus 5 / GPT-5.6.
- 비용 상한 설정: 폐쇄형 플래그십 일일 토큰 예산, 초과 시 GLM 5.2 또는 DeepSeek Flash 자동 다운그레이드.
- 주간 openrouter.ai/rankings 대조: 랭킹 일일 변동. 급등 모델은 프리뷰 가격 종료와 연동되는 경우 많음.
- 오픈웨이트 로컬 백업: GLM 5.2 / Kimi K3를 Mac MLX로 오프라인 대기. API 제한·컴플라이언스 전환 대응.
- 20태스크 검증 세트: 동일 태스크를 저가·플래그십 모델 각 실행, 통과율·단가 기록 후 팀 SOP 반영.
8. 심층 인사이트: capability와 popularity의 분기
7월 랭킹 핵심 한 줄: 능력(capability)과 인기(popularity)가 분기 중. 중국 OSS는 가격으로 트래픽 절반 확보 — DeepSeek V4 Flash vs GPT-5.5 약 35배 가격 차. 일상 태스크 80–90%가 「충분」하면 청구 데이터가 답합니다. 미국 폐쇄형 플래그십은 고난도 태스크 가격 결정력 유지: Claude Opus 5 FrontierBench 43.3%, Anthropic 상대적 깨끗한 보안 기록이 프리미엄 근거.
앱 레이어: Hermes Agent 앱 토큰 45% 독주. 코딩 Agent 패밀리(Kilo Code, OpenClaw, Claude Code, Cline)가 랭킹 대부분 점유. Mac 개발자는 「모델」뿐 아니라 「앱 워크로드」별 라우팅 필요 — Cursor 보완 체인, OpenClaw Agent 체인, Hermes 자기반복 체인마다 최적 모델 ID가 다릅니다.
한국 팀 참고: OpenRouter 평균 지연 약 180–250ms, 국내 세금계산서 미제공. 프로덕션은 국내 규정 준수 API 프록시 검토 권장. OpenRouter는 기술 검증 샌드박스·멀티모델 A/B에 적합.
9. 결론: 계층 라우팅 + Mac 통합 메모리 3단계 아키텍처
Windows/Linux 클라우드에서도 OpenRouter API 호출 가능하나, 로컬 MLX 추론, Cursor 툴체인 연동, 7×24 Agent 상주, 그래픽 워크플로에서는 Apple Silicon Mac이 우위. 「DeepSeek 50센트 vs Claude 10달러/시」 비용 차에 흔들리면서 예측 가능한 로컬 백업·원격 피크 분산이 필요하다면 3단계 권장: 로컬 MLX로 GLM 5.2 / Kimi K3 일상 처리, OpenRouter API로 Opus 5·DeepSeek Flash 시나리오별 라우팅, MACGPU 원격 Mac 노드로 야간 배치 Agent·통합 메모리 부담 장문맥 태스크 처리 — 8월 모델 물결 전, 통제 가능한 연산이 최선의 헤지.