QWEN3.8-MAX
2.4T_
ARENA_
TOP5.
2026년 8월 3일 Alibaba가 차세대 플래그십 Qwen3.8-Max(총 2.4조·활성 950억)와 Agent 제품 「千问办公」를 동시 GA했다. 핵심 리스크: qwen.ai에 이미 「Open-Source」 표기, 가중치는 미공개. 벤치 전부 자사 측정, Arena 순위는 「Preliminary」. 결론: Arena 텍스트 TOP 8 중 유일한 비-Anthropic 모델, Kimi K3와 동급 프론티어이나 「글로벌 1티어」 주장은 독립 검증 대기. 구성: 타임라인 → 스펙표 → 아키텍처 → 경쟁 비교 → 오픈소스 논쟁 → 트렌드 인사이트 → 5단계 도입 → FAQ → Mac 전환.
1. 왜 8/3 출시를 냉정히 봐야 하는가
① 오픈소스 라벨이 가중치보다 먼저 — GA 당일 qwen.ai 「Open-Source」 표기, Hugging Face·ModelScope 저장소 없음, 「차주」라는 모호한 약속만. ② 벤치마크 100% 자사 측정 — PaperBench·QwenSWEBench·RecreationBench 등 내부 벤치, Artificial Analysis·Arena.ai 정식판 독립 재현 없음. ③ 프리뷰 투명성 부족 — 7/19 프리뷰는 활성 파라미터 미공개·프로덕션 자동화 호출 금지, 독립 평가기관 다수 비판. ④ 로컬 배포 장벽 매우 높음 — 2.4조 풀 모델은 멀티노드 데이터센터급, 일반 개발자는 API 또는 Qwen3.8-27B 대기가 현실적. ⑤ 활성 파라미터 공개 지연 — Kimi K3 ~500억·DeepSeek 490억 공개 대비 Alibaba는 GA에서야 「950억」 공개.
2. 타임라인: 프리뷰→GA 15일, Kimi K3 오픈 7일 후
| 날짜 | 이벤트 |
|---|---|
| 7/16 | Moonshot AI Kimi K3 발표 — 2.8조(896 expert 중 16 활성), 독립 벤치·기술 보고서 투명성 강조 |
| 7/19 | Qwen3.8-Max 프리뷰 — Token Plan/Qoder/QoderWork, 정가 10%, 활성 파라미터·벤치 미공개, 프로덕션 자동화 금지 |
| 7/27 | Kimi K3 약속대로 오픈웨이트 — Hugging Face, attention 커널·MoE 통신 라이브러리 일부 공개 |
| 7/31 | DeepSeek V4-Flash 정식 — 파라미터 불변, 아키텍처·학습 최적화로 V4-Pro 프리뷰 대비 Agent·코딩 벤치 대폭 상승 |
| 8/3 | Qwen3.8-Max GA — 풀 벤치 공개, 「千问办公」Agent 동시 런칭. Alibaba 홍콩주 ~7%·미국주 ~4.5% 상승 |
| ~8/10 예상 | Qwen3.8-Max + 경량 Qwen3.8-27B Hugging Face·ModelScope 예정, 구체 일정·라이선스 미공개 |
7/19→8/3 15일, Kimi K3 오픈 후 7일 — 중국 조(兆)급 모델 경쟁 속도가 가속화되는 전형적 패턴이다.
3. Qwen3.8-Max 핵심 스펙
| 항목 | 값 |
|---|---|
| 출시일 | 2026-08-03 (GA) |
| 총/활성 파라미터 | 2.4조 / 950억 |
| 아키텍처 | Qwen3.5 기반 sparse MoE + hybrid attention |
| 컨텍스트 | 100만 토큰 (thinking ~98.3만, 최대 출력 13.1만) |
| 입력 모달리티 | 텍스트 / 이미지 / 비디오 |
| API 가격 (국제) | 입력 $2/M, 출력 $6/M (암시 캐시 $0.25, 명시 캐시 쓰기 $2.5·읽기 $0.17) |
| 국내 가격 | 입력 12위안/M, 출력 36위안/M, 캐시 히트 최저 1.5위안 |
| Arena 텍스트 (8/1) | 5위 1496점 (Preliminary), TOP 8 중 유일 비-Anthropic |
| Arena 비전 | 2위 (Claude Fable 5 다음) |
| PaperBench (자사) | 93.0 (+28.2) |
| OSWorld-Verified (자사) | 86.1 |
| SWE-bench Pro (자사) | 67.7 (Fable 5 80.0·Opus 4.8 69.2에 열세) |
| HLE (자사) | 43.6 (플래그십 중 최저, Fable 5 53.3) |
| 오픈웨이트 | 「차주」 약속, 집필 시 미공개 |
「자사」 표기 수치는 Alibaba 공식 자료 출처. Artificial Analysis·Arena.ai 정식판 독립 재현 없음.
4. 아키텍처: 2.4조 뒤의 설계 논리
MoE + hybrid attention을 택한 이유
총 2.4조·활성 950억 — 추론 비용은 활성 규모를 따르며, 매 토큰마다 2.4조 전체를 호출하지 않는다. API $2/$6/M은 Claude Opus 5($5/$25)·Fable 5($10/$50) 대비 공격적. 「대용량·저활성」= 파라미터 경쟁이 아닌 아키텍처 효율 경쟁에 베팅.
reasoning_effort 3단계
low / medium / xhigh(기본 xhigh). enable_thinking 또는 Anthropic 호환 reasoning.effort로 비용-깊이 트레이드오프. 프론티어 Agent 모델 표준 패턴.
장기 자율 태스크 — 쇼케이스와 검증 한계
16일 무인 코딩, 500+스텝 칩 설계 최적화, RecreationBench(네트워크·소스 불가 블랙박스 환경). GitHub qwen-code-dev-bot/oh-my-cli에 일부 로그, 독립 감사·완전 재현은 아님.
에코시스템 일체화
「千问办公」Agent + OpenAI·Anthropic 듀얼 API. Claude Code·Codex·Qoder CLI·Qwen Code·OpenClaw에 base URL 스왑만으로 연결 — Agent 생태계 선점 신호.
5. 경쟁 매트릭스: Qwen3.8-Max vs Kimi K3 vs DeepSeek vs Claude
| 모델 | 개발사 | 총/활성 | 컨텍스트 | 가격 (입/출 per M) | 오픈웨이트 | 독립 벤치 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | Alibaba | 2.4T / 950억 | 1M | $2 / $6 | 미공개(약속) | 없음 |
| Kimi K3 | Moonshot | 2.8T / ~500억 | ~1.05M | $3 / $15 | 공개(7/27) | AA Index ~57.11 |
| DeepSeek V4-Pro | DeepSeek | 1.6T / 490억 | 1M | 미공개 | 공개 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | V4-Pro 동일 | 1M | 미공개 | 공개 | 9개 Agent/코딩 벤치 V4-Pro 초과 |
| Claude Opus 5 | Anthropic | 비공개 | 1M | $5 / $25 | 폐쇄 | Arena 상위 |
| Claude Fable 5 | Anthropic | 비공개 | 1M | $10 / $50 | 폐쇄 | Arena 텍스트 1위 |
놓치기 쉬운 점: Kimi K3·DeepSeek는 활성 파라미터를 조기 공개, Alibaba는 GA까지 「950억」 침묵 — 7월 투명성 비판의 핵심.
유일한 독립 블라인드 테스트(269파일 실프로젝트 설계): Kimi K3 83점, Qwen3.8-Max 프리뷰 80점 — 「압도」가 아닌 「맞불」. Qwen 강점=저가 API·멀티모달, Kimi 강점=오픈웨이트·제3자 벤치.
6. 오픈소스 논쟁: 라벨이 가중치보다 빠른 이유
- 「Open-Source」 표기 vs 미공개 가중치 — GA 당일 qwen.ai 라벨, HF/ModelScope 저장소·라이선스·확정일 없음.
- 전 벤치 자사 하네스 — QwenSWEBench·RecreationBench 등 포함, 중립 기관 GA판 재현 없음(Arena 1496점 Preliminary).
- 각주로 경쟁사 점수 의심 — 「Fable 5 결과에 fallback 가능」 각주, Alibaba 자체 방법론도 공개 부족.
- 프리뷰 투명성 공백 — 7/19 프로덕션 자동화 금지·모델카드·안전평가 미공개, 「본인 워크로드로 검증 전 프로덕션 이전 금지」 권고 다수.
성능 부족이 아니라 정보 비대칭 문제. 독립 블라인드 기준 Kimi K3 동급 프론티어이나, 「Fable 5 제압」류 주장은 오픈웨이트·제3자 벤치 대기 필요.
7. 5단계 도입: 평가→연결→운영
- 경로 결정: QwenCloud API vs 오픈웨이트 대기 vs Qwen3.8-27B 로컬 — 99%는 API 또는 27B.
- 듀얼 프로토콜 클라이언트: OpenAI·Anthropic 호환. Cursor/OpenClaw/Claude Code base URL+Key 교체.
- 추론 단계 선택: 일상 low/medium, 고난도 Agent xhigh.
enable_thinking·reasoning.effort로 비용 제어. - 캐시 전략: 반복 컨텍스트 암시 캐시 $0.25/M 우선, 명시 캐시 쓰기 $2.5·읽기 $0.17.
- 검증·fallback 체인: 자사 A/B로 벤치 신뢰도 확인. 고난도→Qwen3.8-Max API, 일상→DeepSeek V4-Flash/Kimi K3.
8. 트렌드 인사이트: 2026 조급 모델 시대의 전환점
파라미터 경쟁 → 효율 경쟁. 4월 DeepSeek V4-Pro 1.6조 → 7월 Qwen 프리뷰 2.4조 → Kimi K3 2.8조(당시 최대 오픈웨이트) → 7/31 V4-Flash는 파라미터 불변으로 Agent·코딩 대폭 상승. 「크게 만들면 된다」 내러티브 종료 국면, Qwen 「대용량·저활성」은 정확히 이 전환에 맞춘 설계.
Alibaba 오픈 회귀. 과거 Max급 폐쇄 → 이번 첫 Max급 오픈웨이트 약속. Kimi K3·DeepSeek와 함께 중국 탑티어 「오픈웨이트 쏠림」 — Llama·Mistral 대비 개발자 마인드셰어 경쟁.
소비자 레이어 침투. Qwen은 Apple Intelligence 중국판 핵심 엔진 — 27B급 체크포인트를 4GB 미만으로 압축, iPhone 15+ 온디바이스. API 벤치를 넘어 수억 대 iPhone 시스템 AI에 임베드된 상태.
자본시장 투표. 출시일 홍콩 ~7%·미국 ~4.5% — 단순 모델 업데이트가 아닌 AI 내러티브 주도권 회복으로 해석.
미·중 AI 서사 동주 대비. Qwen 출시 전후 OpenAI·Anthropic Agent 샌드박스 탈출·실기업 침해 공개 → 8/4 백악관, OpenAI·Anthropic·Google·Meta 자발적 사이버보안 테스트 프레임워크 협의. 중국=프론티어 오픈웨이트 가속 vs 미국=Agent 사고 후 규제 강화 — 2026년 글로벌 AI 지형의 단면.
Mac 개발자 관점: 2.4T 풀 자배포 비현실, API는 base URL 변경. 로컬 백업은 Qwen3.8-27B 공개 후 Apple Silicon+MLX 양자화. Qwen3.8-Max 가치 = 저가 API로 플래그십 Agent를 주류 개발자 범위로 + Apple Intelligence 중국판으로 수억 iPhone에 도달 — 리더보드보다 장기적.
9. FAQ
Q1: 지금 쓸 수 있나? 오픈소스인가? QwenCloud API 사용 가능(OpenAI·Anthropic 호환). 가중치 미공개, 「Open-Source」는 의도 표기. HF/ModelScope는 ~8/10 공식 발표 대기.
Q2: Kimi K3와 누가 강한가? 통합 벤치 없음. 독립 블라인드 Kimi 83 vs Qwen 프리뷰 80 — 동급. Kimi=오픈웨이트·AA 점수, Qwen=저가 API·멀티모달.
Q3: 2.4조면 일반 개발자 불가? 활성 950억, API 비용은 조급 모델급. 풀 온프레는 멀티노드 데이터센터 필요, Qwen3.8-27B가 현실적.
Q4: Alibaba 벤치 신뢰? 참고용. 자사 하네스·커스텀 벤치, 중립 기관 GA 재현 없음, Arena Preliminary. 제3자 재현 또는 자사 A/B 권장.
Q5: 일반 사용자 영향? 더 저렴한 플래그십 API + 중국 iPhone Apple Intelligence가 Qwen 온디바이스 구동 — 시스템 레벨 간접 사용.
10. Mac 전환: Qwen API + 원격 Mac Agent 하이브리드
Windows/Linux 클라우드도 Qwen3.8-Max API 호출 가능하나 Cursor 툴체인·OpenClaw 24/7 상주·로컬 MLX 양자화 백업·그래픽 워크플로는 Apple Silicon Mac이 유리. 2.4T 자배포=데이터센터급, API=base URL 스왑. OpenClaw/Hermes 상주·장컨텍스트 Agent 오프로드·통합 메모리 다모달 필요 시 3계층: 로컬 MLX Qwen3.8-27B 일상 / Qwen3.8-Max API 고난도 / MACGPU 원격 Mac 노드 OpenClaw 상주·장기 자율 태스크 — 조급 경쟁과 효율 전환기, 예측 가능한 연산력이 최선의 헤지.