Qwen, 2.4T 파라미터 오픈웨이트 모델 Qwen3.8 공개, Opus 4.8·Fable 5급 벤치마크 성능 주장
- Qwen3.8-2.4T-A95B가 공개됐고 총 파라미터는 2.4T개, 실제 활성화되는 파라미터는 95B개로 512개 전문가 중 라우팅 10개 + 공유 1개를 사용하는 MoE 구조임
- 벤치마크에서 Terminal Bench 2.1 86.6, PaperBench 93.0, WideSearch 81.9 등을 기록하며 자체적으로 Opus 4.8과 Fable 5 사이 성능이라고 주장함
- bf16 전체 모델 용량은 약 $4.9TB이고 fp8은 $2.5TB, 커뮤니티의 unsloth 1bit 양자화판은 $397GB까지 축소됨
- 오픈웨이트판은 상용판 Qwen3.8-Max와 달리 비전 입력이 빠졌고 컨텍스트도 262,144 토큰으로 제한되며, 상용판은 1M 컨텍스트와 비전 입력을 지원함
- 새 파라미터
reasoning_effort로 xhigh/medium/low 3단계 추론 깊이를 조절할 수 있고,preserve_thinking이 기본 활성화돼 과거 메시지의 추론 맥락을 유지함
Hacker News opinions
이거 완전 5TB짜리 모델이네
모델 카드 보니까 너무 좋아보여서 믿기지가 않음
unsloth 1bit 양자화판이 397GB인데, 이 정도면 개인이 살 수 있는 머신에 Opus 4.5급 성능을 넣는 거임. bf16 풀버전은 4.9TB. 근데 오픈소스판은 비전 빠지고 컨텍스트도 250k로 캡됨
1bit 양자화를 풀 모델이랑 비교하는 건 좀 오도하는 거지. 맥 여러 대나 Strix Halo/DGX Spark 몇 개로 1bit 돌리는 건 현실적으로 별로임, 하드웨어에 맞는 사이즈 쓰는 게 맞음
Opus 4.5급 성능은 deepseek-v4-flash-0731로도 나오는데 그건 훨씬 작음. RTX pro 6000 블랙웰 2장이면 돌리고 4장이면 여유롭게 돌아감
양자화 로직이 이해가 안 됨. 100GB 메모리 있으면 어떤 모델 어떤 양자화로 써야 하는지 기준을 모르겠음
이게 파라미터 수 기준으로 최대 오픈웨이트 모델 아닌가?
아니야, Kimi k3가 2.8T-A100B라서 그게 더 큼. 이건 2.4T인데 bf16이라 5TB, fp8이면 2.5TB. Kimi k3는 QAT 4bit로 나와서 1.5TB밖에 안 됨
이거 사실상 Kimi k3 라이벌인데, bf16/fp8로만 내놔서 서빙하기 더 까다로움. 라이센스는 연매출 5000만불 이하면 자유롭게 쓸 수 있고 그 이상이면 코딩/생산성 에이전트 서비스에 제한 걸림
이제 중국 모델들도 raw 성능은 프론티어 급이니까 다음엔 reasoning efficiency 개선하는 걸 보고 싶음
reasoning_effort 파라미터 새로 생긴 거 맞음. xhigh/medium/low로 추론 깊이 조절 가능하고 preserve_thinking도 기본 켜져 있음. 근데 내가 하는 OCR 작업에서는 여전히 프롬프트 튜닝이 많이 필요하더라
오픈웨이트판에 비전이랑 1M 컨텍스트가 없다는 게 아쉬움
DSV4 Flash나 GLM-5.2처럼 원래 비전 없던 모델에 비전 붙이는 데 성공한 사례들 있어서, 이미 비전 트레이닝된 이 모델도 비슷하게 될 것 같음
Qwen3.5는 진짜 풀기능으로 오픈이었는데, 3.8은 비전 빠지고 씽킹 모드 nerf되고 컨텍스트도 짧아져서 좀 의미 없어 보임
DeepSeek V4-Pro-0813(1.6T-A49B) 벤치마크도 방금 나왔는데 Fable 5급이라고 함
RTX 5090에 64GB 램 있는데 이런 대형 모델은 로컬에서 못 돌리는 거 아닌가 싶은데, 30B 이하 모델 쓰는 게 맞고 곧 Qwen3.8-27B도 나온다고 함