Qwen 3.8 27B용 ShapeLearn GGUF 5종 공개, GPU-5가 BF16 대비 99.63% 정확도로 13.1GB VRAM에 90.42 TPS
- ByteShape가 Qwen 3.8 27B용 정식 ShapeLearn GGUF 5종을 공개했고, 최상위 GPU-5(IQ4_XS-3.84bpw)가 BF16 집계 점수의 99.63%를 13.1GB VRAM에서 90.42 TPS로 달성함
- GPU-5가 VRAM에 안 들어가면 GPU-4(IQ3_S-3.23bpw)가 11.0GB로 98.72%에 도달하며 GPU-5보다 작고 빠름. ByteShape의 기본 권장은 GPU-5, 컨텍스트가 문제면 GPU-4
- 추측 디코딩은 MTP 드래프트 헤드가 모든 GGUF에 포함돼 이미지 입력까지 되고, DFlash2는 1.1GB 별도 드래프트 모델과 llama.cpp b10658 이상이 필요하며 텍스트 전용이지만 보통 더 빠름
- 8월 18일 급하게 낸 ShapeLearn-Lite도 자체 KLD 순위보다 선전해 Lite 대 Unsloth Dynamic v3 비교에서 6종 중 3종이 frontier에 올랐고, 여기서 frontier는 '더 빠르면서 더 정확한 모델이 없는' 조합을 뜻함
- 비교 대상은 AtomicChat, Bartowski, ISTA-DASLab, Unsloth Dynamic v3이며 Bartowski 최신 모델은 테스트 이후 공개돼 빠졌고, dense 모델이라 MoE보다 BPW 하락이 TPS 상승으로 직결됨
Hacker News opinions
내가 직접 테스트해봤는데 Unsloth 모델보다 빠르지 않더라. 참고로 난 AMD GPU에서 Vulkan 씀.
의미 있게 느린 게 아니라는 게 의외임. Vulkan이나 ROCm 경로에는 걔네가 쓰는 양자화 최적화 버전 몇 개가 빠져 있음.
7900 XTX에 Vulkan인데 나도 더 빠르지 않았음. Nvidia에선 다를 수 있는데 내 한계는 메모리 대역폭인 듯. 7900 XTX가 3090이랑 대역폭이 비슷하고 Unsloth로 이미 60 t/s 나왔음. 4090, 5090은 대역폭이 훨씬 높으니 걔네 최적화가 더 먹힐 듯.
오타 난 글을 좋아하게 된다는 게 좀 이상하긴 한데, AI가 안 쓴 글이 확실해서 좋음. 요즘 오타가 그립고 정겨움.
Aged like milk, 이 링크 봐라. 댓글 보면 bonsei가 긴 작업에서 무너진다더라.
아님. 여기 IQ4_XS가 제일 큰 양자화인데도 Bonsai가 더 큰 양자화를 안 내니까 여전히 쓸 만함. 삼진(ternary)에서 왜 멈추는지 모르겠는데 사진(quaternary) 버전을 내면 이길 텐데.
그래프 붙은 이 사이트 진짜 보물임. VRAM에 맞는 더 빠른 모델, 그러니까 더 작은 양자화 찾는 데 큰 도움 됐음.
GPU-5가 뭐임?