PrismML, 삼진 가중치 Bonsai 2 27B 공개: 5.9GB에 9배 압축, 성능 98.2% 유지
- PrismML이 Qwen3.8 27B를 기반으로 삼진 {-1, 0, +1} 가중치와 FP16 그룹 스케일링을 쓴 Bonsai 2 27B를 공개함. 가중치당 1.76비트, 총 5.9GB 크기로 원본보다 9배 이상 작으면서 종합 벤치마크 성능의 98.2%를 유지함
- 종합 점수는 83.9로 원본 Qwen3.8 27B(85.4)보다 1.5점 낮음. 코딩 81.58, 에이전트/툴호출 77.57, 비전 78.59, 수학 96.57, 지시 따르기 82.66이며 262K 토큰 컨텍스트와 텍스트·이미지 입력을 지원하고 Apache 2.0으로 배포됨
- RTX 5090에서 초당 143토큰, M5 Max에서 46.8토큰을 냄. RTX 4090 기준 토큰당 0.714mWh로 풀정밀도 8B 모델보다 에너지 효율이 40% 높다고 밝힘
- GGUF 실행에는 PrismML 자체 llama.cpp 포크가 필요함. 커널은 CUDA, CPU, Vulkan만 제공돼 SYCL이나 XPU 가속은 없음
Hacker News opinions
16GB 그래픽카드 가진 사람들한테는 진짜 반가운 소식임. 3.8 27B가 좋긴 한데 32GB 없으면 못 돌렸는데, 이건 16GB 인텔 B50에 올려볼 생각임. XPU 코어로 가속이 될지는 모르겠지만
나는 오늘 B70에서 해봤는데 쓸 만한 결과가 안 나왔음. Prism의 llama.cpp 포크에 CUDA, CPU, Vulkan 커널만 있고 SYCL이 아예 없더라
애플 실리콘에서도 되냐고? 본문에 M5 Max에서 초당 46.8토큰이라고 적혀 있음. 첫 27B는 아이폰에서도 돌았다고 함
브라우저에서 통째로 돌릴 만큼 작음. Hugging Face webml 스페이스에 올라와 있는데, 이전 모델처럼 이 정도로 잘 돌아간다는 게 신기함. 다만 긴 작업 시키면 흥미로운 방식으로 무너지더라. 가중치 받고 나서 꼭 지워야 함
픽셀 9 프로에서는 크래시 났음. 램 16GB짜리 폰 GPU로는 어차피 무리인 듯
나는 M5 Pro에서 20토큰/초 나왔는데 서버 재시작하니까 44토큰/초가 나옴. 뭐가 잘못 돌아가는 건지 모르겠음. 아무튼 Prism 포크 없이는 GGUF가 안 돌아감
그걸로 자전거 타는 펠리컨 SVG 생성시켰는데 18분 20초 걸렸음. 5.5GB 모델 파일 치고는 꽤 괜찮음
upstream llama.cpp에서 정식 지원해주면 좋겠음. 지금은 포크 빌드를 따로 받아야 해서 번거로움
Tensor API not supported 경고는 llama.cpp 시작 시 matmul2d 커널 컴파일이 실패해서 나온 거임. Metal 텐서 헤더가 언어 버전 4.0을 요구하는데 MTLCompileOptions.languageVersion을 안 넣어서 API가 막혀 있었고, 제안한 수정이 49커밋 뒤에 머지됐음
Qwen 3.8 시리즈 기반 8B v2도 내줬으면 함. 그럼 폰에서 바로 돌릴 수 있는데. 물론 알리바바가 Qwen 3.8 8B를 먼저 내야 함
'9배 작다'는 표현은 계속 보면 짜증남. 1/9 크기라고 해야 맞음. 크기에 1보다 큰 수를 곱해서 더 작아지지는 않음
나는 '9배 작다'가 직관적이라고 봄. 속도 얘기할 때 '9배 빠르다'고 하는 것과 같은 맥락이고, 분수 안 써도 되고 주어가 앞에 남아 있음
Unsloth 양자화랑 비교하면 어떤지 아는 사람 있음?