DeepGrove, 아이폰서 120tok/s 내는 200억 파라미터 삼진법 MoE 모델 Maple-Preview 공개
- DeepGrove가 오픈소스 삼진법(ternary) 가중치 추론 LLM Maple-Preview(20B-A1B MoE)를 공개함, Mac mini M4에서 218tok/s, 아이폰에서 127tok/s로 동작함
- IMO 2024 문제 1을 MacBook Pro(M5 Pro)에서 초당 281.5토큰 속도로 만점(7/7) 풀이함
- 동일 프롬프트로 비교 시 1비트 Bonsai 27B(Qwen3.6 27B 기반)보다 약 13배 빠름(Maple 127tok/s vs Bonsai 9.6tok/s)
- 체크포인트 용량은 5.31GB, 컨텍스트 길이는 131,072토큰이며 하이브리드 슬라이딩윈도우+글로벌 어텐션으로 KV 캐시 증가를 억제함
- 벤치마크 평균 점수는 78.7%로 LCBv6 75.1, AIME26 87.5, HMMT26 78.8, GPQA-D 73.5를 기록했고 활성 파라미터는 1.49B에 불과함
Hacker News 의견들
써보니 재밌긴 한데 bonsai 삼진법 모델처럼 지식 관련 환각이 심하게 나타남, 온라인 챗의 검색 도구가 이를 어느 정도 가려주는 느낌임
도구 접근만 있으면 모델 자체 지식은 얼마나 대충해도 되는 걸까 싶음, 즉석에서 당근케이크 레시피 좀 틀려도 구글 검색 하나면 훨씬 정확한 답을 줄 수 있잖아
이 페이지 댓글 5개 중 3개가 카르마 0~1인 계정의 무비판적 칭찬임, 좀 수상함
온라인으로 써봤는데 속도랑 퀄리티 대비는 인상적이더라, 큰 프론티어 모델을 대체하진 못하겠지만 지켜볼 가치는 있음
작은 LLM들이 틀린 걸 너무 자신 있게 말하는 게 너무 싫음, schlong 어원 물어보니 완전히 틀린 답을 아주 확신에 차서 내놓던데 qwen 3.6 35B A3B는 완벽하게 답함
작은 모델한테 자체 지식으로 답하라고 요구하는 게 이상한 거 아님? 그냥 인터넷 검색시키고 답하게 하면 되지 않나
Qwen 3.5 35B-A3B랑 비교한 벤치마크 테이블이 좀 이상함, 이미 Qwen 3.6 35B-A3B가 나온 지 꽤 됐고 훨씬 나은데
메인 비교 대상은 1비트 Bonsai 27B(Qwen3.6 27B)인데 그게 어차피 A3B보다 나음
작은 모델은 툴콜링이 잘 되는 게 진짜 중요함, 사실 암기가 안 되고 자기가 모른다는 것도 잘 모르니까 툴 라우팅이나 백업용 빠른 모델로 쓰면 딱임
이거 완전 공감함, 애플 온디바이스 모델도 그런 식임, 의미 파악은 잘하는데 기계적인 지시(날짜 포맷, 대문자 변환 같은)는 못 지킴, 결국 기계적인 부분은 모델 밖으로 빼고 결정론적 코드로 처리하니까 해결됨
기존 풀프리시전 모델을 저비트로 변환하는 방식이 근본적으로 틀렸다는 주장이 흥미로움, 처음부터 삼진법으로 학습한 모델을 보니 기대됨
제목이 아이폰이라고 해놓고 본문 보면 Mac mini M4 얘기임, AI 회사 사이트들 특유의 있어보이는 말투('release' 대신 'introduce' 쓰는 거)도 웃김
애플이 그냥 바보짓만 안 하면 이런 작은 모델 만드는 회사들이 알아서 좋은 모델 갖다 바칠 것 같음