브라우저에서 초소형 LLM 7종 벤치마크하는 MicroLLM Lab 공개
- WebGPU로 브라우저에서 초소형 LLM 7종을 돌려 속도와 정확도를 재는 MicroLLM Lab이 공개됨. PetitGPT research-v1(125M, 74.4MB)부터 SmolLM2 360M Instruct(215.9MB)까지 전부 Apache-2.0 또는 MIT이며 합계 605.6MB를 브라우저 IndexedDB에 캐시함
- PetitGPT는 GitHub 사용자 yangqi0이 RTX 4090 한 장으로 약 13B 토큰 위치를 사전학습한 124.6M Llama 스타일 디코더(pre-norm RMSNorm, GQA 9/3, RoPE, SwiGLU, tied embeddings)이며, 이 랩은 그 아키텍처와 체크포인트를 WebGPU로 포팅한 것
- 벤치마크는 21개 테스트의 정규식·정확 토큰 검사로 통과율을 재고 지속 디코딩 tok/s를 측정하며, 기기 하드웨어 정보가 담긴 검증 인증서 PNG를 내려받아 X와 LinkedIn에 공유할 수 있음
- 에디터에 적은 JavaScript를 eval()로 실행해 check 함수가 디코딩된 텍스트를 검사하는 방식으로 자체 벤치마크를 쓸 수 있고, 추정치는 이전 tok/s 기준 80 tok/s이며 2016년식 GPU는 M4보다 3~8배 느림
- 해커뉴스 댓글은 지식이 거의 없는 100M급 모델을 어시스턴트로 쓰는 건 무리이고 감정 분석, 텍스트 분류, 개체 추출에 맞다고 지적함. UI가 너무 작고 정보가 과밀하다는 비판도 나옴
Hacker News opinions
SLM은 지식이 거의 없고 추론도 못 해. 감정 분석이나 텍스트 분류, 개체 추출 같은 데 쓰라고 만든 거지 Opus나 Fable이랑 비교할 물건이 아님.
100M짜리 모델한테 어시스턴트처럼 굴라고 하는 건 무리지. 그런 용도가 아예 아님.
PetitGPT에 2+2 물어봤는데 '2+2=4이므로 2+2=4+2'라고 답하더라. 다른 사람은 정답 스크린샷 올렸던데 난 왜 이러나 싶었음.
LLM은 문장을 그럴듯하게 만들 뿐 사실을 보장하지 않는다는 걸 다들 벌써 잊었나. 의미상 맞는 문장이랑 사실 여부는 다른 얘기임.
UI가 진짜 문제임. 글자가 너무 작고 정보가 빽빽해서 실제 인터페이스 나오기까지 한 페이지 넘게 스크롤해야 함. 이렇게 단순한 제품인데 말이지.
제작자 답변 보면 글자 작은 건 일부러 그런 거고 페이지에 600단어뿐이라 바꿀 필요 없다는 입장이더라. HN 프론트페이지에 몇 시간 떠 있으니 할 말은 있음.
ThreeJS TSL로 비슷한 걸 만들었는데 qwen3.5-0.8b가 12 tok/s 나오고 출력도 꽤 말이 됐음. 로딩은 오래 걸림.
MiniCPM5-1B 추가를 추천함. 1B인데 놀랍도록 말이 되고, 픽셀9 CPU에서 33 tok/s 나옴. GPU는 26 tok/s인데 프리필은 500 가까이 뜀.
Firefox에서 GPUShaderStage is not defined 뜨면서 죽던데 브라우저 버전이나 GPU 문제인가.
아무것도 안 된다는 사람 있던데, 제작자는 Windows와 Mac, iPhone에 Chrome과 Firefox, Edge, Safari 다 돌려봤다고 답했음. 지금 서버가 1기가비트 무제한 회선이라 가중치 600MB를 몇 초마다 뿌린다고.
SmolLM2 360M한테 캘리포니아 인구 물었더니 1억 5300만이라 하고 바로 다음 문장에서 3억 2500만이라 하더라. GPU 없이도 엄청 빠르긴 했음.
브라우저 표준으로 오픈 웨이트 모델을 온디바이스에서 돌리는 Web Models API라는 제안을 만들고 있음. 의견 궁금하다고 올렸더니 반응 좋았음.
AI가 만든 티 나는 밀도 높은 UI, 그 Claude 스타일이지. 요즘 소프트웨어가 다 이렇게 가는 것 같음.
Claude Fable 5.1이랑 비교해봤더니 자기가 광대 이야기라고 답하더라. 최소한 자기 인식은 있는 셈임.