ESP32S3 여러 대를 묶어 1.58비트 BitNet 언어모델을 돌리는 깃허브 프로젝트 공개
- ESP32S3 보드를 여러 장 묶어 1.58비트(BitNet) 양자화 언어모델을 추론하는 프로젝트가 깃허브에 공개됨. 저장소 Low-Zi-Hong/ESP32s3-LLM-Cluster는 스타 116개, 포크 7개, 커밋 22개를 기록 중임
- 코드는 master_board와 node_board로 역할을 나눠 보드를 연결하고, python_tools와 src/llm에 QAT 스크립트(qat_158.py, qat_better.py)를 두어 1.58비트 학습 후 양자화를 수행하는 구조임
- 토론 참여자는 이 구성이 0.5B 모델을 ESP32 7대에 쪼개 올린 것이라고 정리했고, 압축이 심해 사실상 고급 잡음 발생기라는 평과 그래도 귀엽다는 평이 함께 나옴
- 보드 간 통신은 SPI 데이지체인 방식이라 노드를 늘리는 확장에는 한계가 있다는 지적이 나옴
Hacker News opinions
압축을 너무 세게 해서 결국 고급 LLM 잡음 발생기가 된 느낌이라 아쉽다. 그래도 만든 사람 손끝에서 나온 귀여움은 인정.
Gemma 4는 언제 나오냐. 그러려면 더 큰 ESP가 필요하겠지.
곧 전구 하나하나에 쿠버네티스 돌아가는 AI가 들어갈 판이다. 퓨처라마가 모든 물건에 AI와 성격을 붙여놓은 게 그냥 우화는 아니었던 것 같다. 규모의 경제 때문에 3000년에 사는 컴퓨터는 전부 AI 보조 칩을 달고 나올 듯.
나도 딱 이런 걸 만들어보고 있다. 양자화를 덜 세게 해서 150M 파라미터짜리인데, 이건 진짜 대단하다.
이걸로 워드프로세서 문법 검사나 작은 텍스트 게임 월드 생성이 가능할지 궁금하다. 이런 클러스터가 뭘 할 수 있는지 감이 안 잡힌다.
공유 고맙다. 0.5B LLM을 ESP32 일곱 대로 쪼개 돌린다는 게 신기하다.
이건 bil-lang.org가 노리는 프로젝트 그 자체다. 파이프라인 병렬 처리를 Go로 하려는 건데, TinyGo 백엔드가 나오기 전엔 너무 기대하지는 마라.
Rust로 소형 RISC-V 칩 수백 개를 묶은 대규모 병렬 컴퓨터를 만들면 어떨까 하는 상상을 오래 했다. 경제성이 있느냐는 별개로 실험해볼 만하다고 본다.
경제성은 확실히 없다. LLM 병목은 여전히 메모리 대역폭이고, GPU에 붙박이로 박히지 않은 메모리 버스는 다 느리다. VRAM 두 배짜리 GPU 하나가 절반짜리 두 개보다 항상 훨씬 낫다. GDDR7은 신호가 사이클당 10mm 정도밖에 못 가니까 칩 수백 개로 흩뿌리면 자원을 다 낭비한다.
병렬화 자체보다 통신을 확장하는 게 문제다. 이 프로젝트는 SPI를 데이지체인으로 엮었는데 그 방식은 멀리 못 간다.
저렴한 칩으로 LLM 제대로 돌리는 최저선이 뭐냐. Mac Mini가 바닥인가, mini-ITX 내장 GPU나 라즈베리파이 HAT으로 쓸 AI 칩이 있나.
지난해 알리에서 Ryzen H255에 24GB LPDDR5, 1TB SSD 붙은 미니PC를 부가세와 배송비 다 해서 350유로쯤에 샀다. 실용적인 LLM 박스의 최하위 클래스라고 보면 되고 8B는 잘 돌고 24B까지 간다. 지금 Gemma 4 26B A4B Q5에 MTP 얹어 돌리는데 꽤 느리긴 하다.