AI가 설계한 오픈소스 추론 칩 openTPU, 작은 모델에서 80+ tok/s 달성
- FeSens의 오픈소스 TPU 프로젝트 openTPU는 RISC-V 코어에 쓰인 AI 설계 기법을 그대로 적용해 만든 추론 엔진으로, Qwen 3.5·Gemma 4 등 최신 모델 대부분을 실행함. 처음엔 초당 몇 토큰이었으나 재귀 자기개선 루프를 거쳐 작은 모델에서 80+ tok/s까지 올라감.
- 저장소는 1,356 커밋, 188 브랜치, 스타 54개. 최신 커밋은 코어에 멀티플렉서 FASTMUX를 넣은 것으로 Qwen3·LFM2·Qwen3.5 4비트 디코드에서 -0.74/-0.35/-0.86% 변화와 -1,021 LUTs를 기록함.
- Session 18 실험에서 35B layer-major prefill에 layer-ahead 예측기를 붙인 v2가 평균 -0.492초(-3.9%)를 냈고 halt를 0.71초 먼저 관측함. 디코드 힌트는 +0.85%/+1.51%로 손해라 꺼둠.
- 검증은 test_rtl -k ldc 5 passed, tools/memch_test.py func 80 PASS, test_board -k turnarounds 1 passed, Mac에서 test_qual_sh 12 passed로 통과함.
- 하드웨어는 데이터센터에서 퇴역한 FPGA 보드로 약 $300에 취미용으로 인기 있고, 추론 TPU의 관건은 메모리 대역폭임.
Hacker News 의견들
RISC-V CPU 코어 만들 때 쓴 기법을 그대로 openTPU에 썼음. Qwen 3.5, Gemma 4 같은 최신 모델 대부분 돌아가고, 처음엔 초당 몇 토큰이었는데 재귀 개선 루프 돌려서 작은 모델은 80+ tok/s까지 나옴.
경험자가 LLM을 제대로 된 방향으로 밀어주면 얻는 게 진짜 많더라.
이거 $300짜리 FPGA 보드에서 돌아가는 거 아님? 하드웨어 더 아는 사람 있음?
데이터센터에서 퇴역한 보드임, 취미러들 사이에서 인기 많음. 추론용 TPU는 결국 메모리 대역폭 싸움이고, 얼마나 뽑아내면서 로직이랑 면적, 전력을 줄이느냐가 관건임.
소프트웨어 하는 사람의 진짜 바보 같은 질문인데, 왜 랩들은 프런티어 모델을 칩에 안 굽나? 성능이랑 요청당 비용 보면 남는 장사일 것 같은데.
하고 있음. 근데 칩 배포까지 시간이 걸림. OpenAI-Broadcom 딜 찾아봐.
설계에서 테이프아웃, 양산까지 너무 오래 걸림. 걔네 사업 자체가 더 좋은 모델을 갖는 게 전제라서 그렇고, 그렇게 하면 오픈소스로 못 둠.
리드타임이 길어서 나올 때쯤이면 칩이 구식이 될 위험이 큼. 실험적인 프로젝트는 팹 캐파 받기도 어렵고.
Etched라는 스타트업이 딱 이걸 함. 트랜스포머 전용 칩에 베팅한 회사임.
Taalas도 하고 chatjimmy도 함.
MoE 때문에 파라미터 수가 워낙 커서 전체 모델을 칩에 굽는 건 비용이 말이 안 됨. Taalas도 8B llama를 반쪽으로 넣은 수준인데 200W 넘게 먹음. 멀티트릴리언 파라미터를 굽는 건 아직 무리임.
모델 SOTA가 칩 설계랑 양산보다 빨리 움직임. 특정 모델에 몇 년 커밋해야 하는데 그동안 새 SOTA 만드느라 돈은 계속 나감. 그래서 다 GPU 씀. 모델이 바뀌어도 메모리만 있으면 칩은 안 죽음.
추론 병목은 메모리 대역폭인데 이건 모델에 특화한다고 빨라지지 않음. 전력과 면적 대비 이득이 프로그래머빌리티 손실을 못 넘는다고 보는 거임.
모델 반복 속도가 너무 빨라서 ASIC 나올 때쯤이면 이미 한참 앞서 있음. Opus 4.8에서 5.5가 4개월 차이임.
비트코인이 GPU에서 FPGA 거쳐 ASIC으로 갔던 것처럼 FPGA도 중간 단계 아님?
모델의 대부분은 가중치인데, 고밀도 ROM은 진짜진짜 어려움.
2028년에 쓸 모델 하나를 지금 실리콘에 굽겠음? 아니면 6개월 더 지켜보겠음?
모델이 몇 달이면 폐기되는데 왜 감자칩보다 빨리 가치가 사라지는 알고리즘에 굽나. 범용 하드웨어는 새 모델마다 갱신되고, 6년 된 Ampere GPU도 아직 씀.
모델 능력이 너무 빨리 움직여서 하드웨어를 못 만든다는 답이 많은데, openrouter에서 1년 넘은 모델이 매달 수천억 토큰을 처리함. Cerebras 사업 자체가 구형 모델을 빠르게 서빙하는 거고, opus 4.7을 15k tok/s로 쓸 수 있으면 좋음.
모델이랑 트랜스포머 아키텍처를 구분해야 함. 아키텍처를 실리콘에 굽고 1년 뒤 아키텍처가 바뀌면 그 실리콘은 GPUs한테 발리는 쓰레기가 됨.
99.9% 사람들은 LLM이 뭘 할 수 있는지 모름. LLM이 설계한 다음 세대 CPU/GPU 나오면 하드웨어도 지수적으로 좋아질 거고, 칩 개발 도구는 지난 몇 달 사이 몇 세기 분량 발전했음.
어떤 도구가 그렇게 뛰었음? 설계 반복이 빨라지는 건 이해되는데, 개발 주기가 짧아지는 것과 하드웨어 지수 성장은 다른 얘기 아님?
재귀 자기개선이 우릴 다 죽인다더니, 여기 재귀 자기개선이 열일하고 있음.
기술은 항상 다음 세대를 개선해 왔음. 완전 자율이 될 때가 문제인 거지. 모두 결국 같은 고원에 도달함.
결과는 아직 안 봤는데, SOTA 모델이 모델을 돌리는 가속기를 만든 건 작년 12월쯤부터 가능했다고 봄. 다음은 SOTA 모델 자체를 돌릴 만큼 메모리 처리량을 확보하는 것. 더 재밌는 질문은 AI한테 큰 FPGA를 주고 재구성 가능한 패브릭을 활용하는 모델 아키텍처를 설계하게 할 수 있나임.