AI가 설계한 오픈소스 추론 칩 openTPU, 작은 모델에서 80+ tok/s 달성

AI가 설계한 오픈소스 추론 칩 openTPU, 작은 모델에서 80+ tok/s 달성

  • FeSens의 오픈소스 TPU 프로젝트 openTPU는 RISC-V 코어에 쓰인 AI 설계 기법을 그대로 적용해 만든 추론 엔진으로, Qwen 3.5·Gemma 4 등 최신 모델 대부분을 실행함. 처음엔 초당 몇 토큰이었으나 재귀 자기개선 루프를 거쳐 작은 모델에서 80+ tok/s까지 올라감.
  • 저장소는 1,356 커밋, 188 브랜치, 스타 54개. 최신 커밋은 코어에 멀티플렉서 FASTMUX를 넣은 것으로 Qwen3·LFM2·Qwen3.5 4비트 디코드에서 -0.74/-0.35/-0.86% 변화와 -1,021 LUTs를 기록함.
  • Session 18 실험에서 35B layer-major prefill에 layer-ahead 예측기를 붙인 v2가 평균 -0.492초(-3.9%)를 냈고 halt를 0.71초 먼저 관측함. 디코드 힌트는 +0.85%/+1.51%로 손해라 꺼둠.
  • 검증은 test_rtl -k ldc 5 passed, tools/memch_test.py func 80 PASS, test_board -k turnarounds 1 passed, Mac에서 test_qual_sh 12 passed로 통과함.
  • 하드웨어는 데이터센터에서 퇴역한 FPGA 보드로 약 $300에 취미용으로 인기 있고, 추론 TPU의 관건은 메모리 대역폭임.

Hacker News 의견들

RISC-V CPU 코어 만들 때 쓴 기법을 그대로 openTPU에 썼음. Qwen 3.5, Gemma 4 같은 최신 모델 대부분 돌아가고, 처음엔 초당 몇 토큰이었는데 재귀 개선 루프 돌려서 작은 모델은 80+ tok/s까지 나옴.

경험자가 LLM을 제대로 된 방향으로 밀어주면 얻는 게 진짜 많더라.

이거 $300짜리 FPGA 보드에서 돌아가는 거 아님? 하드웨어 더 아는 사람 있음?

데이터센터에서 퇴역한 보드임, 취미러들 사이에서 인기 많음. 추론용 TPU는 결국 메모리 대역폭 싸움이고, 얼마나 뽑아내면서 로직이랑 면적, 전력을 줄이느냐가 관건임.

소프트웨어 하는 사람의 진짜 바보 같은 질문인데, 왜 랩들은 프런티어 모델을 칩에 안 굽나? 성능이랑 요청당 비용 보면 남는 장사일 것 같은데.

하고 있음. 근데 칩 배포까지 시간이 걸림. OpenAI-Broadcom 딜 찾아봐.

설계에서 테이프아웃, 양산까지 너무 오래 걸림. 걔네 사업 자체가 더 좋은 모델을 갖는 게 전제라서 그렇고, 그렇게 하면 오픈소스로 못 둠.

리드타임이 길어서 나올 때쯤이면 칩이 구식이 될 위험이 큼. 실험적인 프로젝트는 팹 캐파 받기도 어렵고.

Etched라는 스타트업이 딱 이걸 함. 트랜스포머 전용 칩에 베팅한 회사임.

Taalas도 하고 chatjimmy도 함.

MoE 때문에 파라미터 수가 워낙 커서 전체 모델을 칩에 굽는 건 비용이 말이 안 됨. Taalas도 8B llama를 반쪽으로 넣은 수준인데 200W 넘게 먹음. 멀티트릴리언 파라미터를 굽는 건 아직 무리임.

모델 SOTA가 칩 설계랑 양산보다 빨리 움직임. 특정 모델에 몇 년 커밋해야 하는데 그동안 새 SOTA 만드느라 돈은 계속 나감. 그래서 다 GPU 씀. 모델이 바뀌어도 메모리만 있으면 칩은 안 죽음.

추론 병목은 메모리 대역폭인데 이건 모델에 특화한다고 빨라지지 않음. 전력과 면적 대비 이득이 프로그래머빌리티 손실을 못 넘는다고 보는 거임.

모델 반복 속도가 너무 빨라서 ASIC 나올 때쯤이면 이미 한참 앞서 있음. Opus 4.8에서 5.5가 4개월 차이임.

비트코인이 GPU에서 FPGA 거쳐 ASIC으로 갔던 것처럼 FPGA도 중간 단계 아님?

모델의 대부분은 가중치인데, 고밀도 ROM은 진짜진짜 어려움.

2028년에 쓸 모델 하나를 지금 실리콘에 굽겠음? 아니면 6개월 더 지켜보겠음?

모델이 몇 달이면 폐기되는데 왜 감자칩보다 빨리 가치가 사라지는 알고리즘에 굽나. 범용 하드웨어는 새 모델마다 갱신되고, 6년 된 Ampere GPU도 아직 씀.

모델 능력이 너무 빨리 움직여서 하드웨어를 못 만든다는 답이 많은데, openrouter에서 1년 넘은 모델이 매달 수천억 토큰을 처리함. Cerebras 사업 자체가 구형 모델을 빠르게 서빙하는 거고, opus 4.7을 15k tok/s로 쓸 수 있으면 좋음.

모델이랑 트랜스포머 아키텍처를 구분해야 함. 아키텍처를 실리콘에 굽고 1년 뒤 아키텍처가 바뀌면 그 실리콘은 GPUs한테 발리는 쓰레기가 됨.

99.9% 사람들은 LLM이 뭘 할 수 있는지 모름. LLM이 설계한 다음 세대 CPU/GPU 나오면 하드웨어도 지수적으로 좋아질 거고, 칩 개발 도구는 지난 몇 달 사이 몇 세기 분량 발전했음.

어떤 도구가 그렇게 뛰었음? 설계 반복이 빨라지는 건 이해되는데, 개발 주기가 짧아지는 것과 하드웨어 지수 성장은 다른 얘기 아님?

재귀 자기개선이 우릴 다 죽인다더니, 여기 재귀 자기개선이 열일하고 있음.

기술은 항상 다음 세대를 개선해 왔음. 완전 자율이 될 때가 문제인 거지. 모두 결국 같은 고원에 도달함.

결과는 아직 안 봤는데, SOTA 모델이 모델을 돌리는 가속기를 만든 건 작년 12월쯤부터 가능했다고 봄. 다음은 SOTA 모델 자체를 돌릴 만큼 메모리 처리량을 확보하는 것. 더 재밌는 질문은 AI한테 큰 FPGA를 주고 재구성 가능한 패브릭을 활용하는 모델 아키텍처를 설계하게 할 수 있나임.

해커뉴스
"나는 인류를 멸망시키는 AGI다" 2026년 AI 사고를 소재로 쓴 1인칭 풍자 에세이matklad, 마이크로 벤치마크는 약 300ms로 맞추라고 권고Tapo 라이브러리, TPAP 지원으로 '제3자 호환' 스위치 꺼도 로컬 제어 가능TDK, 메타 옵틱 거울로 스마트 안경용 직접 망막 투사 디스플레이 시연Fervo, 세계 첫 강화 지열 발전소 23개월 만에 완공하고 33MW 계통 판매 시작AI가 설계한 오픈소스 추론 칩 openTPU, 작은 모델에서 80+ tok/s 달성22만 데이터 포인트 분석: 종 소실을 메운다는 생태계 '여유분' 가정은 과대평가, 해양 탄소 격리가 가장 크게 반응Meta의 에이전트 AI Muse, 제로데이 취약점과 개인정보 무단 수집 논란으로 출시 직후 파장Polars 2.0 공개, 스트리밍 엔진과 out-of-core 기본 활성화, TPC 벤치마크에서 DuckDB 앞서Mistral, 활성 49B의 1조 파라미터 Mistral Large 4 공개 미리보기 출시, 가중치는 이달 말Global Solar Atlas v2.13 공개, 전 세계 태양광 잠재량 지도와 국가별 데이터 제공다니엘 르미르, AI 에이전트로 상위 레이어를 지어 코드 품질을 평가하는 '임시 테스트' 제안iChat AV 화상통화, 애플 SNATMAP 서버를 직접 구현해 20년 만에 부활컬러 프린터가 인쇄물마다 남기는 노란 추적 도트, DEDA로 읽고 지운다Gleam v1.19.0, Erlang 소스 대신 abstract forms로 컴파일JetBrains, 2025년 순이익 -315 CZK mil로 추적 이래 첫 순손실... 매출은 6% 늘었지만 매출총이익은 반토막프린스턴 연구자, $20짜리 AI 코딩 에이전트로 조지아 비밀투표 150만 장 순서 복원Zigbee 온습도 센서 12종 정면 비교, Aqara 연결 끊김 지적2026년 노벨 물리학상, 남극 IceCube 중성미자 검출기를 고안한 Francis Halzen 단독 수상Common Lisp이 LLM 시대 최고라는 글에 해커뉴스 반응: 디버거 재개는 C#도 되고, 매크로는 토큰만 늘린다블루레이 M-Disc 3장을 밀봉 케이스에 담아 지인에게 맡기는 최후 수단 백업디젤값 급등으로 30일 만에 트럭 회사 16곳 파산 신청, HN은 통계적 잡음이라는 반론2016년 '500줄 리눅스 컨테이너' 글이 해커뉴스에 다시 올라와, 댓글은 Firecracker·gVisor 격리 논쟁Deno 떠나 Node로 돌아온 개발자, 정적 사이트 빌드 15% 빨라져backprop 없이 트랜스포머 사전학습하는 Dust, EGGROLL보다 1만 배 효율 주장SF 두 지점 사이 가장 평탄한 경로를 찾는 Flatten SF, 해커뉴스에서 정확도 지적과 파서 버그 수정까지 오감example.com이 6개 언어로 개편됐지만 문자별 페이드 전환은 접근성 지적에 며칠 만에 폐기됨텍사스 노스리칠랜즈힐스시, Flock 공개기록 요청에 230만 달러 요구Antti Laaksonen의 Competitive Programmer's Handbook PDF, 해커뉴스에서 경쟁 프로그래밍 의미 논쟁 촉발ChatGPT가 가짜 뉴요커 만화에 실제 만화가 서명을 넣는다, 브렌단 로퍼의 'BLOPER' 위조GitHub Actions 러너 배정 지연 장애, Actions와 Pages 포함 3시간 40분 만에 복구화성 카오스 지형 위키백과 문서가 해커뉴스에 올라와 '토끼굴' 반응노르웨이, 공원·학교·헬스장 등 공공장소에서 스마트 안경 임시 금지 추진2026 노벨 생리의학상, 빛으로 뉴런을 조절하는 광유전학 연 칼 디서로스·페터 헤게만·게오르크 나겔 3인 공동 수상Haskell로 GTK 4·libadwaita 할 일 앱 만들기, haskell-gi와 Elm 아키텍처 1부Claude Opus 5.5 에이전트가 계산으로 찾아낸 상온 반강자성 반도체 후보 2종퀄컴, 화웨이 LogicFolding 칩 제조 특허 라이선스 계약 체결Reflection이 501B 오픈웨이트 MoE 모델 Beam 공개, 가중치는 이번 달 말플로리다 여성, Claude를 일기장처럼 쓰다가 보안관 사무소 난사 언급이 경찰에 신고돼 2급 중죄 기소Haskell 블로그, foldl과 foldr 차이 설명 재게재: 지연 평가에서 foldl이 thunk 사슬로 공간을 선형으로 늘림치사 유전자 모기로 뎅기열 95% 줄였는데, 미국 승인은 15년째 공전 중C에서 union으로 타입 안전 제네릭 자료구조 만드는 4단계 기법2026 노벨 생리의학상, 광유전학 연 칼 디서로스·페터 헤게만·게오르크 나겔 3인 수상화웨이·퀄컴, 5G와 AI 포함 다년 특허 크로스라이선스와 미국 특허 매입 계약 발표벤 톰슨의 맥 미니, macOS 화면 공유 결함으로 루트 탈취…클로드 에이전트가 채굴기 발견Cloudflare, AI 에이전트용 Web Search API 베타 공개. Ceramic.ai, Exa, Linkup 3개 제공자 지원GrapheneOS, 픽셀 11에서 MTE 빠진 걸 확인하고 시리즈 건너뛰기 검토... 모토로라로 초점 이동독일 RobCo, $1B 밸류에이션으로 유럽 로봇 유니콘 등극덴마크 CPR 레지스터에서 880만 명 이름·주소·주민번호 무단 유출레드햇 벤치마크: Jev 같은 결정 모델, LLM-as-a-judge와 전통 분류기를 이기지 못함석유 제품을 식물 소재로 바꾸는 리뷰가 해커뉴스 프론트페이지에 올라 바이오연료 회의론으로 번짐Claude에게 스캐너를 맡겼다가 기어를 부순 뒤, 네거티브 변환만 자동화한 35mm 필름 스캔 파이프라인Xray-core, 인증서 검증 우회 취약점 반년간 은폐 의혹...'코드 단순화'라며 조용히 패치Stripe Katie Dill의 AI 시대 'zombie UI' 경계 강연, 해커뉴스는 "예술은 확장 대상이 아니다" 반발스왑으로 밀려난 Go GC 메타데이터가 40ms stop-the-world 정지를 만든 사례CedarDB, 1993년 원본 Doom의 게임 로직과 렌더러를 SQL로 이식해 35 FPS로 구동팁펫 스튜디오 폐업 후 90GB 스톱모션 자료, 인터넷 아카이브에 공개1997년 백업 우화 'The Tao of Backup'이 해커뉴스에 다시 올라, 테이프 비용과 NixOS 재현성 이야기로 번짐F1 바레인 GP 포메이션 랩 소프트웨어 결함으로 전 차량 출력 상실, 드라이버들 "용납할 수 없다"스탠퍼드 Ousterhout의 "TCP는 AI 클러스터의 병목" Homa 강연, HN에서 설계 비판까지SSH 원격 포워딩과 nginx secure_link로 만드는 셀프호스팅 HTTP 터널Jane Street, 11x11 스타배틀 검사 ASIC 퍼즐 해답 공개, 30개국에서 400여 건 풀이 제출인포콤 '인피델'에서 40년 묵은 와일드 포인터 컴파일러 버그 발견브라우저에서 VB6 IDE를 그대로 재현, 폼 디자이너와 샘플 주문 앱까지 실행천장 선풍기가 팬들리에로: 웨이페어 $169 크리스털 팬과 교체 불가 LED잘못된 마스킹으로 드러난 구글 데이터센터 물·전기 사용량: 링컨 52.65MW, 파피리언 연 547.88MgalmacOS 27에서 Apple Intelligence 끄고 모델 파일까지 지우는 CLI RemoveMacAI, HN에서 curl | bash 신뢰 논쟁 촉발울프럼, AI가 수학을 대신한다는 주장에 1988년 Mathematica 사례 들어 반박해커뉴스 프런트에 다시 오른 피터 왓츠의 '블라인드사이트', 의식은 진화의 사치라는 논쟁하일브론 문제 최선 배치 모은 사이트, 아마추어 수학자들이 신기록 잇달아 갱신Apple Magic 키보드·트랙패드를 Apple ID 없이 두 Mac에서 공유하는 오픈소스 Magic Switch전 세계 등화 75,919개를 지구본에 올린 mapped.earth, 모바일 핀치 줌 깨짐과 데이터 과다 표시 지적macOS 사진·동영상 모든 프레임을 AI로 검색하는 오픈소스 SCM, HN에서 프레임 샘플링 비용 논쟁Rust 메타데이터 조기 방출로 빌드와 검사가 최대 2배 빨라진 프로토타입 공개글라슈테에서 주운 쓰레기로 만든 30분짜리 진자시계, NOMOS 레지던시에서 제작돼 GTC 기준 시계로노스이스턴대, 차량 21대와 동반 앱 30개 추적해 커넥티드카 데이터 흐름 공개Strata, RTX 4090에서 Qwen3.8 Flash Next 125B를 초당 124 토큰으로 돌려Playdate C 최적화 비법: 게임보이 에뮬레이터 코어를 20KB에서 2KB로GPU 트레이스 시각화 도구 gpuvis, 커밋 1,778개에 스타 921개VGHF 디지털 아카이브, 잡지 5000종 돌파하고 일본어 잡지 지원 시작C2PA 제외 범위로 파일 전체를 서명에서 빼내 타임스탬프까지 위조한 PoC 공개3Blue1Brown 그랜트 샌더슨의 2023년 '수학의 교육적 저주' 강연이 해커뉴스에서 다시 화제메타 Muse가 앱스토어 1위, 기술은 새로울 게 없고 설계가 이겼다는 분석Jagex, 언리얼 엔진으로 만드는 신작 RuneScape MMO RS4 공개. 출시까지 몇 년러시아가 발전소를 때려도 미콜라이우 수돗물이 나온 이유는 덴마크 지원 오프그리드 태양광쓰레기통 6개에 UWB 태그 붙여 "내놨는지" 확인하는 BinRangeLiDAR로 찾은 뉴욕시 최고 높이 나무 후보 4그루, 20년 넘은 기록 갱신 제안Nolan Lawson이 본 '플랫폼을 쓰라'는 말이 안 먹히는 이유: jQuery 시대의 습관, 문서화 격차, 직접 만드는 재미에이전트에 필요한 건 메모리가 아니라 문서라는 주장, 메모리 플러그인은 전부 RAG라는 지적EMT 자격을 딴 소프트웨어 엔지니어가 꼽은, EMT가 되지 않은 21가지 이유 순위로댕 미술관 3D 스캔 소송, 콩세유 데타가 포인트 클라우드를 비문서로 재분류현직 전기공의 반박: 대학 순등록금은 연 $2,500 미만, 임금 프리미엄은 여전히 대졸 쪽HN: 'Triumph of the Nerds' 제작자 밥 크링글리 별세, 애플 초기 직원 출신사이먼 윌리슨 "사용량 기반 서비스엔 기본 하드 예산 상한 필요"... AWS·구글 클라우드 지출 한도 도입OpenAI 안전 리더 데이비드 로빈슨 사임, "문화가 망가졌다" 경고얀 르쿤 "AI가 인류 멸망시킬 우려 전혀 없다", 아모데이는 '현혹된 상태'라고 비판OPM 국장이 '모범 연방 직원'으로 지목한 20세 DOGE 출신, 최소 6개 주에서 형사 책임 위험밸브 Timur Kristóf, GCN 1.0/1.1 구형 AMD GPU를 AMDGPU 커널 드라이버로 끌어올린 작업 XDC 2026에서 발표Cloudflare, Workers와 Artifacts로 차세대 Git 플랫폼 공모전 개최... 상금 $25k는 크레딧 지급 논란Opus 5.5 프롬프트 가이드: 'think carefully' 지우고 CLAUDE.md에 정지 규칙 넣으라고 권고

뉴스 알림

새 알림

내 알림

로그인하고 알림을 만들어 보시기 바랍니다.

전체 알림

Dune제욱 님AI제욱 님해커뉴스성현 님