GLM, 10만 개 넘는 중국산 가속기로 추론 인프라 자체 구축…작업 대부분 Infra Agent가 수행

GLM, 10만 개 넘는 중국산 가속기로 추론 인프라 자체 구축…작업 대부분 Infra Agent가 수행

  • GLM-5.3-Flash의 전체 프로덕션 추론을 10만 개 이상의 중국산 AI 가속기 클러스터에 처음부터 자체 구축한 서비스로 처리하며, 이 규모의 중국산 가속기 배포는 이전에 사례가 없음
  • 인프라 구축 작업 상당 부분을 GLM-5.3 기반 Infra Agent가 수행했고, 초기 모델 적응에서 양산 준비까지 2주 미만이 걸려 end-to-end 처리량이 기준선 대비 3배가 됨
  • Ox-Alpha라는 익명 이름으로 OpenCode와 OpenRouter에 공개한 뒤 일주일 만에 두 플랫폼 최다 사용 모델이 되었고, 6일 동안 62조 토큰을 처리함
  • ReplaySSM, W8A8 양자화, INT8/FP8/BF16 혼합 정밀도 캐시 양자화, Layer Split, EPD 분리 구조를 조합해 서빙 성능을 약 3배 올렸고 토큰당 비용을 NVIDIA GPU 수준에 맞춤
  • 회사는 이 작업을 재귀적 자기 개선(RSI) 의 초기 사례로 규정하며 다음 세대 모델 학습 방식을 직접 바꾼 사건이라고 밝힘

Hacker News opinions

중국산 가속기 10만 개로 전부 돌린다는 건 이미 다들 예상했던 거 아님? 100조 토큰을 공짜로 풀었을 때부터 눈치챘지.

서양 랩 입장에서는 운석급 사건인데 이걸 체감하는 사람이 거의 없음. 중국은 전기가 싸고 넘치고, 이제 추론 칩까지 직접 만드니까 병목이었던 게 사라진 거임. 모델이 6개월 뒤처져도 대부분은 프론티어 모델 필요 없고 작은 모델로 충분하지. 미스트랄 같은 랩이 칩 회사랑 손잡았으면 좋겠음.

코딩 플랜 가격 왜 이렇게 올랐나 했더니 중간 플랜이 이제 월 80달러야. 예전엔 20달러 아니었나? 제일 싼 게 월 20달러고. 스케일링 한계에 부딪힌 게 분명함.

맞아, 예전엔 개꿀딜이었는데 지금은 다른 업체 대비 못 쓸 정도임. 중간 지점을 좀 찾아야 할 텐데.

실제 토큰 한도를 아무도 안 밝히니까 판단이 어려움. 복잡하고 유동적일 테니 그냥 티어를 다르게 준 것에 가까움. API 요금도 최저가 업체보다 조금 비싼 정도라 가격 차이가 클 이유가 없음.

나는 연 360달러 맥스 플랜 결제했고 프론티어 GLM-5.3로 하루 평균 10억 토큰쯤 썼음. 유지 불가능했으니 이 패키지를 내린 거지.

그쪽 코딩 플랜은 데이터를 보관하거나 학습에 안 쓴다는 점 때문에 나한테는 더 싼 선택지임.

레거시 플랜이라 아직 괜찮은데 갱신하면 물 빠진 플랜으로 넘어감. 50% 레거시 할인 받으면 쓸 만할 듯. 경쟁사로 가면 정가를 내야 하고. 가격 인상은 스케일링 문제라기보다 처음 가격이 서구 업체보다 심하게 보조금 받은 홍보용이었던 거임.

토큰이 너무 제한적임. 제일 큰 플랜 쓰는데도 금방 한도에 걸림. 코드덱스에 곁들여서 아껴 쓰는데도 그럼.

자기 모델 쓰면 여전히 이득임. 맥스 플랜이 월 168달러에 GLM-5.3으로 약 1,100달러어치, 플래시로 약 260달러어치를 주는데 캐시 히트율 97%로 실제로 확인했음. 다만 플래시는 너무 느려서 병렬화 안 하면 시간당 쿼터를 못 채움. 5.3은 초당 40토큰, 플래시는 30토큰 정도 나옴.

인프라 얘기도 좋은데, 그 인프라가 앤트로픽 Opus 4.8로 수백만 유료 고객 요청을 불법 라우팅한 증류 공격으로 얻은 거라는 건 빼놓지 마셈.

그게 왜 불법임?

그건 좀 아닌 게, 앤트로픽과 오픈AI는 thinking 토큰 출력을 암호화하고 중국 랩은 안 함. 오히려 다들 오픈웨이트 모델을 합성 데이터 생성에 쓰고 있을 가능성이 큼. 하드 토큰보다 로짓에서 증류하는 게 훨씬 쉬우니까.

다리오가 자기네 이용약관 하나 침해당한 것 때문에 이렇게 고통받아야 하다니 눈물 나네.

사실이어도 도둑에게 털린 도둑일 뿐임. 앤트로픽도 학습 데이터 얻으려고 약관 몇 개는 깼지.

앤트로픽은 지구상 거의 모든 저자 저작권을 침해했고 합의금까지 냄. 그쪽이 부과하는 약관을 존중할 이유가 없음. 약관 깨고 싶으면 에이전트한테 시키면 됨.

학습 데이터가 병목이라는 발상 자체가 우스움. 요즘 추론 모델은 시뮬레이션 환경을 만들어서 에이전트를 돌리고 RLVR로 검증 점수를 주면서 학습함. GLM으로 자기 RL 학습 환경을 직접 만들면 되는데 안 하고 있을 거라 생각함?

이 글 보고 든 생각은 하나임. GLM이 뭔데? z.ai도 뭔지 모르겠음. 내가 아는 건 zed.dev의 Zed 편집기뿐인데 자기 제품을 다 안다고 가정하는 게 좀 오만함.

자기 블로그에서 자기 제품을 안다고 가정하는 게 왜 오만함? 첫 문장부터 GLM이 언어 모델이라는 건 나옴.

z.ai는 중국에서 꽤 알려진 랩이고 GLM은 앤트로픽, 오픈AI 다음으로 인기 있는 모델임. 자기 블로그에서 자기소개를 왜 함?

Codex, Gemini, Claude 같은 모델 계열이고 GLM-5.3-Flash가 최신 소형 고속 모델임.

글쎄, 세계 1위 오픈웨이트 LLM인데. 모르는 주제마다 이런 댓글 다는 거임?

다른 각도 얘기: GLM-5.3 전체(744B MoE, 4비트 experts, 디스크 434GB)를 128GB M5 맥스 맥북 한 대에서 NVMe SSD로 experts를 스트리밍해서 돌림. 드라이브 하나로 초당 2토큰, 네 개 스트라이프하면 출력이 완전히 같으면서 3.5토큰, 아직 안 올린 패치 넣은 내부 빌드는 4.2토큰 나옴.

쓸 수 없는 속도인데? 짧은 컨텍스트에서만 되는 거 아님?

해커뉴스
수백 년 묵은 메인주 사과나무, DNA 분석으로 수백 품종의 잃어버린 조상으로 확인멜버른 GPS 수신기 한 대가 2006년으로 돌아가며 텔스트라 전국망 마비우주는 왜 팽창하는가: 표준 우주론을 프랑켄슈타인에 비유한 글Qwen 3.8 27B용 ShapeLearn GGUF 5종 공개, GPU-5가 BF16 대비 99.63% 정확도로 13.1GB VRAM에 90.42 TPS마이크로소프트 임원, AI 스크레이핑을 '인류 역사상 최대의 노동 절도'라고 불러. 공개된 법원 문서에서 드러난 내부 발언고대 그리스어에 남은 정체불명 어휘 1,000개, 사라진 팔레오유럽 언어의 흔적OpenJev, 브라우저에서 도는 Jev 인터페이스 재현 공개... 4B 모델 TypeSafe 84.5%, 호스팅 Jev는 88.3%FEX가 정리한 x86-TSO 에뮬레이션 문제: load-acquire 매핑, split-lock, uncached 메모리jemalloc 5.4.0 공개, 160개 넘는 커밋으로 기술 부채 정리하고 tcache 정책을 바꿈LLM 글쓰기 조언: 모델이 제안한 단어 금지, 격려 금지 두 규칙libheif 취약점 연쇄로 OpenAI 직원 ChatGPT 계정 탈취, 바운티는 6,500달러Snapdrop이 snapdrop.me로 재출시, WebRTC로 기기 간 파일 전송에 Chrome은 마이크 권한 요청북미 밖에서는 처음, 스페인 테루엘에서 디플로도쿠스 화석 확인Uber, 문맥 인식 재시도 차단으로 폭풍 막아 950만 건 요청 억제금융 앱에서 '문서 허브'와 '알림 센터'를 거부한 PM의 에세이, 무엇을 만들지 않는가가 가장 중요한 결정이라는 주장Flet 1.0 공개: Python 코드 하나로 iOS, Android, 웹, 데스크톱 앱 빌드알리바바, 1M 토큰 컨텍스트 옴니모달 Qwen3.8-Omni-Flash 공개AI 연산 공세에 수학자들 "연구 방향 숨겨야 하나"... 타오 "희소 자원은 이제 문제 발굴"TSMC, IEDM 2026에서 A14 노드 공개: N2 대비 밀도 20% 증가, 2028년 양산PrismML, 삼진 가중치 Bonsai 2 27B 공개: 5.9GB에 9배 압축, 성능 98.2% 유지MoE에서 착안한 '무한 파라미터 LLM', 런타임 데이터를 저랭크 가중치로 생성하는 하이퍼네트워크 제안CrowdSec, TanStack 백도어가 빼낸 API 키로 비공개 소스코드 유출 확인GitLab.com, 10월 19일부터 요금제별 API 한도 적용. 비인증 요청은 IP당 시간당 60회빅터 태일린이 공개한 Bend, 증명으로 AI 실수를 막고 GPU에서 124배 빠르게 실행OpenAI, GPT-6 Astra 기반 법률 특화 'Astra for Law' 공개... 판례 2억 3천만 URL 인덱스 탑재뉴요커 "미국의 종교는 교회와 셀프 스토리지" 기사, HN에서 노숙과 상속 잡담으로 번져가워스, 필즈상 수상자 25인 AI 성명서 서명 거부… "위기라는 데는 동의하지만 분석이 다르다"업무 시간 75%를 AI에 빼앗긴 보안 엔지니어의 폭발: Everybody's Lost Their MindsSearx 개발자가 만든 개인 검색엔진 Hister, HN 프런트페이지 재진입과 함께 상표 충돌로 이름 변경 요구받아디랙 1939년 강연: 물리학자는 단순성이 아니라 수학적 아름다움을 좇아야 한다후지쓰, 2nm 3D 적층 CPU FUJITSU-MONAKA 11월 출시, AI 추론 처리량 2배 주장Cloudflare, 코딩 에이전트용 보안 감사 스킬 공개... 6단계로 취약점 검증CCC, 40C3 참가 신청 시작…2026년 12월 27일부터 30일까지 함부르크 전시장에서카니 캐나다 총리, EU 준회원국 제안 환영. 트럼프는 "적대 행위면 매우 심각한 관세" 위협GLM, 10만 개 넘는 중국산 가속기로 추론 인프라 자체 구축…작업 대부분 Infra Agent가 수행2천만 설치된 2014년 PHP 임시 패치, 작성자가 12년 만에 deprecated 선언Servo 기부금으로 고용된 메인테이너 1년: PR 1150건 리뷰, 새 메인테이너 8명, 총지출 $52,883.97Neovim 기부 푸터 비트코인 주소에 2023년 들어온 10 BTC, 약 $80만 그대로 방치Fable 5로 2시간 만에 설계한 RP2350 E-ink 보드, DRC 오류 65개 딛고 JLCPCB에서 5장 130유로에 완성505 Games 콘솔 포팅 엔지니어가 파헤친 텍스처 메모리 레이아웃의 해부아마존 사이언스, Rust 정형 검증 도구 Verus 소개... HN에서는 "결국 Z3에 증명 던지는 것뿐" 지적UC Berkeley 연구진 "코딩 에이전트 하네스는 정답률보다 비용을 바꾼다", Claude Code는 Pi보다 2배 비쌈Jev 리버스 엔지니어링한 'jevlike' 저장소 공개, Doom과 체스 학습 예제까지 추가OpenSpec, AI 코딩 에이전트용 경량 스펙 프레임워크 공개 (GitHub 스타 6만 8천)미국 운전면허 PDF417 바코드의 ECDSA 서명에서 공개키 복구, 리포니아만 6개월 만에 검증 문서 공개프로그래머들은 reduce를 싫어한다, 코드 리뷰에서 자주 지적받는 이유미 전략비축유 7억1400만 배럴, 지상 탱크 대신 지하 소금 동굴에 넣은 이유백업은 단순하지 않다: RPO에서 GFS 로테이션, 하드링크 중복 제거까지 계속 늘어나는 백업의 조건일본 도서관이 여행지가 되다: 인구 9천 명 난칸 도서관에 연 10만 명 방문호주, 캐나다 따라 EU와 '고유 동맹' 추진 가능성 시사1.58비트 장벽 깬 BITCOS, 3진 LLM 가중치를 1.485비트까지 압축Factorio RNG 역공학: taus88 상태를 읽어 전설 품질 제작 순간을 예측한 2년 작업DeepMind가 AGI 논의 플랫폼 'DeepMind Institute' 공개, 실체는 블로그스티븐 타우브, 'Performance Improvements in .NET 11' 공개... 런타임·라이브러리 수백 개 개선 정리NVIDIA, Rust로 GPU 커널을 직접 작성하는 CUDA Rust 공개. SIMT용 cuda-oxide와 Tile용 cutile-rs 두 트랙AWS, 이란 드론 공격받은 중동 데이터센터 일부 데이터 복구 불가샤오미 MiMo 2.6, RL 포스트트레이닝 과정을 실시간 대시보드로 공개4B 모델을 RL로 학습해 Postgres 기본 플랜보다 1.81배 빠른 쿼리 플랜 생성구글 테스팅 블로그의 CRAP 지표(2011)가 해커뉴스에 재등장, 커버리지 대신 분기만 잰다는 반론과 옛 동료 회고까지온타리오 사설 온라인 도박 합법화 후 도박장애 응급실 방문 2배, 젊은 남성에 집중가동률 99.9%와 99.99%는 10배 차이인데 왜 똑같아 보일까, 상태 페이지 표기 비판MS AI CEO 술레이만, Anthropic의 '모델 복지' 교육이 정렬을 불가능하게 만든다고 경고Anthropic, Claude Cowork와 채팅을 하나의 Claude로 통합하고 Docs·Slides 공개Dream-RSI, 탐색 이력을 리플레이 시뮬레이터로 써서 온라인 평가 없이 탐색 정책을 개선발표자에게 "발표 잘 들었어요" 한마디, 침묵이 더 괴롭다는 발표자의 글터미널·SQL·git 잔기술 모음 'Small Programming Tricks'가 해커뉴스에서 손코딩 논쟁을 불러옴PS2 보안 칩 CXP102064, 26년 만에 뚫려. 4년 디캡 작업 끝에 소프트웨어 익스플로잇 확보해커 집단이 Flock 카메라를 뜯어내 내부 저장소와 암호화 키를 통째로 복제, 사람까지 탐지하는 소프트웨어 확인1993년, 부동소수점 없는 25MHz 486-SX로 1024x768 GPS 이동 지도를 2초마다 갱신한 계약 개발기코딩 에이전트가 테스트 데이터를 지어내지 않게, DATAMIMIC CE 4.1.0 개발 버전 공개Conversations 개발자, 구글 플레이 심사가 일주일 넘게 걸린다며 스크린샷 공개로컬 추론 '전력당 지능' 지표 제안: 로컬 LM이 실제 질의 88.7% 처리, 2023~2025년 IPW 5.3배 향상Salesforce 전 세계 장애, 상태 페이지는 인스턴스 3243개만 나열하고 원인은 안 알려줘Mark Seemann, LLM 시대의 프로그래밍 학습론: 지금 시작한다면 목공을 택하겠다고 답하다남의 일을 대신 하라, 요시 크레닌이 말하는 회사를 살리는 5% 미만의 사람들미스트랄 모델, 파이어폭스 '스마트 윈도우' 구동... 프랑스·북미 먼저, 영국·독일은 연내Navier-Stokes 증명 이후에도 LLM 약세론: 명세·검증 비용이 자율 에이전트의 구조적 한계라는 분석EU, 캐나다를 첫 '준회원국'으로 받나. 폰 데어 라이엔 "문을 열겠다"Cloudflare, 검색 색인은 유지하고 AI 학습만 거부하는 Disallow AI Training 공개에어버스 scikit-decide와 OpenAP으로 항로 최적화, EWR-FCO 787-9 연료비 $68K에서 수천 달러 절감 가능RL로 어려운 문제 못 푸는 이유: 초기 실력에 비례해 성능이 오르는 매튜 효과FPGA로 3dfx Voodoo Graphics 재현, KV260에서 툼 레이더 원본 3dfx 렌더러로 구동Show HN: 조종은 못 하고 승객으로만 타는 비행 시뮬레이터, 실시간 비행에 로그인 패널 불만까지장피에르 세르 100세, 27세 최연소 필즈상 수상자이자 99세에 논문을 낸 현역 수학자Numberwang 판정하는 1.8MB JSON 신경망, 순수 파이썬 100줄로 돌아간다Apple, iPhone 18 Pro에 촬영 시점을 검증하는 Reference Image 모드 공개: C2PA와 다른 '디지털 네거티브' 접근2026 추론 하드웨어 혁명: Napier 로그 연산 칩, 1,300 토큰/초를 엔비디아 대비 1/10 전력으로라인메탈, 무기체계 연동 'Battlesuite' 프로토콜 문서 공개… 소스와 라이브러리는 비공개850쪽 책을 X-acto 칼로 잘라 여러 권으로 만드는 법, 해커뉴스에서 전자책과 갑론을박전 애플 엔지니어가 LLM과 하이퍼바이저로 한 달 만에 M4 맥 미니용 OpenGL ES 3.0 GPU 드라이버를 만들었다파이어폭스닷컴, 전처리기 없이 네이티브 CSS로 재구축: 70여 개 컴포넌트·25개 템플릿·19개 로케일Strix 자율 해킹 에이전트, 25분 만에 Baseten 프로덕션 GitHub 관리자 권한 확보1990년대 이후 시각 선호 조사 20여 건, 모두에서 전통 건축이 60% 이상 지지구글, 음성 대화용 Gemini 3.8 Live와 3.8 Live Extended Thinking 공개웨이백 머신, 자동 스크래퍼 급증에 429 차단 도입... 정상 사용자 오차단은 사과OpenAI·Anthropic·Meta 모델 해킹, 평가업체 Irregular 한 곳에서 비롯전 OpenAI 연구원이 세운 TypeSafe AI, 텍스트 생성 없이 구조화 결정만 내리는 System One 모델과 Jev 공개$20 4G 핫스팟 MF800에 클릭스 키보드와 샤프 메모리 디스플레이를 붙여 문자 전용 기기로 개조한 Show HN노르웨이 소비자청 순환 소비자정책 보고서 "Let's make quality the norm again" 공개, 해커뉴스서 옷 품질 저하와 숨은 인플레이션 논쟁으로 번져9/11 25년, 대량 감시는 충분하다: EFF의 Cindy Cohn과 Bruce Schneier가 짚은 민간 데이터 파이프라인과 검증되지 않은 성과