Z.ai, 18B 활성 파라미터 GLM-5.3-Flash 공개…Ox Alpha의 정체 확인
- GLM-5.3-Flash는 전체 320B, 활성 18B 파라미터의 GLM-5 계열 첫 네이티브 멀티모달 모델이며, 회사는 GLM-5.2보다 벤치마크와 실제 작업 성능이 높고 가격은 10분의 1이라고 밝힘
- Artificial Analysis Intelligence Index v4.1.1에서 57점, 할인 기준 작업당 $0.045를 기록했다고 발표했으며, DeepSWE v1.1은 63.4점으로 GLM-5.2의 46.2점보다 높았음
- 긴 컨텍스트 비용을 줄이기 위해 선형 어텐션과 희소 어텐션을 결합했고, 100만 토큰 문맥에서 인덱서의 지연과 메모리를 줄이는 IndexPool은 인덱서 키 벡터 4개를 가중 풀링해 1개로 압축함
- GLM-5.3과 비교해 어텐션 연산량은 3.0배, KV 캐시 크기는 4.4배 줄였으며, GLM-4.5 대비 활성 파라미터는 32B에서 18B, 레이어 수는 92개에서 45개로 낮춤
- 출시 전 ox-alpha라는 익명 모델로 OpenCode와 OpenRouter에서 시험했고, 회사는 중국 AI 칩으로 제공한 이 트래픽이 그 주 가장 많이 쓰인 모델이 됐다고 밝힘
Hacker News opinions
API 정가가 입력 100만 토큰당 $0.15, 출력 $0.50, 캐시 입력 $0.03이라는데, DeepSeek V4 Flash보다도 싼지 궁금함.
미국의 대중 제재는 중국이 자체 반도체 산업을 키우도록 자극한 셈임. 중국처럼 규모와 자원이 있는 나라에 대결을 택하면 결국 자립 개발은 빨라질 수밖에 없었음.
기술 절취가 문제라는 지적은 이해하지만, 요즘은 상당수가 공개된 상태라 복제 가능하다는 논거도 설득력이 약해 보임.
내가 보는 요점은 Ox Alpha를 중국 AI 칩으로 대규모 서빙했다는 사실임. 같은 하드웨어의 초기 기준선보다 종단 간 서빙 성능을 3배 높여 NVIDIA GPU와 비슷한 토큰당 비용을 냈다고 Z.ai가 썼음.
그래도 Ox Alpha는 약 20 TPS로 느렸고 지연도 컸으며 타임아웃도 자주 났음. 칩 자체보다 수요를 감당할 서빙 용량이 부족했던 것 같고, 하루 100T 토큰 주장은 과장으로 보임.
중국 가속기가 발전하는 건 맞지만 NVIDIA의 격차가 아직 큼. Ox Alpha는 더 작은 모델인데도 속도가 꽤 느렸음.
기업 API 고객이 중국 국가에 데이터를 맡길지는 회의적임. 실제 수요는 로컬 호스팅이나 임대 쪽일 텐데, 하나는 비용이 맞지 않고 다른 하나는 컴퓨트가 부족해 보임.
나는 Spark 4대와 AliExpress에서 QSFP 케이블을 사서 로컬 실행을 시험 중임. 2노드 DS4는 평범한 작업엔 좋지만 새롭고 어려운 기술 문제를 만나면 추론 한계에서 맴돌아서, Opus 4.8급 로컬 모델은 아직 못 봤음.
OpenRouter 같은 곳에서 이 급의 모델을 Opus급 모델과 나란히 써 보면 차이가 아직 큼. 로컬 LLM이 프런티어 모델을 대체했다는 글은 단순한 프로젝트를 하거나 품질 기준이 낮은 경우가 많다고 봄.
처음 공개됐을 때 Ox Alpha가 너무 잘 나와서 새 팀 모델인가 했는데, 결국 GLM-5.3 Flash였음. 이제 OpenRouter API도 stealth/ox-alpha 호출에 이 모델의 정체를 알려 주고 있음.
320B 전체 파라미터에 활성 18B면 Flash라 해도 집에서 돌리기엔 큼. Q4로 약 160GB라 최소 192GB 정도는 필요하고, RTX 6000 Pro 2장이나 256GB 통합 메모리는 있어야 쓸 만해 보임.
벤치마크가 좋아도 GLM의 Flash 속도는 DS4 Flash와 경쟁할 수준으로 느껴지지 않음. 같은 세그먼트로 보기는 어려움.