GLM-5.3 오픈 웨이트 공개, GLM-5.2와 같은 베이스에서 사후학습만으로 코딩·사이버 성능 향상
- GLM-5.3은 GLM-5.2와 같은 베이스 모델을 쓰며, 성능 향상은 모두 사후학습에서 나왔다는 설명임. 자체 Z.ai Code Bench에서는 GLM-5.2보다 50% 높은 점수를 기록했다고 밝힘
- Terminal Bench 3.0에서 28.3점을 기록해 GLM-5.2의 4.6점보다 크게 올랐으며, DeepSWE는 66.9점, FrontierSWE는 78.1점임
- 취약점 탐색 평가 CyberGym에서 84.5점으로 표의 최고점이며, ExploitGym은 2시간과 6시간 조건에서 각각 105점과 130점으로 GLM-5.2의 29점과 39점을 크게 넘김
- 추론 예산은 reasoning_effort에 low, high, max를 지정하며, 생략하거나 다른 값을 넣으면 max가 기본값임. 채팅에서는 clear_thinking=true를 명시하도록 안내함
- 로컬 배포는 SGLang, vLLM, Transformers, KTransformers, Unsloth 등을 지원하고 Ascend NPU에서는 vLLM-Ascend, xLLM, SGLang을 지원함
Hacker News 의견들
요즘 점점 더 많이 쓰는데, 좋은 의미로 Opus 4.8 같은 느낌임.
모델 평가는 HTML/CSS, 자바스크립트, C++ 중 뭘 시키는지에 따라 완전히 달라짐. 구체적인 작업이나 하니스 없이 좋다는 말은 별 의미 없다고 봄.
지난 12월부터 GLM만 쓰고 있는데 토큰 문제나 지정학적 제한으로 스트레스받은 적이 없었음. 5.3도 품질이 좋아서, 몇 년 안에 집에서 돌릴 하드웨어가 나오길 기대 중임.
Claude 특유의 말투 없이 그냥 일을 처리하는 점이 좋음. 최고나 가장 신뢰할 만한 모델은 아닐 수 있어도 대화하기는 제일 편한 편임.
GLM-5.3-Flash는 DeepSeek보다 싸다고 보기 어려움. 기본 가격이 $0.50 대 $0.48이고 지금은 한시적 50% 할인 중이지만, 출시 24시간 안에 주요 추론 제공자가 붙을 만큼 화제는 충분히 됐음.
z.ai에서 써보니 Flash라는 이름과 달리 꽤 느렸음. 새 DeepSeek Flash도 마찬가지였고, 서버가 몰린 듯함.
내 경우 GLM-5.3-Flash는 속도가 들쭉날쭉하고 정말 느릴 때가 있음. 저렴하더라도 바로 대체할 모델은 아니라고 봄.
DeepSeek V4-Flash에서 $0.08 나오던 작업이 GLM-5.3-Flash에서는 $0.30 이상 든 적이 있음. DeepSeek 가격 인상 뒤 기준이고 OpenRouter의 High와 50% 할인을 썼는데도 그랬음.
DeepInfra가 OpenRouter에서 처음으로 붙었고, 지금은 Ollama Cloud와 TrustedRouter의 Z.ai, Novita, Atlas Cloud, IO.NET에서도 쓸 수 있음.
OpenRouter로 Claude를 썼더니 11개 메시지 대화 한 번에 $200이 청구됐음. 캐시 토큰이 전혀 잡히지 않았는데, 어떤 제공자는 캐시 적중률이 67%이고 최고 제공자는 95%라고 함.
DeepSeek Flash나 새 GLM Flash보다 한 단계 높은 오픈 웨이트 모델을 찾으면 GLM 5.3이 적당한 선택지 같음. Kimi보다 능력은 조금 뒤처져도 돌리기 쉬우며, 512GB 통합 메모리 Mac M5 Ultra라면 4비트 양자화로 로컬 실행도 가능할 듯함.
512GB RAM 듀얼 Xeon이나 동급 AMD 서버에서도 더 느리게는 돌릴 수 있음. 하루 작업을 분석 에이전트에 넘기거나 밤새 단발 작업을 돌리는 용도라면 괜찮겠지만 소음 때문에 차고나 지하실이 필요할 것임.
추론은 기대보다 아쉬움. 단단한 잡일은 잘하지만 대화형 산문 품질이 낮고, 습관이나 과한 열의를 프롬프트로 고치기도 어려워서 결국 정신적 비용이 생김.
토큰당 비용만 보면 로컬 장비는 전혀 이득이 아님. 그래도 내가 Spark 두 대를 샀을 때 GPT OSS 120B의 AA 점수는 24였는데, 지금은 GLM 5.3 Flash Q4로 AA 57을 돌릴 수 있으니 장비 가치가 커졌다고 느낌.
GLM-5.3 위에 LoRA 등을 얹어 특정 산업 모델로 최고 성능을 내기는 어렵다고 봄. 범용 모델이 특화 모델을 자주 이겼고, 프런티어 모델 출시 주기가 빨라서 만들기도 전에 구식이 될 가능성이 큼.