Z.AI, 무료 고성능 Ox Alpha가 새 GLM 계열 모델이며 가중치 공개한다고 확인
- 중국 AI 기업 Z.AI가 온라인 사용량 차트에서 무료 고성능 모델로 알려진 Ox Alpha를 자사의 새 GLM 계열 모델이라고 확인함
- Z.AI는 블룸버그 질의에 답하며 Ox Alpha 가중치를 기사 게시일인 2026년 8월 26일 밤 공개하겠다고 밝힘
- Z.AI는 Zhipu라는 이름으로도 알려진 회사임
- 기사에서 Ox Alpha는 무료 제공과 높은 성능으로 온라인 사용량 차트 상위권에 오른 모델로 소개됨
Hacker News opinions
블룸버그 외에는 아직 출처를 못 찾았지만, 회사가 공식 확인했다니 일단 사실로 봐도 될 듯함. 다만 성능은 과장이 너무 많아서 판단하기 어려움
모델 크기가 얼마인지 아는 사람 있음?
신뢰할 만한 성능 보고서 링크를 못 찾겠음. 실제 역량을 확인할 자료가 필요함
나는 에이전트로 Mindustry를 Java에서 C#으로 옮기는 작업에 써봤는데, 50시간째 돌아가도 잘 해내고 거의 끝났음. 추론은 15 to 20 tks로 느렸지만 장기 작업 결과는 DeepSeek Flash와 GPT Luna보다 훨씬 나았고, GPT Sol이나 Opus보다는 못했음. 파라미터는 2천억 to 3천억쯤으로 추정함
DeepSWE에서 63%라는 수치가 돌고 있음. 이 벤치마크를 만든 Wenghi는 꽤 신뢰할 만한 편임
공개 테스트 초반보다 후반에 같은 작업 성능이 크게 나빠졌다는 보고가 많았는데, 테스트 기간에 무슨 일이 있었는지 궁금함
나는 pass@K 분산일 가능성이 더 크다고 봄. 같은 프롬프트도 결과 편차가 큰데, 중국 오픈소스 모델은 Fable이나 Opus처럼 RL을 많이 거친 모델보다 그 편차가 더 크게 느껴졌음. 7일 사이에 RL 체크포인트를 바꿨을 가능성도 있지만 낮아 보임
초반에는 가장 좋은 양자화 버전을 내서 테스트를 끌고, 이후 여러 양자화 수준을 시험하며 성능을 낮췄을 수도 있음
LiveBench에서는 GPT-5.4 Nano보다도 낮은데 oxalpha.com에서는 Fable을 크게 앞선다고 함. 서로 너무 다른데, 후자가 맞으면 Fable 증류설은 여전히 나올까?
oxalpha.com은 공식 사이트가 아니라 누군가 급히 만든 페이지임. 거기 수치로 판단하면 안 됨
Fable을 이겼다는 결과는 완료되지 않은 벤치마크 실행 중간값이었고, 최종 결과는 더 낮았음
그 벤치마크는 의심스러움. 지적 전까지는 스폰서 AbacusAI의 Kimi K3 파인튜닝 모델이 오픈 웨이트 1위였는데, 지금은 목록에서 사라졌음
증류됐다는 확실한 증거가 나오기 전까지는 안 믿겠음. LLM 성능 도약은 예고 없이 여러 번 나왔고, 뒤처졌다고 여긴 쪽의 불평일 수도 있음
Fable급이라는 말은 SNS 과열에서 나온 주장임. 유능한 소형 모델일 수는 있어도 프런티어급으로 보긴 어려움. 크기, 양자화 뒤 성능, 일반 소비자가 살 수 있는 장비에서의 속도를 봐야 함
모델만 놓고 비교하는 건 별 의미 없음. 에이전트 하니스마다 컨텍스트 처리 방식이 크게 달라서, 여러 하니스에서 같은 모델을 비교해야 함
나는 omp+Ox Alpha가 큰 평가 환경 생성과 리팩터링에서 cc+Fable과 Codex Sol을 이기는 걸 봤음. Ox Alpha는 파일을 어디에 둬야 하는지 알고 작업을 끝까지 마쳤는데, 나머지 둘은 두 평가 기준 모두 실패했음
중국 회사가 가중치를 기본값처럼 공개해야 한다고 기대받는 게 웃김
중국 연구소가 모든 모델 가중치를 내놓는 건 아님. 프런티어보다 작은 모델은 공개하지 않으면 만들 이유가 적고, 신생 연구소에는 브랜드를 알리는 전략이기도 함. Qwen도 최상위 모델 전체를 공개하진 않음
시진핑이 지난달 세계인공지능대회 연설에서 오픈소스와 개방, 협업을 장려하겠다고 공식 정책으로 말했음. 그 뒤 Alibaba와 Qwen이 Max 변형까지 가중치를 공개한 데 영향을 줬다는 해석이 나옴
Ox Alpha는 DeepSeek Flash 07/31보다 확실히 낫다고 봄
나도 DeepSeek V4 Flash 0731을 자주 써서, Ox Alpha가 작고 계산 비용도 비슷하다면 큰 얘기임. 나는 에이전트를 오래 방치하기보다 빠른 추론으로 계속 개입하는 개발 방식을 선호함
성능이 조금 낫더라도 더 싸지는 않을 듯함. 둘 다 Flash 계열이면 결국 더 싼 쪽을 고를 것 같음
가중치 공개는 DeepSeek와 오픈 모델 쪽에서 경쟁하려면 맞는 선택임. 다만 GLM 5.3은 OpenRouter에서 Z.AI만 제공하고 Hugging Face에는 안 보여서, 이번에도 완전한 GLM 공개인지 제한 라이선스인지 봐야 함
중국 모델 이름이 Kimi, Qwen, GLM, Z.ai, Ox로 너무 섞여 있어 일반 사용자 충성도를 얻기 어려워 보임. 하나로 집중된 생존자가 나와야 한다고 봄
나는 동의 못 함. 오픈 웨이트 모델을 직접 쓰거나 로컬 실행하는 사람은 이 정도 이름 구분을 어려워하지 않음. Ox는 GLM이고 Z.ai가 GLM 제작사임
내가 헷갈린다고 모두가 헷갈리는 건 아님. 그렇게 복잡한 구조도 아님
소비자가 고객인 것도 아님