샤오미 MiMo-V2.6-Pro, 오픈웨이트 지능지수 46점으로 1위… 학습비 $3.47M 공개
- MiMo-V2.6-Pro는 Artificial Analysis 지능지수 46점을 기록해 오픈웨이트 모델 114개 중 1위에 올랐고, 비교 대상 모델 중앙값 18점을 크게 웃돎
- 총 파라미터 1.0T에 토큰당 활성 42B, 1M 토큰 컨텍스트, MIT 라이선스이며 텍스트·이미지·음성·영상 입력을 받고 텍스트만 출력함
- 출력 속도 124.5 tok/s, 입력 100만 토큰당 $0.435·출력 $0.87이고 캐시 할인 99%가 적용돼 캐시 가격은 100만 토큰당 $0.0036까지 내려감
- 지능지수 평가에 140M 토큰을 써서 총 $206.66이 들었고, 샤오미가 밝힌 RL 학습 비용 $3.47M은 빅5의 추정치 $100M 이상과 큰 차이를 보임
- 해커뉴스에서는 지능지수 46점이 DeepSeek-V4.1의 39점보다 높은 점과 페이지의 '중앙값 140M' 표기 오류를 두고 의문을 제기함
Hacker News opinions
지능지수 설명에 자기 토큰도 140M인데 중앙값도 140M이라고 적혀 있음. 이런 오타는 오히려 사람이 만든 흔적이라 반가움.
MiMo가 46점인데 DeepSeek-V4.1은 39점인 게 좀 수상함. 샤오미 부록 보면 DeepSeek이 MiMo를 앞서는 항목도 있는데 격차가 너무 큼.
AA 벤치는 계속 바뀜. Astra가 GPT 5.6 Sol 대비 개선이 없다고 나오자 크게 갈아엎었고, Fable 5.0을 직접 목록에 넣어보면 Opus 5가 아직 1점 앞섬.
어려운 건 내 쓰임새를 반영하는 벤치를 찾는 일임. 남의 순위표만 보고 판단하기는 어려움.
DS 4.1은 flash라 똑똑한 편은 아님. 계획 없이 시키면 규칙적으로 탈선함.
직접 벤치 돌려보니 DeepSeek보단 빠르지만 최상위 모델보단 훨씬 느렸음. 그래도 가격이 진짜 강점임. KillSwitch-Bench에서 Opus 5 66.9, Astra 57.9, Fable 5.1 46.7, MiMo 38.8, Muse Spark 36.5 나왔음.
속도는 수요에 따라 널뛰기함. 어젯밤엔 80 tok/s 넘게 나왔음.
OpenAI 사용량 제한이 심하게 줄고 성능도 떨어지는 것 같아서 이제 중국 모델을 진지하게 써보려 함. 느려도 매일 같은 성능이 나오면 됨.
Codex에 $200씩 내는데 예전엔 일주일치 작업이 나왔는데 이제 1~2일치임. 새 모델 나올 때마다 쓰던 모델이 멍청해지는 느낌인데 증거는 없음.
그 지능 하락설, 진짜 증거가 있음? 2023년부터 계속 나오는 얘긴데 추적 사이트를 보면 그냥 평평한 선임.
Sol 5.6 xhigh 잘 쓰다가 이번 주엔 제한에 계속 걸림. MiMo 2.6 Pro 초기 결과가 UI 외 작업엔 괜찮아서 지출을 옮기는 중임.
샤오미가 밝힌 $3.47M는 RL 학습 비용만임. 발표 블로그에도 그렇게 적혀 있고, 그래프가 0에서 시작하지 않는 걸 보면 사전학습은 별도임.
사전학습을 거의 안 한 모델이 DeepSWE v1.1에서 48점이 나오겠음? 비용 숫자를 그대로 받아들이긴 어려움.
중국 연봉은 샌프란시스코보단 낮지만 유럽 수준은 됨. 선전 물가가 훨씬 싸서 그런 면도 있음.
Mimo 2.5는 좋았는데 루프를 너무 많이 돌았음. 원샷 용도로 썼는데 2.6에서 고쳐졌으면 함.
위에는 1/114라고 써 있는데 그래프를 보면 아닌 것 같음.
#1/114에 마우스를 올려보면 오픈웨이트 모델끼리만 비교한 거임. 그래서 순위가 다르게 보임.