xAI, Grok 4.6 공개, 장기 에이전트 작업 강화하고 GPT-5.6 Sol과 벤치마크 동률
- xAI가 Grok 4.5 후속작인 Grok 4.6을 공개, 장시간 실행되는 에이전트 작업과 시각/인터랙티브 프로젝트 완성도에 초점을 맞춤
- Artificial Analysis Intelligence Index(9개 벤치마크 종합 점수)에서 61점을 기록해 GPT-5.6 Sol Max와 동률을 이뤘고 Fable 5 Max(62점)에는 근소하게 뒤처짐
- 가격은 입력 토큰 백만개당 $2, 출력 토큰 백만개당 $6이며 더 빠른 변형 모델은 가격이 2배임
- Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare에서 바로 사용 가능하고 출시 첫 주는 Grok Build와 Cursor 내 사용량을 2배로 제공함
- 훈련 과정에서 Grok 4.5로 SFT 트레이젝토리를 재생성하고 커널 최적화, 웹 개발, CAD 등 도메인별 강화학습 환경을 폭넓게 활용함
Hacker News opinions
DeepSeek-V4-Pro-0813 나온 직후에 이거 발표하는거 일부러 그런거 아니냐, 타이밍이 묘함
Cursor 블로그에도 올라왔던데, xAI-Cursor 인수 아직 마무리 안 됐는데 Composer는 어떻게 되는거지
Fable급 성능인데 더 빠르고 훨씬 싸다니, 이건 진짜 놀랍다
벤치마크 대부분에서 GPT-5.6-Sol 이기고, API 가격은 Kimi K3보다 싸고, Cursor 구독 사용량도 후하게 줌
가격 때문에 Grok으로 갈아탈까 고민 중인데, Opus 4.8이 워낙 좋아서 다른 모델 만지는 게 아깝게 느껴짐
내가 써본 바로는 Grok 4.5는 Opus급은 아니고 Sonnet이랑 Opus 중간 정도, 굳이 따지면 Sonnet에 조금 더 가까움, 4.6은 두고봐야 알듯
나치 모델이 벤치마크는 잘 나오네, 근데 나는 안 씀, 머스크가 RL을 자기 말투처럼 만들려고 손대는거 자체가 소름끼침
싫든좋든 실제로 나치 발언이랑 CSAM 생성 문제로 소송까지 걸린 회사인데 그거 지적하는게 왜 틀린말이냐
가격 페이지는 아직 업데이트 안 됐고 여전히 4.5로 표시되어 있음
Fable 나온지 2개월 만에 모든 대형 랩이 갑자기 Fable급 모델을 낸게 너무 이상함, 연구 인력 이동이나 증류로는 설명 안 되고 벤치마크 조작 가능성이 제일 그럴듯함
그냥 Anthropic한테 특별한 moat이 없었던거 아니냐, 다들 GPU랑 데이터랑 기법만 있으면 비슷한 수준까지 갈 수 있는거고
나는 벤치마크 조작파임, GPT-5.6 Sol도 Fable급이라 불렸는데 일주일 써보니까 그냥 RLHF로 집요함만 최대치로 올려놓은거였음, 작은 인증 티켓 하나 줬는데 3시간 넘게 돌면서 2만5천줄 넘게 코드 써놓고 실제로는 대부분 쓸모없는 과잉 엔지니어링이었음