xAI Grok 4.6, Artificial Analysis 지능지수 61점으로 GPT-5.6 Sol급 프론티어 합류
- Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록해 Grok 4.5보다 5점, Grok 4.3보다는 23점 올랐고 GPT-5.6 Sol과 동급, Claude Opus 5(63점)와 Claude Fable 5(62점)보다는 낮음
- 실사용 에이전트 작업 벤치마크 GDPval-AA v2에서 Elo 1753으로 Claude Opus 5 다음이며, $2/$6 입출력 토큰 가격은 Grok 4.5와 동일하게 유지되어 Claude Opus 5($5/$25), GPT-5.6 Sol($5/$30)보다 60% 이상 저렴함
- 작업당 비용은 $0.84로 Kimi K3와 같은 수준이면서 지능은 더 높아 Intelligence vs Cost per Task 파레토 프론티어에 위치함
- 장기 에이전트 작업 벤치마크 AA-Briefcase에서 Elo 1577로 Fable 5급이며, 평균 53턴/0.5B 입력 토큰으로 작업을 끝내 Claude Opus 5(max)의 103턴/2.0B 토큰보다 훨씬 효율적임
- 캐시 히트 가격은 Grok 4.5의 1M당 $0.3에서 $0.5로 올랐고, 해커뉴스 댓글들에서는 실제 코딩 체감 성능에 대해 호평과 회의적 반응이 갈리며 xAI 신뢰성 논란도 함께 제기됨
Hacker News opinions
Cursor가 Grok 4.5부터 프론티어급 모델을 진짜 저렴하게 쓸 수 있게 해줬음. 하위 플랜에서도 Grok이랑 Composer 토큰을 엄청 많이 쓸 수 있어서 OpenAI나 Anthropic보다 훨씬 오래 씀
OpenAI가 리셋 크레딧으로 사람들 화나게 만든 이번 주 사태 보니까, 이런 거 믿고 쓰다가 나중에 당할 수도 있음. 그거 보고 나도 그냥 openrouter로 직접 모델 골라서 쓰는 코딩 에이전트 만들기로 함
Cursor가 $10B에 인수한 데이터가 xAI 학습에 엄청 값진 자산이었을 거라고 봄. 거기에 GB300 물량까지 더해지니 이 정도 성능 나오는 거 아닐까
코딩에 Grok 쓰는 사람 나는 한 명도 못 봤음
나 씀. Claude 쓰다가 Grok 4.5, 특히 얼리 액세스로 쓴 4.6로 넘어왔는데 다시 Claude로 안 돌아가고 싶음. Claude보다 3배는 빠른데 엔지니어링 품질 차이는 못 느끼겠음
내 벤치마크 돌려보니 Grok 4.5는 Opus나 ChatGPT보다 한참 밀리고 Gemini보다는 나은 수준이었음. 그래서 이번에 GPT-5.6 Sol급이라는 거 좀 의심스러움
우리 회사 SWE들 다수가 Grok을 메인으로 씀. Claude, ChatGPT, Cursor 다 무제한으로 쓸 수 있는데도 그럼. 말투랑 성능, 속도가 괜찮아서 쓰는 거지 싸서만은 아님
나는 그 회사 때문에 그 제품 자체를 안 씀
일론 못 믿어서 Grok에는 한 푼도 안 주고 싶음. 세계 최고 부자가 그 돈으로 선거에 개입하는 거 보면서 정 떨어짐
4.5부터 캐시 읽기 가격이 $0.30에서 $0.50으로 거의 두 배 뛴 것 같음. 코딩할 때 토큰 비용의 80%가 캐시 읽기/쓰기라서 이거 꽤 크게 느껴짐
모델 크기가 3배로 커진 거 아닐까 싶기도 함
Grok이 최고는 아니지만 가격 대비 기본은 확실히 함. 아직 프론티어 수준 수학은 못 미는 것 같음
GLM 5.2보다 훨씬 안 복잡하고 빠르게 써지는 게 장점임. 가격 대비 성능 괜찮음
일론이 Cursor 데이터 산 게 결국 신의 한 수였던 듯. 4.5도 이미 꽤 능력 있는 모델이었음
SpaceXAI가 자체 데이터센터에 곧 칩 공장까지 가진 유일한 프론티어 업체라서, 결국 더 싼 토큰에 비슷한 지능으로 앞서갈 거라고 봄. 내 경험상 Grok 빌드가 Claude Code보다 2~5배는 빠름