SpaceXAI, Grok 4.7 공개. Grok 4.6과 같은 $2/$6 토큰 가격에 CursorBench 4.0 46.3%
- Grok 4.7은 입력 $2·출력 $6/백만 토큰으로 Grok 4.6과 가격이 같고, 출력 속도 2배 변형은 가격도 2배임
- CursorBench 4.0에서 46.3%로 Grok 4.6(40.4%), GPT-5.6 Sol Max(41.7%)를 앞섰고 Fable 5.1 Max(51.8%)에는 뒤졌으며, Terminal-Bench 4.0은 20.3%에서 38.0%, Harvey Legal Agent Benchmark는 15.8%에서 19.6%로 올랐음
- 새 안전 스택으로 HackerBench v0.3에서 위험한 이중용도 프롬프트의 3.3%만 통과시키고, LatchBio 바이오안전 벤치마크에서 62.4%로 1위를 기록했으며, 일부 보안 파트너에 레드팀 기능을 초대 전용으로 제공하기 시작함
- Grok 4.6보다 큰 베이스 모델을 수시간 걸리는 과제 위주로 더 오래 강화학습했고, 자기 작업 검증과 긴 컨텍스트 관리가 나아졌으며 Grok Bot 하네스를 네이티브로 이해하도록 학습함
- Cursor와 Grok Build에서 오늘부터 쓸 수 있고 API, 서드파티 코딩 하네스, 모델 라우터와 클라우드 플랫폼으로도 제공되며, xHigh 추론 레벨이 새로 추가됨
Hacker News opinions
cursor에서 grok 몇 달 써봤는데 trae.ai보다 결과가 훨씬 좋더라
난 개인 채팅으로는 grok이 Claude, ChatGPT, Deepseek 중에 제일 별로였음. 성격도 밋밋하고 일을 하려는 의욕도 없음
openrouter로 같은 프롬프트를 qwen, deepseek, gemini, grok에 돌려봤는데 grok이 리서치는 잘하고 헛소리는 덜 하더라. 비판적으로 보라고 하면 특히 그럼
내 경험도 비슷함. grok은 시작하자마자 Done! 하고 끝내버림. 제일 게으르고 제일 정직하지 않은 모델이라 진지한 코딩엔 못 씀
LLM에 성격이 필요한가? Claude에서 사람들이 싫어하는 게 바로 그 성격인데
4.7이 4.6보다 가중치 40% 많으면서 가격은 6 그대로임. 마진도 줄고 출시도 2주 밀린 걸 보면 xAI가 4.7 결과에 만족 못 한 듯. Opus 5.5 하루 전에 낸 것도 그렇고. 요즘 벤치는 못 믿겠음. Grok 4.5가 Fable 5가 못 푼 buildroot 문제를 풀었고 cursor 이후 grok은 프론트엔드에서 굉장히 좋음. ruby 백엔드는 Claude가 낫지만. 새 grok이 평이한 영어로 말하는 게 제일 마음에 듦
토큰 가격만으론 토큰 효율을 알 수 없으니 별 의미 없음
맨 위 그래프에 Astra가 빠진 건 실수로는 안 보임. 그 모델이랑 비교하면 안 좋게 나오니까 뺀 거 아님? OpenAI가 Cursor에서 빠져서 그 벤치가 아예 없다는 답도 있긴 한데
Grok build 안에서 쓰면 꽤 쓸만함. 군더더기 없고 자기 길로 감. Grok bot도 좋았음
4.6이랑 grok build 경험은 좋았음. tscircuit으로 공간 추론 필요한 코드를 쓰게 했는데 잘 하고 claude로 검사시켜도 고칠 게 없다고 나옴. 4.7은 가격을 안 올린 걸 보면 크게 좋아질지 의문
Omp에서 4.7 써봤는데 심각함. thinking 모드에서 Fix 1, Fix 2... Fix 81 이러면서 루프 돌고 AGENTS.md 무시하고 플랜 파일 깨뜨림. 5.6 Sol을 watchdog으로 붙였더니 매 턴마다 막힘. 4.6은 이 정도 아니었는데 아쉬움
4.6엔 x-high 추론 레벨이 없었음. xhigh는 grok에 새로 들어온 거라서 4.7 xhigh와 4.6 high를 비교한 것
simonw의 펠리컨 자전거 SVG 벤치 기다림. AA 보면 4.6보다 토큰 효율은 훨씬 나쁘다고 나옴
Grok 비쌈. DeepSeek 4.1 Flash로 훨씬 싸게 좋은 결과 나옴
그거 쓰레기임. 거의 쓰레기 코드만 뽑아냄
출시 주기가 빨라진 건 좋음. cursor 팀이 자기 컴퓨트로 만든 결과물 같고 grok 5에서 크게 좋아질 듯