OpenAI, GPT-6.1 Sol 공개: Astra에 근접한 성능을 5분의 1 가격에
- OpenAI가 GPT-6.1 Sol을 공개함. 입력 100만 토큰당 $2, 출력 $10, 캐시 입력 $0.10으로 GPT-6 Astra(입력 $10, 출력 $50, 캐시 $1)에 근접한 성능을 5분의 1 가격에 내세움
- DeepSWE v1.1에서 GPT-6 Astra와 같은 점수를 약 5분의 1 비용에 냈고, GPT-6 Sol의 최고 점수는 6.4%p 앞섰음. 더 낮은 추론 노력과 비용에서 나온 결과임
- AutomationBench에서 Opus 5.5보다 2.2%p 높은 점수를 약 3분의 1 비용에 기록했고, OSWorld 2.0 오프라인 세트에서는 GPT-6 Sol보다 7%p 높은 점수를 절반 이하 비용에 냈으며 Astra에는 2.1%p 차이로 붙었음
- Terminal-Bench Science 0.1에서 GPT-6 Sol 점수를 2배 이상으로 늘렸고 작업당 평균 $5.47로 Opus 5.5($23.21)와 Astra($23.80)보다 75% 이상 저렴함. 다만 최고 점수 68.1%는 Astra가 유지함
- 낮은 추론 노력에서 사실 오류가 포함된 응답 비율을 11.4%에서 7.7%로 줄였음. 약 32% 감소임
Hacker News opinions
어제 안전 문제 때문에 못 낸다는 헤드라인 있지 않았나? 그건 6.1 Astra고 이건 Sol임. Astra는 Opus 5.5를 여전히 못 넘어서 보류한 것 같고, 이건 그래도 괜찮은 성과임. 6-Sol은 진짜 별로였음.
사용량 집계 방식 바꾼다고 발표한 다음에 API 가격 내리는 건 뻔한 수순임. 엔터프라이즈 시장 생각하면 다 맞아떨어져.
Opus 5.5 절반 가격이면 도전장 던진 거지.
6이 지난주에 나온 것 같은데 벌써 6.1이야? 6이 너무 실망스러워서 급하게 만든 것 같고 Opus 5.5에 놀린 것도 있을 듯.
토큰 가격이 주된 싸움터가 된 게 업계랑 투자자한테는 불길한 신호임. Anthropic이 올해 IPO 하는 이유일 수도 있어. 소비자한테는 대역폭 값이 싸진 것처럼 좋은 일이지만.
중국이 LLM에 독일차에 했던 짓을 할 거임. 오픈웨이트가 이미 토큰 지출의 60%쯤이고 glm 5.x가 SOTA에 꽤 근접해 있어. 규제 요구가 쏟아지는 이유기도 하고.
능력 정체기에 부딪혀서 갑자기 속도 조절하자는 거라는 증거가 하나 더 쌓인 셈임. 모델이 더 똑똑해지지 않아도 지금 능력을 싸게 만드는 것만으로 큰 이득인데, Nvidia만 빼고.
모든 축에서 경쟁하는 건 정상임. 아무도 모든 축을 다 이길 수 없으니 축으로 만든 다면체 안에 각자 니치가 생기는 거지. DeepSeek과 Grok은 그걸 이해하는데 나머지 회사들은 항상 모든 걸 잘해야 한다고 생각하는 게 이상함.
모델이 그렇게 똑똑하면 태스크에 맞는 모델을 스스로 고르면 안 되나?
모델 전환은 컴퓨트 비용이 엄청 큼. 처음부터 다시 돌려야 해서 Cursor가 한동안 시도했다가 대부분 껐어. 모델들은 지식 컷오프 때문에 자기 자신은 물론 최신 모델도 모르고, 기본값은 자기가 아는 모델 중에서 고르는 쪽이라 나는 GPT 6 Luna 같은 목록을 컨텍스트에 넣어두고 계속 갱신 중임.
Github도 그걸 하려고 하고 있음. Copilot project-hydra 찾아봐.
출시 주기가 빨라진 이유가 뭐임? RSI인가? 아님. DeepSeek 기술 논문 대응이고 중국 모델 압박임. SWE 하는 친구들 다 중국 모델로 갈아탔고 나도 QWEN, GLM 쓰면서 OpenAI랑 Anthropic API는 비용 때문에 끊었어.
버전은 마케팅이고 숫자는 올라가야 함. 두 랩이 서로 눈치 보면서 동시에 뭔가를 내는 것도 그렇고.
구독 allowance를 절반으로 줄여서 Codex 사용자 입장에선 잘해야 2.5배 저렴해진 것임. Claude Sonnet 5.5 API 가격에 맞춘 것 같은데 Claude Code 구독 allowance가 훨씬 넉넉해 보이더라.
6-Sol이 광고만큼 안 좋아서 간단한 리팩토링에서도 5.6-Sol보다 품질이 떨어진 게 느껴졌음. 이번엔 좀 나아야 할 텐데.