앤스로픽, Claude Sonnet 5.5 공개: Terminal-Bench 4.0 70.6%로 Opus 5.5 앞서고 작업당 비용은 최대 30% 절감
- 앤스로픽이 Claude 5.5 패밀리의 두 번째 모델 Sonnet 5.5를 2026년 9월 28일 공개했다. Sonnet 5보다 30% 이상 빠르고 작업당 비용은 최대 30% 낮으며, 가격은 입력 $2/M, 출력 $10/M, 캐시 읽기 $0.20/M로 전작과 동일하다
- 에이전트 코딩 평가 Terminal-Bench 4.0에서 70.6%를 기록해 Sonnet 5의 10.3%를 크게 앞섰고 Opus 5.5의 66.4%도 넘어섰다. CursorBench 4.0은 55.5%로 Opus 5.5의 57.8%에 근접했다
- 지식 노동 평가 GDPval-AA v2.1에서 1844점을 받아 Opus 5.5의 1846점과 사실상 동급이다. FrontierCode 1.1에서는 52.1%(xHigh)로 Opus 5.5의 54.4%보다 낮고 GPT-6 Sol의 49.3%보다 높다
- 사이버 능력이 Opus 5급이라 Sonnet 모델 최초로 사이버 안전장치와 폴백을 적용했고, 고위험 사이버 요청은 Sonnet 5로 되돌린다. 생물학 안전장치는 Sonnet 5와 같고 일상적인 소프트웨어 개발과 대부분의 생명과학 작업은 영향받지 않는다
- 고볼륨·비용 민감 용도로 설계된 Claude Haiku 5.5가 몇 주 안에 Claude 5.5 패밀리에 합류할 예정이다
Hacker News opinions
에이전트 코딩 벤치만 보면 Opus 5.5랑 거의 1:1임. Terminal-Bench 70.6 대 66.4, FrontierCode 52.1 대 54.4, CursorBench 55.5 대 57.8이고 Sonnet이 몇 개는 앞서기까지 함.
Sonnet 5는 에이전트 코딩 API 가성비가 최악이었음. GLM-5.3 Flash가 20분의 1 가격으로 압살했는데 이제야 격차가 좁혀진 거임.
그럼 이 동급 모델들을 도대체 왜 이렇게 찍어내는 거야? 점점 비슷한 것만 나오는데.
$200 내고 Cyber Verification Program에도 들어가 있는데 승인된 버그바운티 작업에 Opus 5.5도 Sonnet 5.5도 못 씀. 바로 Cyber 플래그 뜸. 안전장치가 엉망임.
나도 그냥 fuzz라는 단어 썼다고 플래그 먹음. 보안 맥락도 아니었는데.
CVP 문서 맨 위 보면 Opus 5.5에는 적용 안 된다고 적혀 있더라. 5.5는 곧 확대한다고만 하고. 애초에 기대를 하면 안 되는 프로그램임.
대학 때 쓴 30년 된 C 코드 좀 봐달라고 했더니 가드레일 걸림. 버퍼 오버플로 투성이긴 했지만 나도 아는 사실이었음.
스마트홈용 ESP32 블루투스 재실 감지 하려다 바로 플래그 먹고 Sonnet 4.6으로 강등됐음. Codex로 가니까 아무 문제 없었음.
2003년산 C++ 컴파일러 분석이 현대 사이버보안이랑 무슨 상관이냐고 설득하려고 계속 싸우는 중임. IDA Pro나 Ghidra는 이런 제약이 없음.
플래그 먹고 앤스로픽에 대한 신뢰가 순식간에 사라졌음. 인터넷에서 긁어다 학습한 걸 이제 와서 게이트키핑하는 게 이해가 안 됨.
벤치마크마다 Fable 숫자가 빠져 있는 게 눈에 띔. 가격/성능 파레토에서 밀려난 거 아니면 일부러 뺀 거임.
비용 파레토 차트를 서로 갈아치우는 게 재밌음. 며칠 전엔 OpenAI가 앞서 보였는데 일주일도 안 돼서 Anthropic이 다시 가져갔음.
Sonnet 5는 벤치만 잘 나오는 느낌이었음. 회사 코드베이스 품질이 확 떨어졌고 말도 안 되는 여러 줄 주석이 난무하게 됨.
5.5는 확실히 낫긴 한데 Fable 품질에는 아직 못 미친다고 봄. 일단 평가 기간을 길게 두고 쓰는 게 맞음.
사이버 능력만 보면 Opus 4.8이 정점이고 그 이후 모델은 전부 더 나쁜 모델로 폴백하는 셈임.
모델이 똑똑해지는 속도보다 효율이 좋아지는 속도가 훨씬 빠른데, 마케팅 각도에서는 그게 더 임팩트 있어 보이니까 Fable을 뺀 거임.