앤스로픽, Claude Opus 5.5 공개: Opus 5 대비 비용 40% 인하, Terminal-Bench 4.0 66.4%
- 앤스로픽이 Claude 5.5 계열 첫 모델인 Claude Opus 5.5를 공개함. 대부분 작업에서 Claude Fable 5.1 수준 성능을 내고 실행 비용은 Opus 5보다 40% 낮으며 초기 테스터 한 명은 68만 라인 코드 마이그레이션을 하루 만에 끝냄
- 토큰 가격은 백만 토큰당 입력 $4, 출력 $20으로 20% 인하됐고 캐시 읽기는 $0.20으로 Opus 5 대비 60% 저렴해 에이전트·코딩 작업 비용이 크게 내려감
- Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846점으로 선두였으나 AutomationBench 40.0%와 Terminal-Bench-Science 58.7%에서는 GPT-6 Astra(각 41.4%, 64.6%)에 뒤짐
- Frontier Design과 METR의 출시 전 외부 평가를 거쳤고 자동 행동 감사에서 역대 최고 점수를 받아 경계를 벗어난 행동이 줄고 프롬프트 주입 저항력이 Opus 5보다 강해짐
- 생물학·사이버보안 능력이 Claude Mythos 5.1 수준이라 해당 용도는 생명과학 검증 프로그램과 사이버 검증 프로그램을 통과한 조직과 실무자에게만 열리며, Opus 5의 장황한 문체를 고쳐 중요 정보를 앞세우도록 바꿈
Hacker News opinions
어제 장애 때 Mythos 5.1, Fable 5.1, Opus 5 전부 에러율이 올라갔었는데 이런 모델들이 개발 도구의 하중을 받치고 있어서 장애가 더 크게 느껴졌음.
Opus 5 문체가 진짜 최악이었는데 5.5에서 좀 잡혔으면 좋겠음.
100% 해결은 아닌데 concise output style 켜면 꽤 괜찮아졌더라.
랜딩 페이지 스크롤 UX가 끔찍함. 그냥 내용만 보여주면 되는 거잖아.
켜면 멀쩡한 버전 나옴. accessibility 설정에서 reduce motion 켜니까 정상 페이지가 나왔음.
Firefox에서는 성능도 별로라 히어로도 못 지나갔음.
이렇게 되면 Fable 자리가 애매해지는 거 아닌가?
곧 새 Fable 나오겠지. 근데 벤치마크 점수는 이제 신뢰가 안 가서 실사용에서 어떻게 보이는지 봐야 함. Opus 5도 Fable급이라고 했었거든.
우리 팀은 Opus 5 못 써먹어서 대부분 Opus 4.6으로 되돌아갔음. 5.5로 갈아탈 수 있으면 좋겠는데.
같은 작업 같은 코드베이스인데 LLM 어휘가 계속 바뀌는 이유를 모르겠음. 이거 연구한 거 있나?
코드 청크 하나 붙여넣고 리뷰 시켜봤는데 cadence가 그대로임. claudism이 조금 줄어든 정도라 글쓰기 개선은 지켜봐야겠음.
pace the frontier 하자고 해놓고 바로 내놓았는데, 다 같이 안 늦추면 슬로우다운은 말이 안 됨.
HAProxy를 C에서 Rust로 옮기는 테스트를 돌렸다는 건 좀 놀라웠음.
가격 40% 인하는 반가운데 작업당 출력 토큰이 더 많이 나온다는 소문이 있어서 토큰 효율을 봐야 판단이 됨.
이번엔 사용량 리셋이 'Reset for free' 버튼으로 바뀌었더라. 10월 22일까지 쓸 수 있고 원할 때 활성화하는 방식임.
그건 codex 방식 그대로 베낀 거임.