Claude Opus 5.5 인텔리전스 지수 58점으로 212개 모델 중 1위, 과제당 비용은 $5.98
- Claude Opus 5.5(Adaptive Reasoning, Max Effort)가 Artificial Analysis Intelligence Index에서 58점을 받아 212개 모델 중 1위를 차지함
- 가격은 입력 100만 토큰당 $4.00, 출력 $20.00이고 지수 과제 하나당 비용은 $5.98로 계산됨
- 지수 평가에서 생성한 출력이 2억 6,000만 토큰으로, 중앙값 8,800만 토큰에 비해 매우 장황함
- 지수 10개 평가를 통합한 v4.3.2로 측정한 결과 이번 모델 평가에만 $8,708.20이 들었음
- 텍스트와 이미지 입력, 텍스트 출력을 지원하며 컨텍스트 창은 100만 토큰(12포인트 A4 용지 약 1,500쪽 분량)임
Hacker News opinions
Opus 5 high effort 대 high effort로 비교하면 과제당 비용이 절반이더라. 이건 진짜 괜찮음.
꽤 크네. Anthropic이 돈에 욕심이 많아서 정반대로 나올 줄 알았는데.
AA가 기본으로 max effort만 보여줘서 토큰 엄청 먹는 모델인 줄 알고 실망했는데, 다른 effort 페이지도 따로 있더라. adaptive reasoning이 뭔지는 아직 모르겠음. 모든 reasoning 단계마다 adaptive reasoning이라고 적혀 있어서.
Astra High가 $1.73으로 Opus 5.5의 $1.82보다 조금 더 쌈.
과제도 대략 절반 시간에 끝나더라. 다만 몇 주 뒤에 Anthropic 모델 서비스가 평소처럼 느려지면 어떨지 봐야 함.
꽤 조용한 출시네. 정식 나오기 전에 꽤 써봤는데 거의 못 느꼈음. 코드 품질이 약간 나아진 정도인데 여전히 그닥임.
모델 능력의 천장에 거의 다다른 것 같음. 훈련을 너무 많이 하니까 사람을 조종하는 모델이 나온다는 얘기까지 나오는 판이고.
출시 몇 주 뒤에 평가를 다시 돌리나? 우리 내부 데이터셋으로 어제 돌려보니 Sol이 Luna와 같은 수준으로 후퇴하더라. 한 번 돌린 거라 확실하진 않지만, 출시 직후에 1등 증명하고 사람들이 갈아타면 발 빼는 게 걱정됨.
이 테스트는 계속 샘플링해야 하고, 모델이 답을 외우지 못하도록 랜덤화도 해야 한다고 봄.
GPT-5.6 Sol의 API 성능은 시간이 지나도 바뀌면 안 됨. 실제로 바뀌었다면 심각한 버그라서 우리가 조사할 거임. (OpenAI에서 일함)
지금 이 페이지는 max 리즈닝 설정 기준임. "펠리컨이 자전거 타는 SVG 만들어줘"를 max로 두 번 시도했는데 둘 다 문제를 생각하다가 128,000 토큰 예산이 다 떨어졌음. max가 답을 내기 전에 오버씽크해서 사실상 쓸모없을 수 있다고 의심 중임.
예산이 있는 사람에겐 Opus 5.5 Medium이 달러당 지능이나 과제당 비용 기준으로 타당함. Max 비용은 완전 미쳤고. 나는 요즘 5.6 Luna에 제일 반가운데 지수 1위가 아니어도 달러당 작업량이 미친 값어치라서임.
Opus 5 Max에게 회사에서 쉬운 줄 알았던 일을 맡겼는데 항상 툴 한도에 걸려서 실패하더라. 같은 일을 High로 바꾸고 툴 사용을 최소화하라 했더니 몇 분 만에 답을 냈고 30분 뒤엔 배포하고 있었음.
이거 3개월 전부터 내가 느낀 건데, medium이 대부분 작업에 맞음. high 이상에서는 같은 문제에 주석이랑 코드만 늘어나고 실질 이득은 없음. 출력이 입력이 되고 다시 출력이 되는 자기재생 루프임.
Message Batches API에서는 output-300k-2026-03-24 베타 헤더를 쓰면 Opus 5.5가 출력 토큰 300k까지 지원함.
이 지수는 못 믿겠음. Opus 5, 26년 최악의 출시 중 하나를 Astra 위에 놓고 있는데 숫자가 올라간 게 뭘 의미한다는 거지?
벤치마크 결과는 모델을 건드리지 않는 한 안 바뀜. 언제 나온 게 뭐가 중요하다고.
이 지수에는 "Astra"나 "Opus 5"가 따로 없고 (모델, reasoning) 튜플마다 항목이 있음. Opus 5 high랑 Astra high를 비교하면 Astra가 전반적으로 나음.