Anthropic이 Claude Haiku 5.5를 공개, Haiku 4.5보다 평균 75% 저렴하고 GDPval 점수는 735에서 1620으로 상승
- Anthropic이 Claude Haiku 5.5를 공개함. Haiku 4.5 대비 평균 약 75% 저렴하고, GDPval-AA v2.1 점수는 735에서 1620으로 올랐음(Sonnet 5.5는 1840, GPT-6 Luna는 1437).
- 요금은 100,000 토큰 이하 요청이 입력 $0.10/MTok, 출력 $0.50/MTok이고 초과분은 입력 $0.50, 출력 $2.50으로 오름. Haiku 4.5의 $1 입력 / $5 출력보다 싸며, Anthropic은 Haiku 4.5 요청의 90%가 10만 토큰 이하 구간이었다고 밝힘.
- Sonnet 5.5의 캐시 읽기 가격을 절반으로 내려 대부분의 agentic 작업 비용이 약 20% 줄고, Claude Max와 Team 구독자에게 월간 API 크레딧을 지급함.
- Haiku급 모델로는 처음으로 effort 설정을 조절할 수 있어 비용과 지능 사이를 사용자가 선택함.
- 벤치마크는 OSWorld 2.1 72.4%(Haiku 4.5는 15.7%), Terminal-Bench 4.0 39.2%(0.0%), Humanity's Last Exam 45.9%임. Asana는 작업 완료 지연 30% 감소와 에이전트 턴당 최대 2.5배 빠른 추론을, HubSpot은 CRM 평가에서 92.8% 점수를 보고함.
Hacker News opinions
LLM판 무어의 법칙 같은 게 있나 궁금함. Epoch AI 보면 2023년부터 같은 성능 달성 비용이 분기마다 47%씩 떨어져서 연 13배라더라.
작은 모델이 똑똑해지는 건 불필요한 정보를 버리고 추론으로 다시 도출할 수 있어서라고 봄. 대신 작업마다 추론 토큰을 더 써야 하지만.
Sonnet 캐시 읽기 가격 인하는 반가움. GPT-6.1 Sol이랑 가격 맞추려면 어차피 해야 했던 거고, 예전 캐시 가격에서는 Opus 5.5 대신 Sonnet 5.5 쓸 이유가 없었음.
근데 10만 토큰 컷오프는 너무 낮지 않나. 에이전트 굴리면 순식간에 넘는데, Haiku한테만 적용되는 것도 이상하고.
그건 니 느낌이고 발표문 보면 Haiku 4.5 요청 90%가 10만 토큰 이하 구간이었음. 요약이나 분류, 컴팩션 같은 작업은 그 안에서 끝남.
토크나이저 차이도 있음. Claude 10만 토큰이 GPT로는 6만에서 6만5천 토큰쯤이라 Luna의 272k 컷오프랑 실제 거리는 훨씬 멀어.
분류 작업은 Jev 대안이랑 붙는 시장인데 Anthropic도 OpenAI도 $0.10/M이고 Jev는 $0.04/M이라 아직 2.5배 비쌈.
10만 컨텍스트로 코딩 못 하면 모델이나 하네스가 깨졌거나 실력 문제임. 나는 트리아지나 탐색 서브에이전트로 주로 씀.
Haiku 5.5가 GPT-6 Luna보다 확실히 똑똑하고 일부 코딩 벤치에서는 Sonnet 5도 이기더라. 잘 정의된 티켓 구현 같은 건 진짜 잘함.
Mimo나 GLM은 10분의 1 가격인데 굳이 Haiku 쓸 이유가 있나 싶음.
토큰당 정액 가격이 오히려 이상한 거임. 인코딩과 디코딩이 컴퓨트에 선형이 아니라서 구간을 나눈 게 실제 원가에 가까워지는 것뿐.
Anthropic이 드디어 Haiku를 업데이트했네. Asana가 지연 30% 줄었다는 것도 그렇고, 이제 Opus한테 파일 편집을 맡겨봐야겠음.