Claude Code Fable 5에 effort 축소 서버 실험 적용 주장
- X 사용자 argofowl은 Claude Code 2.1.236 이상의 Fable 5 세션 일부가 effort 척도를 축소하는 서버 측 실험에 등록됐다고 주장함
- 게시물은 2.1.237부터 Fable 5가 high effort를 기존 low의 10/100과 같은 값으로 읽는다고 주장하며, 변경 기록에는 이 내용이 없었다고 말함
- argofowl은 구버전 Claude Code와 Opus 5는 실험 대상에서 제외됐고, 모든 사용자가 아닌 일부만 영향을 받는 A/B 테스트일 가능성이 높다고 추정함
- 해커뉴스 댓글에서는 effort 값이 시스템 프롬프트로 제어된다면 모델에게 설정을 물어보는 방식이 확인 근거가 될 수 있다는 의견과, 에이전트 하네스의 토큰 예산 제어까지 고려하면 모델 응답만으로는 검증할 수 없다는 반론이 맞섬
- 여러 댓글 작성자는 Opus 5가 단순 작업에 과도한 추론 시간과 토큰을 쓰거나 성능이 떨어진다고 경험을 공유했지만, 이 주장을 뒷받침하는 Anthropic의 공식 확인은 제시되지 않음
Hacker News opinions
나는 이 일만이 아니라 사용량 한도 조절과 백엔드 모델 라우팅도 계속 최적화한다고 의심함. 비용 유인이 너무 큼
나는 alyph.ai로 API를 쓰는데, 채팅 모델은 개인 사용량과 전체 부하에 따라 성능이 크게 달라지는 느낌임. 특히 PST 업무 시간이 나쁘고 API는 덜 영향받는 듯함
트윗만 보면 모델에게 effort 설정을 물어본 게 근거 같은데, 모델이 자기 설정을 어떻게 안다는 건지 모르겠음. 아직 설득되지 않음
내 이해로 effort는 시스템 프롬프트가 전부 제어함. 모델이 그 형식으로 학습됐으니 물어보는 방식도 어느 정도 확인 수단이 될 수 있음
Copilot 추론 출력을 봤을 때 세션 budget을 의식하는 내용이 나온 적 있음. 모델이 effort나 예산 비슷한 정보를 알 가능성은 있다고 봄
모델이 자신을 Opus라고 말해도 실제로는 구형 Sonnet일 수 있음. 얼마 전엔 테스트 문제를 줘서 진짜 Opus인지 성능으로 확인해야 했고, Anthropic이 Opus를 판다고 해놓고 다른 걸 주는 것 같았음
Opus 5에 config 파일을 읽고 새 데이터로 고치라고 했는데 4.6은 2분도 안 걸릴 일을 43분 동안 컨테이너와 샌드박스, 테스트 스위트를 만들며 저장소 전체까지 훑더라. 바뀐 파일은 하나였음
나도 Opus 5가 쓸데없이 토큰을 태운다고 느낌. AI 회사는 필요한 것보다 토큰을 더 쓰게 할 재정적 유인이 있음
회사에서 ChatGPT Pro 승인을 받아 Codex를 써봤는데 속도가 놀랄 만큼 좋았음. 혁명적인 모델이라기보다 요청별 모델 배정과 덜 강한 모델 활용을 Claude Code보다 잘하는 듯해서 Gemini나 OpenCode도 볼 생각임
Opus 5 xhigh는 기초 산수도 잘 못하더라. 예전에는 월 200달러 구독자였는데 Fable 일 이후 20달러로 내렸고, 이제 Codex 한도가 찼을 때만 씀
나도 비슷해서 Opus 5를 피하고 Opus 4.8로 돌아갔음. 4.8은 아직 잘 돌아감
Claude Code 서브 에이전트는 어떤 모델을 써도 사소한 작업에 토큰을 지나치게 많이 씀
같은 100만 컨텍스트의 Max 요금제를 비교해 보니 Opus와 Sonnet 비용 차이 대부분은 Opus가 더 장황해서 생기더라. Sonnet으로 내리기보다 Low 추론을 쓰니 비슷한 비용에서 결과가 더 좋았고 High도 요즘 거의 안 씀
effort가 정말 프롬프트 정보만인지는 모르겠음. 에이전트 하네스가 추론 토큰 예산과 압축을 정한다면 모델은 현재 모드를 볼 수 없어서 틀린 답을 할 수 있음
내 이해로 effort 수준과 기대 행동은 시스템 프롬프트와 학습에 들어가 있음. 출력 전 추론에 쓰는 토큰량을 어느 정도 바꾸지만, 일관성은 다른 LLM 동작과 마찬가지로 제한적임
나는 Anthropic에서 이미 떠났음. OpenAI도 문제가 있지만 Anthropic만큼 심하진 않았음
Anthropic Cyber Verification Program 승인을 받았다가 3개월 뒤 'in review'로 내려갔고 지원 문의도 답이 없었음. 재신청도 막혀서 Codex와 TAC로 옮겼는데, 펌웨어 디버깅 같은 계정 내용 때문에 막힌 거라고 95% 확신함