Fable 5 구독 영구 제공 뒤 사고 토큰 급감, 6주 측정에서 8월이 7월보다 크게 줄어
- Fable 5를 구독 요금제에 영구 제공한 뒤 성능이 떨어졌다는 관측에서 시작해 다섯 가지 방식으로 측정한 결과, 8월의 사고 토큰이 7월보다 크게 줄었음
- 하락은 일시적이지 않고 6주 내내 이어졌으며 며칠 단위로 등락했고, 일부 등락은 특정 제품 발표와 릴리스 시점과 겹쳤음
- xhigh나 max 노력 수준을 쓰는데도 대부분의 호출이 사고 토큰을 거의 받지 못했고, 긴 추론이 일어난 경우에도 공개 벤치마크 수준에 거의 도달하지 못했음
- 작성자는 모델이 멍청해졌다고 느껴질 때 너프 여부를 묻지 말고 자신이 받은 추론 환경(inference regime) 을 물어야 한다고 주장함
- 댓글에서는 사고 토큰이 클라이언트로 전달되지 않아 측정 방식이 불분명하다는 지적이 나왔고, Opus와 gpt-5.6-luna 등 다른 모델에서도 주 단위 성능 기복을 겪었다는 사례가 이어짐
Hacker News opinions
Anthropic이 컴퓨트 아끼려고 모델 성능을 건드린 적 없다고 공개적으로 말했던 걸로 기억하는데, 나는 Opus 쓰면서 주마다 성능 기복이 크다는 걸 체감했음. 공식 해명이 뭔지 궁금하네.
지난번에 같은 문제가 제기됐을 때 돌아온 답은 Claude Code 자체의 회귀였다는 거였음. 어느 쪽이든 바이브코딩에는 안 좋은 그림이었는데 그냥 넘어갔지.
Anthropic은 매주, 어쩌면 매일 최적화를 배포하면서 A/B 테스트를 돌림. 모델 성능을 조작하진 않아도 실험은 활발하게 하고 있음.
사고 토큰을 어떻게 측정한 거임? 그건 클라이언트로 안 돌려주잖아.
토큰 사용량 자체는 알려주니까 자기 소비량은 볼 수 있음. 그 수치를 어떻게 해석했는지가 관건이지.
모델 X가 AGI급이라며 벤치마크를 다 이기고, 다음 날 Y랑 Z도 다 이기고, 몇 주 뒤엔 양자화됐네 추론이 나빠졌네 하고 난리남. 나라면 그 돈으로 좋은 커피 사 마시겠음.
단계가 몇 개 빠졌는데. 첫째 우리 모델이 세상을 끝낼 거라는 경고, 둘째 거의 AGI, 셋째 다음 주 제한 공개, 넷째 200달러 구독자 전원 공개, 다섯째 20달러 구독자도 공개. 구글은 검색할 때마다 원하든 원치 않든 모델을 밀어 넣는 단계가 하나 더 붙고.
블루보틀이 커피를 물에 타면 커피를 끊고 차를 마셔야 함? 벤더가 실제로 뭘 주는지에 대한 증거를 공유하는 건 중요한 일임.
그래도 쓸 만한 AI는 필요함. AI 없이 일하면 생산성이 5분의 1로 떨어지고, 중국 회사에 돈 주긴 싫은데 서구 회사 중에 공개 모델을 구독제로 주는 곳이 없음.
나도 비슷하게 느낌. 프런티어 모델과 몇 주 붙어서 브레인스토밍하다 보면 1주차와 8주차 성능 차이가 큼. 처음엔 유능한 연구 조수 같더니 8주쯤 되면 간식 받으려고 꼬리 치는 강아지가 됨.
비결정적인 시스템에서 반복 가능한 테스트를 어떻게 만듦? 같은 프롬프트를 보내도 매번 다른 답이 나오는데.
토큰 자체는 비결정적이어도 불변일 프록시 지표를 보면 됨. 벤치마크 정확도나 복잡한 문제에서의 사고 수준 같은 것.
진짜 Fable은 6월에 며칠 있었던 그 버전이라고 봄. 정부가 시장에서 내린 뒤에 조금 너프됐고, 지금 건 그보다 못하지만 여전히 쓸 만함.
나도 그렇게 봄. Fable은 밴 이후로 예전 같지 않음. 가드레일을 강화하려고 시스템 프롬프트를 건드린 게 성능을 깎았을 가능성이 큼.
Anthropic이 높은 추론이 필요 없다고 판단한 작업에서 비용을 아끼려고 자동으로 성능을 낮추는 방식을 찾고 있는 게 분명함. 나는 항상 max 추론을 쓰는데 출시 직후와 3, 4주 뒤 차이가 뚜렷하고, 새 계정에는 지능 부스트를 주는 것 같기도 함.
어제 gpt-5.6-luna 얘기를 했음. 출시 첫 주에 Hermes 기본 모델로 썼을 땐 5.5만큼 좋았는데 2, 3주 사이에 확 멍청해짐. 예전엔 서버 로그 확인해달라고 하면 알아서 했는데, 이제는 ssh로 들어가서 journalctl을 돌리라고 직접 시켜야 함. 나는 medium 추론 수준 씀.
똑같음. 두 달 동안 Fable이랑 Sol을 매일 몇 시간씩 썼는데 요즘 둘 다 DeepSeek4.1 수준까지 내려옴. 여전히 낫긴 한데 차이가 크지 않고 스트레스는 비슷해짐. Ultra M5 256을 사서 친구들이랑 비용 나눌까 고민 중임.
양자화된 모델로 배정되느냐의 운 문제인 듯. luna xhigh도 하루하루 지능이 확 달라짐.
이게 AI나 분산 시스템처럼 특정 분야 사용자에게만 나타나는 건지, 전반적인 건지 궁금함. 나는 분산 시스템 작업 중인데 오늘 Fable은 거의 못 쓸 수준임. Opus 같아서 다른 사람들도 그런가 찾아봤더니 맞더라.
나는 임베디드 시스템인데 Opus에서도 같은 일이 매일 나타남. 어떤 날은 괜찮고 어떤 날은 계속 고쳐줘야 하고, 어떤 날은 프롬프트에 이미 있는 정보를 다시 알려줘야 함. 불투명한 유료벽 뒤에서 뭘 주는지 알 수 없는 슬롯머신 같음. 비즈니스 구독 씀.