Opus 5.5 너프 측정 저장소 livenerf, 78문항 고정 패널로 30일 사전등록 실험 진행
- ninjahawk/livenerf가 Opus 5.5의 너프 여부를 측정하는 30일 사전등록 실험을 돌리는 중이며, 고정된 78문항 패널을 하루 한 번 Opus 5.5(high effort)로 실행하고 대조군으로 Opus 5에 GPQA 문항을 돌림
- 설계는 10일 베이스라인과 10일 결정 구간 2개로 이뤄지고, 10일 구간당 MDE 7.5점을 예측함. 파일럿 3에서 포화된 합성 대조군과 비밀값은 데이터 수집 전에 제거함
- livenerf.daily가 UTC 기준 하루 한 번 실행되며 시간당 따라잡기와 핀/락/예산 가드를 갖췄고, livenerf.plot이 런칭 주 베이스라인 대비 일별 페어 델타를 라이트/다크 SVG로 그림
- 댓글에서 Nerf Bench(bridgebench.ai)가 런칭 당일 벤치마크를 뜨고 10% 넘는 편차를 변화로 판정하며 Opus 5.5와 GPT-6 Astra를 추적 중이라는 언급이 나옴. 이 벤치가 Opus 4.6 저하를 탐지해 Anthropic이 블로그로 인정했다는 주장에는, 벤치가 최근 공개돼 불가능하다는 반박이 붙음
- 반대 의견으로는 모델이 너프된 게 아니라 사용자가 새 지능 수준에 적응한 것이라는 주장, 신모델 출시로 몰린 수요 때문에 컴퓨팅을 재배분한다는 추측, API와 엔터프라이즈 종량제에서는 저하를 못 느꼈다는 경험담이 나옴
Hacker News opinions
이거 천재적임. Sonnet 5가 너무 별로여서 못 돌아가겠는데 Opus 5.5도 너프될까봐 진짜 걱정됨.
10일 간격이면 너무 긴 거 아님? Astra는 일주일 안에 너프된 느낌이었는데.
항상 일주일쯤임. 그게 쾌락 적응의 좋은 근사치라고 봄. 너프를 벤치로 입증하려는 시도는 많이 봤는데 지속된 게 없음.
오늘 벌써 결과가 더 나빠지고 있음.
조직들이 모델을 빠르게 승인하는 게 늘면 Anthropic이 컴퓨팅에 쪼들려서 피크 시간에 조금씩 덜어내는 거 아닐까.
핫테이크: 모델이 너프된 게 아니고 사람들이 새 지능 수준에 익숙해진 것뿐임.
아니 의도적이든 아니든, 런칭 직후에 모델이 급격히 힘을 잃는 경험은 확실히 있음.
벤치가 전부 그렇게 나오는데 핫테이크도 아님. 사람들이 이걸 주장할 때마다 사례를 물어보면 아무것도 안 나옴. 진짜로 의도적으로 너프하면 Anthropic 입장에선 경제적 자살인데.
Anthropic이 예전에 사용자 항의 후에 하네스 버그를 인정한 적 있음. 이 글에 링크도 있음.
수요 기반인 것 같음. 새 모델 나오면 수만 명이 몰려서 서버가 터지고 너프가 생김. 솔직히 말하면 사용자를 더 빨리 잃으니까 '과부하니 나중에 오세요'라고 못 하는 거임.
서버가 밀리면 품질 저하가 아니라 응답이 느려져야 맞음. 최소한 선택지라도 주거나 경고라도 해줘야지. 그러면 시간 낭비는 안 할 텐데.
API도 영향 받나? 퍼블릭 클라우드의 Claude는? 난 엔터프라이즈 종량제로만 써서 이런 너프 불평을 이해 못 했음. 특정 시간대에 느려지거나 품질이 떨어진 걸 느낀 적이 없음.
Anthropic이 내 주간 쿼터를 A/B 테스트함. 새벽 3시에 자동 프롬프트로 토큰 수와 5시간/주간 쿼터를 재는데, 절대 토큰 수는 0.1% 안에서 같은데 모드 A에서는 5시간 쿼터의 1%, 모드 B에서는 4%를 차지함.
이런 불투명함 때문에 오픈 모델이 결국 답이라고 봄. 총소유비용이 더 들어도 내가 통제하는 지능이 낫음. 너프 여부보다 신뢰할 수 없다는 게 문제임.
사례 하나: Opus 4.6으로 며칠째 claude code 세션 돌리는 중인데 Sonnet 5.5 발표 직후부터 권한 요청을 훨씬 자주 함. 출력 품질은 같은데 속도가 확 느려짐. 권한 요청을 늘리는 게 품질 저하 없이 접근을 조절하는 방법일 수 있음.
n=1은 쓸모 없음. 출력이 결정적이지도 않고.
이 저장소는 이제 너무 유명해져서 Anthropic이 곧 벤치막이를 할 거임.
Nerf Bench도 있음. 런칭 당일에 테스트하고 그걸 기준으로 벤치함. 10% 넘게 벗어나면 변화로 보고, Opus 5.5랑 GPT-6 Astra를 추적 중임. Opus 4.6 저하를 탐지해서 Anthropic이 나중에 블로그로 인정했음.
그 벤치가 방금 나왔는데 어떻게 Opus 4.6 저하를 탐지했겠음.
OpenAI가 livenerf 클라이언트를 탐지하는 분류기를 만들어서 그 요청만 안 너프하면 됨. 오픈 모델이 종착지임.
그럼 모든 클라이언트가 처음엔 livenerf인 척 하면 됨. 구글 UA로 위장하던 것처럼.