해커뉴스 AI 예측 10년치를 모아 투표하는 goalposts 공개, 3분의 1은 판정 불가
- 해커뉴스 과거 댓글에 달린 AI 예측을 모아 '이뤄졌는가'를 투표로 판정하는 사이트 stoppels.ch/goalposts가 공개됨. 2016년 Houshalter의 seed AI 댓글부터 최근 예측까지 들어 있음.
- 댓글 작성자들은 예측 최소 3분의 1이 무엇을 주장하는지 판정할 수 없을 만큼 모호하다고 지적함. 댓글을 여러 번 읽어도 목표선이 어디인지 알 수 없다는 것.
- 2016년 예측은 튜링 테스트 통과, 코드 작성, 커피 주문이었지만 2026년 예측은 물리적 문 열기, 인간의 째째함 흉내, 새로운 과학적 돌파로 바뀜.
- GPT-4가 웹에서 복사하지 않은 발 ASCII 아트를 알아보는 예측은 현재 64% 찬성, 18% 반대. Opus 5.5가 그린 발을 ChatGPT 무료 티어는 '기차'로 인식함.
- OpenAI와 Anthropic 합산 시가총액이 2027년까지 $2.5T에 도달한다는 HN 내기가 언급됨. API 추론 마진 10% 초과 내기도 함께 걸림.
Hacker News opinions
내 예측 하나가 완전히 틀렸다는 게 확인돼서 오히려 기뻤음. LLM이 ML 모델을 쓰고 학습시킬 수 있다는 건 인정하는데, 임의의 새 과제를 던지는 건 아직 ML이 근본적으로 부족함.
사이트 이름이 goalposts인 게 딱 맞음. 사람들이 계속 기준을 옮기고 있잖아. 원래 댓글은 '비즈니스 과제'였는데 지금은 '임의의 새 과제'로 넓혔음.
그래서 네 예측 조건이 아직 충족 안 된 거지. 모델한테 시키면 확실히 해냈다고 믿을 수 있게 되면 지식 노동자 90%는 끝나는 거임.
비즈니스 말을 효율적인 버그 없는 코드로 바꾸는 건 AGI가 있어야 풀린다고 봄. 지금 벤치마크는 다 AI가 오라클로 쓸 수 있는 자동화 테스트로 돌아가고 있음.
OpenAI랑 Anthropic 합쳐서 2027년까지 시총 $2.5T 간다는 내기를 HN에서 했는데 지금 잘 가고 있음. API 추론 마진 10% 넘는다는 내기도 걸었음.
시장 가치랑 실제 가치가 같지 않다는 게 다행인 거지.
IPO 전에는 시장 가치라는 게 없음.
틀린 예측마다 송어로 한 대 맞는 정도의 책임만 있어도 사이트가 좋아질 텐데, 그 전에 이용약관에 넣어야 함.
예측에 돈을 걸면 됨. 틀리면 돈을 잃으니까.
예측 최소 3분의 1은 뭘 주장하는지 정확히 판정이 안 됨. 댓글을 여러 번 읽어도 기준이 어디인지 모르겠는 게 많았음.
HN 사람들은 객관적인 것에는 대체로 합리적임. 대부분 'AI는 절대 못 한다'가 아니라 'AI는 현재 못 한다'였음.
jerf의 2024년 댓글은 답이 나와 있음. 리서치 수준 수학 문제를 완전히 푸는 게 아니라 접근법만 제안한 거라 만족스러움. 코딩 도우미는 완만하게 올라왔는데 수학은 하룻밤에 리서치 수준까지 갔음.
자연어로 요구사항을 명시하는 걸 인간이 못 하는 게 문제임. AI가 아니라 인간 쪽 문제지.
2016년엔 튜링 테스트 통과, 코드 작성, 커피 주문이었는데 2024년엔 더 복잡해졌고 2026년엔 물리적 문 열기, 인간의 째째함 흉내, 새로운 과학적 돌파가 나옴. 이 변화만 봐도 알 수 있음.
튜링 테스트가 당연히 풀렸다는 밈은 짜증남. 반사실이나 인과 세계 모델로 파고들면 최신 모델도 무너지고, ESL 학생이나 아이들한테는 안 통하는 방식으로 걸림. 사람이면 협조 안 할 때도 모델은 협조적이라 그 자체가 신호임.
튜링 테스트는 원래 결함이 있었음. 중국어 방 논증으로 이미 알고 있었던 거지.
그게 바로 요점임. 기계인지 사람인지 구분이 어려울 때가 통과한 거라는 정의니까.
내 예측도 하나 있음. GPT-4가 웹에서 복사하지 않은 발 ASCII 아트를 보고 발이라고 말하는 것. 지금 투표는 64% 찬성, 18% 반대임. Opus 5.5한테 발을 그리게 했더니 그럭저럭 발이 나왔는데, ChatGPT 무료 티어에 붙여넣었더니 '기차'라고 하더라.