Show HN: Pac-Bench, 30개 모델이 원샷으로 만든 팩맨, Opus 5.5가 99/100으로 1위
- claude-opus-5-5가 30개 모델 가운데 99/100으로 1위, 벽시계 9분 17초에 출력 61,349토큰, 비용 $1.99, HTML 10.8KB짜리 팩맨을 한 번에 만들어냄
- 채점은 참가 모델이 아니라 Opus 5.5가 맡아 90초 자동 플레이 테스트와 소스·미로 감사로 진행했고, 배점은 조작 20, 유령 25, 팩맨 끼임 20, 미로 20, 사운드 15점임
- 2위 claude-fable-5-1은 96점에 $5.87, claude-sonnet-5.5는 95점에 $1.61, grok-4.7은 94점에 $1.69로 비용 차이가 점수 차이보다 훨씬 큼
- 제작자 jonclegg는 1년 전 우연히 팩맨을 시험했는데 어느 모델도 잘 못해서 새 모델이 나올 때마다 계속 돌렸고, 스크린샷이 잘 나오고 5초만 플레이해도 수준을 알 수 있어 팩맨을 골랐다고 밝힘
- 댓글에서는 프롬프트가 너무 모호해 벤치마크가 아니라 프롬프트 해석 능력 측정이라는 지적과, 원작 그대로의 게임플레이를 LLM이 판정하는 구조라 곧 모든 모델이 만점에 수렴할 것이라는 회의론이 나옴
Hacker News opinions
첫눈에 봐도 Opus 5-5는 완벽한 클론 같았고 나머지는 결함이 보이더라. Astra는 주변에 쓸데없는 것만 잔뜩 만들어놨어.
나도 같은 생각. Opus 5.5 high effort가 확실히 낫더라. 입력 버퍼링, 유령마다 다른 패스파인딩 AI, 레벨 전환까지 갖췄어. gpt-5.6 sol high도 과제는 완수했는데 파이프 사이 틈이나 유령 먹을 때 일시정지가 안 되는 게 덜 다듬어진 느낌이었음.
맞아, Opus 5.5는 처음으로 지적할 게 없었어. 지난주에 다른 작업들에도 써봤는데 확실히 단계가 바뀐 느낌임.
DOOM으로 같은 걸 해봤는데 Fable 5는 별로였고 Astra는 스프라이트 애니메이션이 미쳤더라. 근데 이게 그냥 돌아간다는 게 내 실력의 100배라는 점은 좀 우울함.
프롬프트가 저렇게 짧은 건 말이 안 됨. 결국 모호한 프롬프트를 어떻게 해석하는지 재는 벤치마크잖아. 원작에 충실하게 만들라고 적어도 명시해야 점수를 매기는 의미가 있음.
왜 Pac-Man이냐고? 1년 전에 우연히 테스트했는데 아무 모델도 잘 못했음. 새 모델 나올 때마다 계속 돌렸고, 스크린샷이 잘 나오고 5초만 해봐도 괜찮은지 알 수 있어서 편함.
유령 패턴을 진짜 이해하는 건지 그냥 반응만 하는 건지 궁금함. 원샷 학습에는 생각보다 훨씬 복잡한 게임임.
GLM-5.2 버전도 있는데 술 취한 팩맨처럼 좀 뻑뻑하더라. 이것도 목록에 넣어야겠음.
결국 웹에 있는 코드를 그대로 토해내는 거 아님? 별로 감동 없음.
웹에 아직 없는 걸 시켜봐. 좋은 모델이면 함. 믿기 어려운 건 알겠는데 현실을 부정할 순 없음.
이 벤치마크 별로 유용하지 않다고 봄. LLM 하나가 게임플레이가 원작처럼 보이는지 판정하고 다른 하나가 구현하는 구조라, 성능 향상이 극적으로 나올 수밖에 없음. 곧 다 0에서 1로 갈 거임.
나도 요즘 직접 팩맨 클론을 만드는 중인데 LLM 구현은 디테일이 많이 빠짐. 유령 행동이 원작과 다름. 직접 만들어보지 않으면 그 차이를 못 알아챔.
팩맨 게임을 하는 건 줄 알았네. LLM이 간단한 게임이나 로컬 앱 만드는 건 이미 확인된 사실 아님?
여기 GLM-5.2가 있음: