전략(Stratego) AI 아타락소스, 세계 최강자에 15승 1패. GPU 16장에 수천 달러로 학습
- 카네기멜런·MIT·NYU·스탠퍼드 공동 연구팀이 만든 아타락소스(Ataraxos)가 세계 최강 전략(Stratego) 선수 핌 니메이어를 15승 1패 4무로 꺾음. 학습에는 GPU 16장과 수천 달러만 들었음
- 전략은 말 40개의 정체가 숨겨진 불완전정보 게임으로 가능한 배열이 1 데실리언(10의 33승)을 넘고 한 판이 2,000수까지 감. DeepMind는 탐색 공간이 너무 커서 수 읽기(search)를 붙이지 못했음
- 자기 대국 1억 6300만 판으로 학습했고, 은닉 정보 때문에 자기대국 학습이 진동하는 문제는 초반에 크게, 후반에 작게 전략을 고치는 방식으로 해결함
- 핵심 혁신은 상대 말의 이동 패턴으로 숨은 정체를 추정하는 믿음 모델(belief model) 신경망. 모든 배열을 열거하는 대신 그럴듯한 배열을 샘플링해 후보 수를 시뮬레이션하고 고름
- 2025 전략 세계선수권에서 도전자들을 상대로 40판 중 38승. 니메이어는 3주간 20판을 두고 판당 $100를 받았지만 1승만 거둠
Hacker News opinions
딥마인드가 2022년에 전략 봇 냈던 걸로 기억하는데?
기사에서 그거 다룸. 새 봇은 학습 데이터가 100분의 1 수준인데 더 잘 둠.
2022년 'Mastering the Game of Stratego' 논문이 있었는데, 그때의 마스터링은 완성이 아니었던 셈임. 4년 지나서야 사람보다 확실히 강해짐.
이 접근법은 하나비에도 통함. 자기 카드는 못 보는데 다른 사람은 다 보는 게임이라 흥미로움.
유치원 때부터 하던 게임인데 그땐 심리전이랑 블러핑이 전부였음. 그 시절 게임이 어려웠던 건 봤던 상대 말을 다 기억 못 해서인데 AI는 절대 안 까먹음.
아 이런, 나 전략 봇 만드려고 벼르고 있었는데. 리만 가설 증명하는 것보단 덜 삽질이라고 생각했는데 요즘은 Claude한테 물어보면 된다더라.
요즘 스타크래프트 1 RL 봇도 나오고 어드밴스 워즈 봇도 나왔는데 둘 다 상위 인간 수준임.
silent defense 변형에서는 AI가 얼마나 잘할지 궁금함. 기사에서도 불확실성이 크다고 했는데 silent defense면 불확실성이 더 큼.
어릴 때 친구가 Electronic Stratego를 갖고 있었는데, 양쪽 말 강함을 안 밝히고 싸울 수 있어서 훨씬 재미있었음.
이런 게임이 반복적으로 정복되는 이유는 정적이어서라고 봄. 매주 새 카드가 나오는 MtG 같은 게임이면 인간이 훨씬 대등할 텐데, 새 카드 하나가 학습 데이터 전체를 무효화할 수 있음.
그 논리는 안 맞음. 새 카드가 나오면 에이전트가 기존 수천 장과의 상호작용을 훑는 게 인간이 다 외우는 것보다 훨씬 쉬움.
MtG에 Stockfish가 없는 건 규칙 구현이 빡세고 아무도 신경 안 써서임. 원리적으로 포커나 브리지랑 다를 게 없고 둘 다 초인 엔진 있음.
새 카드 나올 때마다 랜덤 부분집합으로 학습시키면 정적 게임 대비 100배에서 1000배 정도 추가 학습이면 될 듯. 그래도 많은 양이긴 함.
하스스톤은 봇이 넘쳐나고 사람도 자주 이김.
16 GPU에 수천 달러? 근데 연구진이 CMU, MIT, NYU, 스탠퍼드임. 아무나 한 게 아님.
앞 문장이 '예산이 뛰어난 DeepMind도 못 했다'니까 대비는 예산이지 인재가 아님.
게임 아카이브가 ataraxosai.github.io에 있음.
어릴 때 전략 엄청 좋아했는데 다 이겨서 같이 해줄 사람이 없었음. 20년 만에 다시 해보고 싶은데 AI가 정복하기 전에 붙어볼 걸 그랬음.
나도 11살쯤에 전략 찾아서 그 뒤로 한 번도 안 졌음. 정찰 공격으로 상대 진형 파악하고 1계급 높은 말을 올려 보내는 식이었는데, 그걸 프로그램으로 짜기가 어렵다는 게 신기함.