소형 결정 모델 Jev가 유튜브 라이브로 포켓몬스터 레드 깨는 중, 두꺼운 하니스 두고 워크스루 논쟁
- Frigade가 만든 소형 결정 모델 Jev가 유튜브 라이브로 포켓몬스터 레드 전체를 클리어하는 중이며 오른쪽 패널은 매번의 결정과 확률을 표시하고, 코드는 github.com/christianmat/jev-pokemon에 공개됨
- Jev는 게임 ROM에 직접 붙어 상태를 읽고 좌표 이동 같은 도구를 쓰며, 하니스가 길찾기와 텍스트 마일스톤을 제공하는 구조라 HN 댓글은 버튼만 정하는 모델이 아니라 워크스루에 가깝다고 지적함
- 실제도 뚜렷한 실수가 잡혀 로켓단 아지트에서 10분 넘게 갇히다가 빠져나왔고 엘리베이터 앞에서 멈춰 포켓몬에게 TM/HM을 가르쳤으며 리자드는 유일한 불꽃 기술 불꽃세례를 잊고 카운터를 익힘
- 저자가 인용한 포켓몬 짐 벤치마크에서 프론티어 추론 모델은 배지 4개까지 0.5달러 미만 비용을 기록했고, 한 댓글러는 Fable로 브록까지 가는 데 예산이 소진됐다고 보고함
- 3D 게임 화면 이미지는 입력하지 못하고 픽셀만 보는 초당 30틱 FPS에는 지연이 커서 부적합하며, Jev는 다단계 강화학습 환경이 아닌 단발 분류용이라는 평가가 나옴
Hacker News opinions
- 진짜 재밌게 보고 있는데, 작명 켜기 전에 닉네임 실험도 해봤어? 궁금하더라
- 하니스가 너무 두꺼워서 이건 사실상 워크스루 재생 보는 느낌임
- 동의함. 버튼만 정하게 하는 줄 알았는데 '라벤더 타운으로 동쪽으로 가기' 같은 추상적 목표까지 정해주면 다르지
- 레포 다이어그램 보면 전부 Jev던데, 큰 모델이 상위 목표를 맡는 사례 있어? sonnet에 일반 전투, opus에 중간 난이도, fable에 체육관 관장 배분하고 Jev가 모델 오르내림까지 관리하는 구조 생각해봄
- 프론티어 추론 모델도 포켓몬에서 꽤 잘 하는데, pokemon-gym 기준 뱃지 4개까지 비용이 0.5달러 미만이었음. 이 실험에서 볼 건 비용과 지연이지
- Fable 얘기라면 림월드를 Astra가 클리어한 적 있음. LLM으로 이런 게임 끝까지 돌리는 건 확실히 됨
- 라이브 보는데 로켓단 아지트에서 10분째 갇혀 있길래 한 시간 뒤에 다시 와봤음. 엘리베이터 앞에서 멈춰서 진행 대신 포켓몬한테 TM/HM 가르치고 있던데 웃기더라. 결국엔 빠져나옴
- Doom 얘기는 뭐야? 데모 영상에서 1단계 꽤 잘 하던데
- 초당 30틱 FPS는 경험상 너무 빨리 죽어서 안 되더라. 지연이 감당이 안 됨
- 이미지 입력 안 되는 게 아쉽긴 함. 이미지→텍스트 모델 앞에 두면 지연이 올라가서 결정 모델 쓰는 의미가 없어지고, 그러면 게임을 로봇 공학 쪽 시험대로 쓰기 힘들지
- 결정 속도는 빠른데 왔다갔다만 심해서 랜덤처럼 보임. 이전 결정을 상태로 다시 피드백은 해?
- 선택지가 너무 레일로드 느낌인데, 이 옵션이면 엄청 바보인 모델도 게임 깰 듯
- 다들 빠르고 싸다는 얘기만 하고 실제로 얼마나 똑똑한지는 아무도 안 물어봄. 다른 LLM들이 스스로 분류한 결과랑 비교해본 사람 없어?
- 그러게. 결정 잘 하는 신경망부터 시작해서 언어 모델 점점 키워온 건데, 갑자기 작은 결정 모델 하나에 다들 난리치는 게 좀 이상함
- 저스트 커서 이번 주에 fable 예산 태워서 비슷한 거 만들었는데 브록에서 멈췄거든. 토큰이 그렇게 빨리 소진되는 건 좋은 데이터 포인트네
- 하니스에 길찾기랑 텍스트 마일스톤이 너무 많이 들어가 있음. 포켓몬 지식 아예 없는 오픈 모델로 추론하는 모습 보고 싶다
- 귀신 포켓몬에 막혔다던데 맞아?