8GB VRAM 한 장으로 돌아가는 continual learning 언어 모델 mini-AGI 공개
- mini-AGI는 바이트 단위 continual learning 언어 모델로, 8GB VRAM GPU 한 장에서 처음부터 학습하고 읽는 모든 것에서 계속 배움. 가중치를 디스크의 일반 파일로 저장하고 필요할 때 GPU로 페이징해서 파라미터 수가 VRAM이 아니라 남은 디스크 공간에 묶임.
- 학습 중 용량이 부족하면 새 용량을 늘리고 아무것도 참조하지 않는 부분은 잘라내며, 학습과 서빙이 같은 코드 경로를 씀. 작성자에 따르면 새로 생기는 expert마다 부모가 16개.
- 작성자는 README에서 현재 토이 수준 모델이라 프런티어급 성능을 기대하면 안 된다고 밝힘. 일반화 여부는 모델이 너무 작고 학습이 덜 돼서 판단할 수 없다며, 코퍼스 전체를 학습시킨 뒤 간단한 벤치마크로 확인할 계획.
- 체스 데이터만 524K 문자 연속 학습시킨 뒤 다른 도메인 성능 저하를 확인한 결과 거의 떨어지지 않았고, 코퍼스 전체를 읽힐 때는 32K 문자 길이의 무작위 스트림을 섞어서 읽힘.
- 공개된 저장소는 스타 127개, 포크 13개, 커밋 12개. 본 적 없는 데이터셋에 대한 held-out 점수도 README에 공개.
Hacker News opinions
Mini-AGI랑 8GB VRAM이 한 문장에 같이 나오는 거 보니까 진짜 반갑더라. 로컬 AGI도 생각보다 안 멀지도 모르겠음.
빅테크 쪽은 다들 의심하면서 직접 만져볼 수 있는 걸 원하지. 비용은 곧 내려갈 거라 보니까 이런 프로젝트에 관심이 쏠림.
뇌가 돌아가는 방식에 개념적으로 가까워지는 느낌임. 새로 생기는 expert마다 부모가 16개라는 것도 웃기고.
유기적인 게 마음에 듦. 안 쓰는 요소는 스스로 지우고 새로 자라나니까 역전파 말고 자연선택도 같이 돌아가는 셈임.
최근에 continual learning 방법을 여러 개 만져봤는데 catastrophic forgetting을 처음부터 피하도록 설계한 건 반가움. 클론해볼 만함.
이 구조가 진짜 일반화가 되는 건지 아니면 그냥 암기인지 궁금함. 덧셈 같은 기본 과제는 돌려봤어?
모델이 너무 작고 학습도 덜 돼서 일반화 주장은 못 하겠음. 코퍼스 전체를 읽게 한 다음에 간단한 벤치마크로 확인할 계획임.
드디어 빠져 있던 조각을 찾은 느낌임. 고맙다.
주제가 계속 바뀌는 상황에서 초반에 읽은 내용을 기억하는지 테스트해봤어?
코퍼스 전체를 읽힐 때 32K 문자짜리 무작위 스트림을 섞어서 읽힘. 섞는 이유는 catastrophic forgetting이 아니라 그냥 평범한 망각을 막기 위해서임. 체스 데이터만 524K 문자 읽혀봤는데 다른 도메인 성능은 거의 안 떨어졌고 숫자는 README에 있음.
내가 살면서 본 것 중에 처음으로 proto-AGI처럼 보이는 물건임. 이름값 함.
컨텍스트 관리랑 RAG를 잘하는 것보다 이게 나은 점이 뭔지 모르겠음. 학습된 지식은 구조적으로 손실이 있어서 잘 못 믿겠더라.
본 적 없는 데이터셋에서 문자 예측률이 얼마나 나옴?
README에 있는 held-out 점수가 바로 그 본 적 없는 데이터셋 점수임.