Prime Intellect, RLM과 Continual Harness로 자가개선형 코딩 에이전트 'Prime Agent' 오픈소스 공개
- Prime Intellect가 Prime Agent라는 자가개선형 코딩 하네스를 출시하고 GitHub에 오픈소스로 공개함, curl 스크립트로 바로 설치 가능함
- 핵심 개념은 두 가지, Recursive Language Model(RLM)은 컨텍스트를 변수처럼 다루고 서브에이전트 호출을 REPL 안의 함수 호출로 취급함
- Continual Harness는 하네스 자체 상태(프롬프트, 스킬, 메모리, 서브에이전트)를 에이전트가 직접 CRUD하도록 만들어 에이전트-투-에이전트 메시징과 세션 간 오케스트레이션까지 지원함
- 모델은 영속적인 IPython 커널을 유일한 툴로 사용하고, 서브에이전트는 각각 별도의 prime-agent 인스턴스로 구현됨
- 백그라운드 데몬이 모든 세션을 소켓으로 관리하며 세션 JSONL과 커널 스냅샷으로 워커 크래시 시 복구가 가능하고, Agents View로 실행중/유휴/비활성 세션을 탐색할 수 있음
Hacker News 의견들
나도 이거 한번 써봐야겠음
나도 비슷한 RLM 하네스에 로컬 MCP 서버, 로깅, 메모리, 디렉토리 기반 프로젝트 룰까지 만들어봤는데 요즘 파운데이션 모델들이 워낙 좋아져서 이런 하네스가 딱히 필요없어짐. 그냥 .md 파일에 컨텍스트 저장하는 걸로 충분함
RLM 논문의 핵심은 그냥 LLM을 코딩 에이전트처럼 만드는 거임, 루트는 고성능 모델 쓰고 서브에이전트는 저렴한 모델 쓰는 구조라 이득 보는 거지. Prime Agent는 여기에 continual harness라는 걸 얹었는데 블로그 글에 설명이 부실함. 메시지 패싱이랑 코드 공유 정도로 보이는데 참신하긴 한데 혁신적이진 않고 다른 시스템들이 이미 하던 거의 변형임
나는 스킬 개선 스킬 방식으로 감, 뭔가 실패하거나 한 번 이상 생각이 필요하면 스킬로 학습하도록 룰을 걸어놨고, 공유 위치에 동기화해서 팀이나 여러 워크스테이션에서 같이 쓸 수 있게 만듦
ARC-AGI-3를 거의 다 풀었다는 게 인상적임, 다른 벤치마크나 실제 코딩 작업에서는 어떨지 궁금함
근데 Prime Intellect는 공식 ARC-AGI-3 리더보드에는 안 올라와 있음
이 저장소 코드 보면 리뷰나 설계 없이 LLM이 그냥 짠 티가 남, 파일 하나가 거의 1만 줄이고 switch문 하나가 1000줄 넘게 이어지는 것도 있음. 모델들이 대체로 작은 코드베이스에서 더 잘 작동하는데 이 프로젝트는 반대로 감, 자가개선 에이전트 부트스트랩하려면 훨씬 작은 걸로 시작하는 게 나을 듯
이런 코드 비대화 문제 어떻게 해결함? 재설계 스킬도 써보고 클린업 세션도 따로 돌려봤는데 딱히 잘 안 됨, 다른 툴이나 프레임워크 아는 사람 있음?
하네스 자체 개선 루프에 RL 트레이닝 붙이면 진짜 재밌어질 듯, 나도 LLM으로 하네스 엔지니어링 시도해봤는데 결국 코드 비대해지기만 하더라. 모델들이 기본적으로 그런 작업에 튜닝이 안 되어있는 느낌
모델이 강해질수록 오히려 지나치게 정교한 하네스가 추론을 방해할 수도 있음
결국 최선의 하네스는 그 모델이 RLVF된 바로 그 하네스가 될 것 같음
이거 토큰 엄청 잡아먹을 것 같음, 자가개선 자체는 새로운 아이디어도 아니고 지금 비용 구조로는 현실성이 없음