스탠퍼드·엔비디아 CLM-8B 공개, 상태-행동 대조학습으로 Jev급 성능에 지연시간 최대 9배 짧고 DeepSWE 81.6% 기록
- 스탠퍼드대와 NVIDIA Research가 상태 임베딩과 행동 임베딩을 InfoNCE 대조 학습으로 묶어 후보 행동을 코사인 유사도로 채점하는 Contrastive Language Models(CLM)을 공개함.
- CLM-8B는 Nemotron Q&A 6천만 쌍 사전학습, 합성 하드 네거티브 3천만 개 중간학습, 에이전트 트래젝터리 100만 개 후학습으로 만들었으며 이 사전학습 전체가 RTX 4090 한 장으로 약 1시간에 끝남.
- 제로샷 평가에서 CLM-8B는 컴퓨터 사용·게임·툴 호출 과제 성능이 Jev와 비슷하면서 지연시간은 최대 9배 짧으며, 후보가 많거나 행동을 재사용할 수 있는 WikiRacing·T-Rex Game에서 격차가 커짐.
- 가벼운 미세조정 후 CLM은 DeepSWE 81.6%, Terminal Bench 2.1 87.6%로 에이전트 코딩 벤치마크 SOTA를 기록했고 추론은 Jev보다 4~6배 빠르며, 반대로 Jev는 장기 과제 검증자로서 무작위 선택 기준보다 못 나옴.
- 상태와 행동 임베딩을 분리해 각각 캐싱·재사용하는 인프라를 구축했고, 테스트 대조 손실이 연산량·모델 크기·데이터 크기가 커질수록 멱함수 형태로 예측 가능하게 줄어드는 스케일링 법칙을 확인함.
Hacker News opinions
이 프로젝트 언제 시작했는지 궁금하네. Jev가 공개된 게 일정에 영향을 줬을까?
작년에 로보틱스 쪽에서 이 방향 탐색했고 CLM은 몇 달 전 그 작업에서 바로 나왔다고 함. TypeSafe 호환 API 붙은 저장소만 이번에 새로 올라온 거래.
지연시간 비교가 좀 그렇다. 로컬 GPU랑 네트워크 왕복이랑 비교하는 거라 Jev 실제 런타임은 비슷할지도 모름. 벤치마크 결과 자체는 흥미롭긴 한데.
TypeSafe Jev 플레이그라운드 써보면 모델 지연이랑 네트워크 지연을 따로 보여주는데, 모델 지연은 내 테스트에서 100~200ms 나오더라.
그 디노런 GIF는 뭐냐? Jev는 느린데 점프는 제대로 하고 이 모델은 계속 선인장에 부딪히는데... 그게 상관없는 거야, 아니면 뭔가 놓친 거야?
학습 과정에서 안 된 것까지 실험 근거로 공개한 건 꽤 좋았음. 근데 Jev가 원격 서버라 지연시간 논리는 별로고, 요즘 나오는 공개 Jev류 모델들이랑 비교하는 게 더 궁금하다.
"Jev 대비 동급"이 마리오, T-Rex, WikiRacing, 즉 대규모 K 의미 기반 행동 매칭 구간에서만 나온 결과임. 날짜 연산이나 정책 임계값 같은 타입드 의사결정 부하는 제로샷 셋에 아예 없고.
제발 System One이 그냥 "빠름"이라는 뜻의 새 유행어로 굳지 않았으면 좋겠음.
이미 굳은 지 15년 됐다고 봄. Thinking, Fast and Slow가 2011년 책인데.
H100에서 돌려보니 190ms 나오는데 Jev는 170ms더라. 세팅을 잘못한 걸까?
행동용 CLIP이네. 상태랑 행동을 각각 인코더로 맵핑해서 공유 임베딩 공간에 넣는 구조가 되게 깔끔하다.
이게 진짜 분류기냐는 의문은 남는다. 스팸 판별이랑 에이전트 작업에서 다음에 뭘 입력할지 고르기는 다르고, 후자는 정답 있는 분류가 아니라 반복 라운드 게임의 전략에 가까움.
Jev나 이 모델 둘 다 과적합된 그럴듯한 "확률"을 뱉는다는 쪽으로 점점 기우는 중임. Jev가 Jev를 검증하는 2차 시스템을 100경기 돌려보면 결국 1차랑 성능이 같고 뒤집힌 경기만 늘어난다.
임베딩 캐싱 덕에 소비자용 하드웨어에서 돌릴 여지가 보인다. Nemotron DQA 사전학습이 RTX 4090 한 장에 약 1시간이라는 점도 인상적임.