컨텍스트를 파일로 다루는 Context Language Models, 기존 모델 제로샷만으로 정확도 11.4% 높이고 FLOPs 21.5% 절감
- Context Language Models(CLM)는 컨텍스트를 파일로 취급하고 모델이 그 파일을 제한 없이 수정하도록 만들어, 컨텍스트 관리를 외부 하네스 제어에서 모델 내부 동작으로 옮김. 여러 에이전트 컨텍스트가 파일로 공존하는 멀티에이전트 구조로도 이어짐.
- 기존 모델로 제로샷 구축만 해도 BrowseComp-Plus에서 정확도 11.4% 높이며 FLOPs 21.5% 절감, 12시간 EdgeBench에서 점수 5% 높이며 FLOPs 59% 절감, 24시간 다중 저장소 에이전트 스웜 과제에서는 같은 연산으로 개선폭이 65% 큼.
- 자연어 지시를 표준 스킬 최적화 루프로 진화시켜 컨텍스트 관리 과제의 held-out 정확도를 최대 35.9포인트 올리면서 연산은 줄였고, 온라인 강화학습을 적용하면 Qwen3.5-9B의 BrowseComp-Plus 성능이 47.6% 오르면서 FLOPs는 12% 줄어듦.
- 서빙을 위해 Suffix Cache Reuse를 함께 설계해 같은 성능에서 표준 SGLang보다 서버 연산을 35% 줄임. 저자는 Rulin Shao 등 13명으로 Luke Zettlemoyer, Mike Lewis, Nathan Lambert, Pang Wei Koh가 포함됨.
- 컨텍스트 관리 전략을 컨텍스트 내 학습과 파라미터 학습 양쪽으로 익힐 수 있게 된 것이 이 구조 전환의 결과임.
Hacker News 의견들
컨텍스트 관리는 요즘 LLM 쓰면서 남은 큰 골칫거리 중 하나인데 이건 좀 클 수도 있겠다. 캐시 무효화가 걸리는 게 뻔한 문제인데 그것까지 같이 파본 게 더 흥미롭고.
가장 큰 발견은 캐싱 규칙을 무시하고 무효화된 캐시 접미사를 그대로 남겨뒀는데 성능이 안 떨어졌다는 점일지도. rotary 인코딩 그냥 다 무시하고 바뀐 부분만 정확히 채워 넣으면 모델이 깨질까, 아니면 내부에서 스스로 보정할까?
이거 그냥 아무 모델에나 파일을 다음 컨텍스트로 보내면 되는 거 아님? 수정 깊이에 따라 캐시 미스 비용은 내가 무는데 CLM은 그 재계산을 건너뛰는 거고.
비슷한 걸 Codex가 실험 중이라고 들었음, 아직 미출시. 요약 컴팩션이 아니라 모델이 작업하면서 노트를 유지하고 컨텍스트 한계에 가까워지면 노트 붙인 새 세션을 열고 이전 세션 포인터를 남기는 식. Pi에서 노트 최대 토큰 제한 걸어서 다시 만들어봤는데 요약 컴팩션보다 싸더라.
나도 커스텀 코딩 하네스에 fs 툴 세트 만들어서 이렇게 썼음. 동적 내용을 뒤쪽에 배치하도록 순서 잡으면 캐싱도 꽤 챙겨지더라.
컨텍스트 관리가 어텐션 자원을 잡아먹는 게 걸림. 에이전트가 자기 기억 문제를 풀게 할 건지 실제 과제를 풀게 할 건지인데, 별도 하이퍼바이저 에이전트가 메인 에이전트 컨텍스트를 관리하는 게 내 경험상 훨씬 낫고 캐시 미스 시점 통제도 쉬움.
그럼 두 번째 모델이 관리를 맡게 하면 되지 않나.
이건 램 같은 건가, LLM용 램? 그럼 MMU랑 딸린 추상화를 처음부터 다시 발명해야 하는 거 아니냐.
초반엔 나도 그러려니 했는데 그냥 초록을 못 쓴 거 같음. 실제로 한 건 agents.md를 다시 발명한 수준보다 훨씬 깊어 보임.
결국 CLM은 본 모델과 같이 학습되는 별도 모델이 되겠지. DB의 hot/cold 페이지처럼 컨텍스트도 여러 층으로 나뉠 거고, 1년 안에 Context as a DB 논문 나올 듯.
Bitter Lesson이 컨텍스트 관리에서 또 나온 셈이네.
관련해서 Recursive Language Models도 있음, arxiv 2512.24601.