Cognition, Kimi K3 후학습 SWE-2 공개… FrontierCode 50.0%, Fable 5.1보다 64% 저렴 주장
- Cognition은 SWE-2가 FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1보다 0.9%포인트 낮지만 평균 롤아웃 비용은 64% 적다고 발표함
- SWE-2는 2.8조 파라미터 Kimi K3를 후학습한 모델이며, 모든 추론 노력 수준을 한 번의 RL 학습에서 다루는 선형 비용 페널티를 적용했다고 설명함
- 공개 표에서 SWE-2는 DeepSWE 1.1 73.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%를 기록했으며, Terminal-Bench 4에서는 Fable 5.1의 55.8%보다 낮음
- FrontierCode에서 SWE-2 medium은 SWE-1.7보다 평균 단계 수가 127회에서 53회로 줄고 평균 비용은 81% 낮았으며, 첫 실제 코드 수정의 중앙값도 48단계에서 18단계로 감소함
- SWE-2는 출시일부터 Devin Desktop과 Devin CLI에서 쓸 수 있고, Devin Web과 Fusion에도 순차 배포 중임
Hacker News opinions
Terminal-Bench 4가 27.3%인데 다른 벤치는 왜 안 보여주는지 의심됨. 벤치마크에 맞춘 결과 같음.
FrontierCode 자체가 Cognition 벤치고, 오늘 나온 DeepSeek v4.1 Flash보다도 전반적으로 약해 보임. 제출 계정도 새 계정이라 자가 홍보 아닌가 싶음.
SWE-1.5는 직접 써봤을 때 꽤 좋았음. Anthropic과 OpenAI에 가려졌지만 Cognition도 탄탄한 쪽이라고 봄.
Kimi K3를 후학습한 모델이면 SWE 작업에서 성능이 들쭉날쭉할 법함. 이미 증류된 모델을 다시 다듬은 셈이지만, 64% 저렴하다는 말이 맞으면 쓸 이유는 있음.
최상위 중국 연구소가 하는 증류나 사전학습보다 후학습은 훨씬 쉬워 보임. 조금 더 나은 파생 모델이 바로 가격을 깎기 시작하면 이 회사들도 가중치를 닫아둘지 궁금함.
Devin을 써야만 하는 구조로 보이는데, 별도 플랫폼에 묶이는 에이전트면 굳이 시험할 마음이 안 남.
Cognition 직원이긴 하지만 SWE-2 개발에는 참여하지 않았음. 다음 한 달은 무료고, 대부분의 사용은 Devin CLI로 가능함.
가중치가 공개된다면 도구 종속성은 꽤 상쇄됨. 성능이 충분하면 기존 도구를 모델에 맞춰 붙이면 됨.
Terminal-Bench 2.1은 92.8%인데 몇 주 전에 나온 Terminal-Bench 4는 27.3%인 차이가 너무 큼. 새 문제로 일반화하는 능력, 더 직설적으로는 벤치마크 과적합 정도를 보는 수치 같음.
2.8조 파라미터 모델이 10조 파라미터급 모델의 지능과 능력에 도달한다는 건 쉽게 못 믿겠음. RL이 많이 끌어올려도 한계는 있다고 봄.
TB2.1은 이미 포화됐고 TB4는 아직 포화되지 않았음. Sol xhigh도 TB2.1에서는 90%지만 TB4에서는 37%인데, 벤치가 새롭다는 이유만으로 Sol까지 과적합이라고 할 건가.
벤치마크가 목표가 되는 순간 좋은 벤치마크가 아니게 됨.
TB4의 27.3%도 최신 모델 범위 안임. Sonnet 5는 12.4%, Luna 17.3%, Grok 4.6은 20.3%, Sol은 37.3%, Opus 5는 51.8%임.
벤치 수치는 거의 쓸모없다고 봄. 모델끼리 점수 차이도 작고, 내 실제 작업에서 더 낫다는 보장도 없어서 결국 자기 작업용 벤치를 만들어야 함.
로컬에서 190GB 미만 RAM으로 돌리는 Qwen 3.8-Flash-Next도 TerminalBench 4에서 25.3%임.
DeepSeek V4.1은 Terminal Bench 4에서 이 모델보다 4포인트 높은 31%대임.
가중치 정보도 없고 공개 가중치인지도 안 보임. 그럴 거면 왜 DeepSeek Flash 4.1 대신 이걸 써야 하는지 모르겠음.
DeepSeek 4 Flash 계열을 제대로 양자화해 돌리려면 메모리가 약 160GB, 4.1 Flash는 약 250GB쯤 필요하다고 들었음. 비자명한 실제 작업에서는 여전히 Astra나 Opus 5 같은 클라우드 모델에 의존하게 될 수도 있음.