연구자 워크플로 70개로 과학 AI 에이전트를 평가한 Terminal-Bench-Science, 최고 점수는 30%
Hacker News 의견들
수학 과학 분야에서는 Sol이 Opus를 이긴다니 반갑네. 지금 내 용도에는 그게 필요하고, GPT 문체도 더 마음에 듦.
실제 연구 워크플로를 평가하는 방향이 맞다고 봄. 에이전트 벤치는 장난감 과제가 너무 많았음.
Luna면 파서 명세를 주고 파서를 작성시키기에는 이미 충분히 쓸 만하더라.
LLM에 parser_spec을 줘서 파서를 만드는 게 lex 같은 도구보다 정확히 뭐가 더 나은지는 모르겠음.
Gemini가 언급되지 않은 건 아쉽네. 과학 성능을 따로 훈련하는 모델인지도 궁금함.
Opus 5가 Fable보다 높은 건 이상함. 내 코딩 경험에서는 Opus 5가 거의 모든 면에서 Fable보다 못했음.
이건 과학 과제 평가잖아. Fable은 생물의학 작업에서 안전장치 때문에 병원성 섬 분석 파이프라인까지 거부해서 사실상 못 썼음.
내 경험상 Fable은 깊게 파고드는 데 좋지만 오래 자유롭게 돌리면 맥락 전환을 못 하고 엉뚱해짐. Opus는 덜 창의적이어도 더 안정적이라, 큰 코드베이스의 체계적 변경에는 낫더라.
Claude가 Sol보다 과학 지능에서 꽤 앞서는 건 놀랍지 않음. Claude는 구체적인 과학·수학의 뉘앙스를 이해하는 느낌이고, Codex는 코딩에 더 치우쳐 보였음.