레드햇 벤치마크: Jev 같은 결정 모델, LLM-as-a-judge와 전통 분류기를 이기지 못함
- 레드햇 개발자 블로그가 Jev로 대표되는 결정 모델을 전통 가드레일과 벤치마크한 결과, 결정 모델이 LLM-as-a-judge나 전통 분류기를 능가하지 못한다고 정리함
- 비교 대상에는 zero-shot 용도로 쓴 BART-large-mnli, LLM 심판, 커스텀 학습 데이터가 필요한 전통 분류기가 포함됨
- TypeSafe AI의 System One/Jev는 텍스트를 생성하는 대신 상태와 질문 목록을 받아 고정된 결정을 출력하는 방식으로 소개됨
- 부록에 Shieldstral, Qwen3.6-35B, Nemotron용 프롬프트와 Laya 튜닝 정책을 공개해 LLM 심판 쪽 평가를 재현할 수 있게 함
- 저자들은 유연성과 이식성 사이의 중간 지대를 약속한 결정 모델이 실측에서는 그 이점을 보여주지 못했다고 결론 내림
Hacker News opinions
평가에 쓴 프롬프트가 너무 단순하던데. 그것만 보고 결정 모델이 별로라고 결론 내리기엔 좀 그렇지 않나.
이게 뭐 새로운 뉴스임? 범용, 빠름, 저렴 셋 다 잡는 건 원래 없었음. LLM 심판은 범용이지만 느리고, 전통 분류기는 한 가지 일만 빠르고 싸게 함. 결정 모델은 아무 분류 문제에나 던져도 그럭저럭 쓸 만한 중간 지점인 거고.
Jev가 Luna 6 같은 중간급 LLM보다 빠르거나 싸거나 정확한 게 실제로 확인된 거임?
그 과제가 너무 단순했던 거고, 단순 분류는 BERT 시퀀스 분류로도 됨. 우리 벤치마크에서는 Jev가 오픈 결정 모델들보다 다단계 추론에서 훨씬 잘했고, 그 용도로 만든 GLiDE나 Luna보다도 정확도, 신뢰도 보정, 시간, 비용 모두 나았음. hard-decisions.anth.us에 정리해 뒀음.
선택지가 많아지면 LLM이 더 유리하지 않나? 이 글은 차단/비차단 두 옵션만 봄. OpenAI는 Decisions API에 뭘 쓰는지 궁금하네, 파인튜닝한 luna인가.
에이전트 분기 결정에 이런 모델을 쓸 때 중요한 건 보정과 정보량임. 로짓은 epistemic 불확실성을 손실 압축한 거라 공변량이 조금만 움직여도 고확률 구간 추정이 흔들림. Similarity-Distance-Magnitude Activations 같은 논문이 이 문제를 다룸.
BART는 이 테스트에 너무 옛날 모델이고 요즘 쓸 만한 선택이 아님. zero-shot 가드레일용으로 만든 내 NLI 모델로 벤치마크 재현 중임. 큰 모델을 이기진 못해도 크로스인코더 기준선은 제대로 줄 거임.
차단/허용 프레임 자체가 문제임. 자동 검사가 99개 출력 전부 통과시킨 배치를 손으로 읽었더니 8개가 깨져 있었음. 채점기는 자기 루브릭에 적힌 실패 모드만 잡고, 두 옵션짜리 가드레일 벤치는 그 천장을 그대로 물려받음.