Jev식 결정 모델을 직접 만들어보니 1.7B 모델 확률이 과신함
- Jev처럼 고정된 선택지만 허용하고 한 번의 forward pass로 답을 고르는 결정 모델이 이 글의 중심 개념임
- Qwen3-1.7B에 선택지 토큰만 허용하는 방식으로 CommonsenseQA 무작위 표본 1,221문항을 평가해 정확도 59.38%를 얻고, 미세조정 후 62.41%로 올라감
- 모호한 질문인 박쥐를 어디서 찾을 수 있나에서 동굴 선택지 확률이 0.9978로 나와 모델이 지나치게 확신하는 문제가 드러남
- 신뢰도 구간별로 나눠 보면 모델의 확신도가 실제 정답률과 맞지 않아 출력 확률을 그대로 신뢰도로 쓰기 어려움
Hacker News opinions
JSON 출력 얘기인 줄 알았는데 텍스트는 안 만들고 확률만 뱉는 거임.
MLE인데 분류기 얘기 꺼내면 다들 관심 없더라. Jev 뜨는 거 보면 속이 좀 뒤집힘. 근데 LLM도 제로샷 분류기로 이미 싸게 잘 써왔잖음.
Jev가 뜬 이유는 API가 if문이나 switch문처럼 생겨서인 듯. 챗 API에 익숙하니까 이런 식으로 안 생각하는 거임. 챗 모델은 값도 비싸고 거절 답변 같은 엉뚱한 출력도 나옴.
싸고 빠른 게 핵심임. Jev은 엄청 싸서 예전엔 정당화 안 되던 곳에도 그냥 던져볼 수 있음.
온도 조정해서 벤치마크에 맞춘 거 허용되는 거임? p-hacking 냄새 남.
맞으면 맞는 거임. 테스트셋이 충분히 크고 다양하면 아무것도 없는 것보단 낫지. 여러 종류 작업에 던져보면 신뢰도가 얼마나 흔들리는지도 알 수 있음.
나는 3DS 게임 테스트 하네스에 OpenAI Decisions API 써봤는데 입력 하나당 2~300ms라 속도 때문에 쓸 수밖에 없었음.
Qwen 같은 모델은 로컬에서 느림. Laya를 브라우저에 올려보니 200ms 아래로 나왔음. 근데 Laya도 ModernBert 미세조정이라 그냥 양방향 언어 모델임. 결정 모델 신비주의 좀 그만하자.