GLM-5.3-Flash를 한 번의 패스로 Jev급 타입 결정 모델로, 정확도·속도 대등하고 이미지까지
- Privatemode가 GLM-5.3-Flash를 파인튜닝 없이 한 번의 forward pass로 타입 결정 모델로 바꾸는 방법을 공개함.
- 프롬프트에 선택지 인덱스를 붙이고 마지막 메시지를
choice_index:로 미리 채운 뒤, 첫 토큰 위치에서 인덱스별 로그 확률을 선택지 안에서 다시 정규화해 신뢰도로 씀. - 공개 데이터셋으로 만든 벤치마크에서 결정 정확도와 속도가 TypeSafe의 Jev와 대등한 수준으로 측정됨.
- 지연시간은 독일에서 Privatemode 180ms, Jev 264ms였고 미국에서는 Jev 164ms, Privatemode 299ms로 뒤집힘.
- 이미지 입력에 타입 결정을 붙일 수 있는데 이는 Jev로는 불가능하며 GLM은 오픈 가중치 모델임.
Hacker News opinions
Jev가 빠르고 싸니까 그냥 Jev를 쓰면 되는 거 아닌가?
원글에 답이 나옴. 속도는 같고 이미지 지원까지 되는데다가 GLM은 오픈 가중치임.
Jev가 오픈 가중치 모델에 새 후처리 학습(RLCD)을 얹었다는 추측이 있는데, 베이스 모델만으로 정확도가 비슷하면 Jev 아키텍처가 꼭 필요했나 의문이 생김. 가격으로만 붙는 건 별로인데 아직 안 써봤음.
나는 랜덤 책 발췌 23,000단어(약 3만 토큰)를 컨텍스트로 넣어봤는데 Jev가 800ms, 때로는 500ms에 답하더라. 사전 채움 2만에서 5만 tok/s 수준이라 일반 LLM으로는 불가능함. Cerebras도 이 정도는 아님.
근데 답은 맞았어? 나는 내 케이스에서 돌려봤더니 엄청나게 틀리는데, Jev 팀 답변이 '질문을 더 뭉뚱그려라'임. 얼마나 질문을 바보로 만들느냐의 싸움이어서 일단 패스.
그리고 Jev는 질문을 전부 병렬로 처리하는데 일반 LLM은 그게 안 됨.
아니야. 나 Cerebras로 초고속 Jev 대용으로 실험 돌려봤는데 더 빨랐음.
GLM은 자동회귀 디코더라서 'Jev-like'라는 말이 좀 이상함. Jev의 속도 이점을 그대로 못 가져옴.
원글에 측정치가 있는데, 독일에서 Privatemode 180ms, Jev 264ms. 미국에서는 Jev 164ms, Privatemode 299ms로 뒤집힘. 컨텍스트는 채워두고 선택 토큰 몇 개만 평가하는 트릭이 비결임.
이거 뻔한 접근 아니야? Jev가 필요하다고 결론 내기 전에 다들 이미 시도해봤을 법한데.
뻔한 게 맞지. 진짜 의문은 사람들이 왜 'Jev Jev' 하고 계속 외치는가임. 애스트로터핑 냄새남.
'Jev-like' 속성이란 말 자체가 농담인가? LLM을 분류기나 랭커로 이렇게 쓴 지 한참 됐는데.
로컬에서 돌릴 수 있는데 Jev가 왜 더 싸? 사전 채움 0.5%, 디코드 0.1%, 캐시 99.4%에 지연은 20ms 미만임.