Jev 호환 0.8B 결정 모델 Jeff 공개, 자택에서 학습해 M4 Max에서 약 28ms
- Jeff는 Qwen3.5와 Gemma를 파인튜닝한 소형 open-weight 제로샷 분류 모델 세트로, 상황과 선택지 목록을 주면 텍스트 생성 없이 한 번의 forward pass로 선택지별 캘리브레이션된 확률을 반환함
- 2B 모델이 5개 벤치마크 패널에서 83.1%를 기록해 Jev의 공개 수치 83.0%를 근소하게 넘었고, 0.8B는 M4 Max에서 약 28ms에 결정함
- 라이선스는 Apache 2.0이고 TypeSafe와 무관한 Jev 호환 API를 제공함
- 학습은 자택에서 진행: RTX PRO 6000 한 대로 훈련, DGX Spark 두 대가 Qwen3.8-Flash-Next로 합성 데이터를 생성, MacBook에서 테스트, 폰에서 Tailscale로 모니터링함
- Financial PhraseBank 96%, RAGTruth 86-89%로 Jev보다 앞서지만 멀티스텝 추론은 뒤지고, 비교에 쓴 Jev와 AutoJev 수치는 같은 벤치마크의 다른 표본에서 나온 값임
Hacker News opinions
Jeff 만든 사람인데, 상황이랑 선택지 목록을 주면 한 번의 forward pass로 선택지별 확률을 뱉는 제로샷 분류 모델임. 텍스트 생성이 없어서 빠르고, 필요하면 더 파인튜닝해도 됨.
2B가 0.8B한테 지는 게 좀 웃기네. BBH나 JudgeBench는 추론 쪽이라 뒤지는데, 제로샷 분류면 Banking77이나 CLINC150 같은 걸 쓰는 게 맞지 않았나?
집에서 이걸 돌린다는 게 제일 놀랍다. RTX PRO 6000에 DGX Spark 두 대라니.
qwen한테 1토큰만 답하게 하는 것과 속도를 비교하면 어떰?
Jev가 그렇게 화제였는데 로컬에서 돌아가고 파인튜닝도 되는 모델이 나온 건 진짜 유용함.
내 케이스에선 Jev 94%, Jeff 70% 나왔음. 분류로는 못 씀.
그건 네 분류에서만 그런 거고, 만든 사람도 파인튜닝하라고 해뒀음. Jev를 밀어내려는 게 아니라 오픈 웨이트로 MVP 만드는 게 가능하다는 걸 보여주는 거지.
구인광고 분류에 써봤는데 0.8B는 완전 무용이고 2B는 나았지만 job type은 계속 놓쳤음. Gemini 2.5 Flash Lite랑 Jev, Jeff를 같이 돌려봤다.
오픈소스라고 나온 me-too Jev들은 다 별로였음.
Von 1.2가 Doom 점수는 더 좋더라. Defend Center 시나리오에서 분류기로 22킬까지 뽑았고(최대 26), CPU에서 초 단위로 학습하고 1MB도 안 되는데 추론은 1ms 아래임.
Jev 같은 기능이 프론티어 모델에 언제쯤 그냥 내장되냐? 근데 그건 로컬에서 돌리면 되니까 상관 없음.
프론티어 모델도 다 할 수 있음. 다만 그렇게 빠르거나 싸지 않을 뿐.
Structured Outputs에 스키마 제약 걸면 되는 거 아닌가? deepseek flash로 티켓 1만 개를 1달러도 안 되게 처리하는데 1초 아래 지연이면 충분함.
가격 비교 좀 해줘. Jev는 입력 100만 토큰당 $0.42고 출력은 공짜라던데.
TypeSafe가 Jev 기술 얘기는 조용히 넘어감. 속도랑 비용 보면 토큰을 LLM처럼 단어마다 훑는 방식은 아닌 듯.
어텐션은 있을 텐데 autoregressive가 아니라서 토큰마다 모델 전체를 다시 돌리는 O(n^3)은 아닐 거임.
로컬 추론이 비효율적인 건 계산이 아니라 매 토큰마다 파라미터를 메모리에서 불러오는 문제임. Jev는 답을 여러 개 병렬로 뽑고 중복을 버리는 방식일 가능성이 큼.