PostHog, Jev류 결정 모델에 추론을 결합한 오픈소스 'jeeves' 공개
- PostHog가 Jev 스타일 결정 모델에 자기회귀 추론을 붙인 오픈소스 프로젝트 jeeves를 GitHub에 올렸다. 스타 153개, 포크 9개, 커밋 20개, 브랜치 1개짜리 저장소다.
- 출력은 예/아니오가 아니라 noul이라는 값이다. 댓글 설명에 따르면 Bernoulli 시행에서 하나를 고르는 대신 명제가 참일 보정 확률을 0.0에서 1.0 사이로 돌려준다.
- 벤치마크에 쓴 모델은 9B이고 응답 지연은 p90 기준 17초다. 댓글에서는 이 속도가 Jev의 미덕(싸고 빠름)과 어긋난다고 지적한다.
- 저장소는 drafter, inference, loader, model, prep, sdk 디렉터리로 나뉘고, 최근 커밋은 expandable segments allocator 제거와 drafter 명명 정리다. diffusion drafter 적응을 흥미롭게 본 댓글이 있다.
- 사용자 실측에서 M5 Pro 48GB로 독일 축구 트윗 100개의 아이러니를 판정하는 데 30분 이상 걸렸고 68개를 맞혀 Jev의 79개보다 낮았다. 다른 오픈 결정 모델보다는 높았다.
Hacker News opinions
noul이라는 말은 어디서 나온 거야? 찾아보니 Bernoulli 시행에서 하나를 고르는 대신 참일 보정 확률을 0.0~1.0으로 돌려주는 값이라더라. 솔직히 이 이름은 싫다.
베이지안 통계에서는 그걸 credence라고 부르는데, 굳이 새 단어를 만들 필요가 있었나 싶다.
짧고 Boolean이랑 발음이 비슷해서 프리미티브 이름으로는 괜찮은데. 뭐라 부르든 개념 자체는 이해된다.
결정 전에 자기회귀 추론을 돌리면 Jev의 장점(단일 포워드 패스, 싸고 보정된 확률)을 대부분 포기하는 거 아닌가? 타입 있는 출력과 확률 인터페이스는 유지하면서 어려운 케이스 정확도만 올리는 게 목적인가?
이건 별로 놀랍지 않다. LLM 추론이나 그 전의 chain of thought 프롬프팅은 결국 test-time compute scaling이라서.
파이프라인 일부는 Jev류로, 일부는 전통 LLM으로 가져가는 하이브리드가 답인 것 같다.
p90이 17초면 이걸 왜 쓰나? 그냥 LLM 쓰는 게 낫지. Jev의 아름다움은 엄청 싸고 엄청 빠르다는 데 있는데.
"엄청 싸다"는 건 좀 미루자. 내 스팸 탐지 케이스에서는 프롬프트 캐싱 덕에 Luna가 20% 더 저렴했다. 속도는 Jev가 낫지만.
Jev류는 보정된 확률을 주지만 정확도가 낮다. 그럼 둘 다 보여줘야 하는 거 아냐? 왜 하나만 보여주는 거임.
내 벤치마크(독일 축구 트윗 아이러니 감지)를 M5 Pro 48GB에서 돌려봤는데 100개 판정에 30분 넘게 걸렸다. 정확도는 68개로 Jev의 79개보다 낮았고, 다른 오픈 결정 모델보단 높았다.
이 Jev류 모델들이 진짜 일반적인가? 크로스 도메인으로 폭넓게 평가한 사람 있나?
분류기는 생성 텍스트의 부분집합이다. Jev는 앱 곳곳에 뿌려도 될 만큼 싸고 빨라서, LLM으로는 답답하고 비싼 유스케이스를 열어준다는 게 핵심이다.
포스트 트레이닝은 필요 없다. LLM이 생각하게 하고 prefill 뒤에 JSON만 강제로 뱉게 하면 된다. 확률이 어긋나지 않게 출력 예시를 프롬프트에 잘 넣어야 하지만.
내 경험엔 Jev가 빠른 건 그냥 작고 구린 모델이라서다. 반박할 사람?
Jev가 2주 만에 점심을 뺏기고 있다는 게 웃기다. 타입세이프가 분류기를 결정 모델이라고 마케팅하느라 VC 돈 쓴 덕분이지.
Jev같은 것들이 이미지 입력도 지원하나? Qwen 이미지 인코더에 약간 튜닝하면 될 것 같은데.