Jev 리버스 엔지니어링한 'jevlike' 저장소 공개, Doom과 체스 학습 예제까지 추가
- vinnylarouge가 GitHub에 Jev 유사 모델 구현 jevlike를 공개, 스타 254개와 포크 29개, 커밋 3개를 기록 중임
- 최신 커밋(9월 16일)에서 Doom과 체스 공유 학습 예제를 추가했고 공동 작성자로 OpenAI Codex가 서명됨
- README에 따르면 Jev-like 모델은 텍스트와 N개 선택지를 받아 각 선택지에 확률 하나씩 반환하며, 단어를 하나씩 생성하는 대신 한 번의 패스로 처리함
- HN 댓글에서 vLLM PR 57250의 DiffusionGemma Jev 모드를 언급, DGX Spark에서 결정당 약 0.2초, 프로그래밍 언어 감지 10/10, 자연어 감지 9/10, 단위 크기 비교 10/12를 기록하고 ASCII 미로도 해결함
- 한 댓글 작성자는 TypeSafe 발표와 홈어시스턴트 데모를 보고도 이해하지 못했는데, README의 세 문장 설명이 발표문에 있었으면 좋았겠다고 밝힘
Hacker News opinions
Doom도 돌린다더라, 영상 링크 올라와 있음
와 진짜 순식간이네
미쳤다
누가 Qwen-2.5-1B-RLCD 오픈소스 했다고 올린 영상 있는데 그거 새티어임. 좌우 결과가 확연히 다른데 1B 모델이 똑똑할 리가 없잖아. Jev가 똑똑하지 않으면 별로 안 흥미로움
나는 좋음. Jev 내부에 더 뭔가 있을 것 같긴 한데 효율적인 universal transformer라는 아이디어 자체는 마음에 듦
diffusion 모델이면 다 잠재적 Jev일 수 있음. vLLM PR 57250 돌려보니 DGX Spark에서 결정당 0.2초 정도 나옴. 프로그래밍 언어 감지 10/10, 자연어 감지 9/10, 단위 크기 비교 10/12, 틀린 답은 낮은 확률로 표시되고 ASCII 미로도 풀더라
근데 이런 커스텀 인코더-디코더 프로젝트들은 왜 Qwen 3.5 최소 버전 대신 2.5나 3을 쓸까? 파라미터 몇백m 때문인지 아니면 아키텍처나 사전학습 때문인지 궁금함
Claude한테 버전 지정 없이 LLM 비슷한 거 포팅 시키면 학습 시점에 제일 유명한 걸 기본값으로 씀. 3.5는 학습 데이터 밖임
Qwen 2.5가 linear attention 나오기 전 거라 쓰기 더 단순한 거 아닐까
HF 검색 API로 작은 모델 스캔하는 스크립트를 에이전트한테 짰는데 Qwen 3.5가 상위에 안 옴. 모델들이 오래된 콘텐츠를 선호하고 스크립트도 최신성은 안 따짐
내 미니에서는 qwen2.5-14b가 3 계열 small보다 훨씬 빠르더라
만든 사람이 레딧 LocalLLaMA에 글 쓴 것 같던데 거기서 봤음
요즘 LLM 활용하는 거 보면 그냥 zero/few-shot 분류기인데 단계만 잔뜩 늘린 게 많음. 잠재 공간에 인코딩된 지능을 효율적인 출력으로 뽑아 쓰는 쪽은 아직 개척이 덜 된 영역 같아서 재밌음
README 보면 텍스트와 N개 선택지를 받아 각각 확률 하나씩 반환하고 단어별 생성 대신 한 번에 처리한다고 되어 있음. TypeSafe 발표 읽고 홈어시스턴트 데모 봐도 뭔지 몰랐는데 이 세 문장이 발표문에 있었으면 바로 이해했을 듯