언어모델 거부 반응을 걷어내는 Heretic 공개, HN에서 지표 체리피킹 논쟁 붙어
- Heretic은
pip install -U heretic-llm뒤heretic Qwen/Qwen3.5-4B한 줄로 언어모델의 거부 반응을 제거하는 자동화 abliteration 도구이며 GitHub(p-e-w/heretic)와 Hugging Face(heretic-org)에서 배포 중임 - 작동 방식은 거부당하는 프롬프트와 통과하는 프롬프트를 대량으로 넣고 두 그룹이 비슷한 잠재 공간에 놓이도록 가중치를 반복 수정하는 것임
- 제작자는 거부 횟수와 KL divergence가 방향성 절제(directional ablation) 논문을 포함한 관련 문헌의 표준 지표라며 체리피킹이라는 비판을 반박함
- 토론 참가자들은 거부 반응 중심으로 학습된 모델은 해당 정보 자체가 인코딩되지 않았을 수 있어 거부를 막아도 환각만 나온다고 지적함
- abliterated 모델이 먼저 불법화될 것이라는 전망에 대해, torrent조차 막지 못한 상황에서 pip 두 줄로 끝나는 작업을 금지하는 건 실행 불가능하다는 반론이 나옴