기존 서브워드 LLM을 두 단계 변환으로 바이트 단위 모델로 바꾸는 방법, Nature 논문으로 공개
- 두 단계 변환 절차로 기존 서브워드 기반 모델을 바이트 단위 모델로 바꾸는 바이트화(byteification) 기법이 제시됨, 추가 학습은 최소한만 필요함
- 기존 바이트 수준 방식들보다 성능이 높고 문자 단위 추론 과제에서 두드러지게 뛰어남
- 바이트 단위로 처리해서 실용적인 추론 속도를 얻고, 원본 LLM의 기존 생태계를 그대로 재사용할 수 있음
- 저자들은 바이트 방식이 서브워드 모델과 경쟁할 만한 규모로 확장되며, 코드나 생물학 서열 같이 문자 단위 의미가 중요한 분야에서 장점이 있다고 주장함
Hacker News opinions
네이처가 좀 털린 듯. 응용 AI 쪽 논문을 너무 받아준 거 아니냐. 본업 쪽에 있었으면 나았을 텐데.
이 논문의 뭐가 문제인데? 나는 그냥 읽어봤는데 괜찮아 보이던데.
서브워드 토크나이저는 원래 causal이 아니었음. 그러니까 BPE가 미래 바이트를 계속 훔쳐보고 있었던 거임. 처음 알았다.
토큰 없는 LLM 연구는 이미 많았음. 근데 아직도 토큰 도메인에서 돌아가는 거 보면 이유가 있는 듯. BLT(arxiv 2412.09871)이랑 Charformer(arxiv 2106.12672) 같이 보면 좋음.
디퓨전 모델은 토큰 없는 거 아님?
H-Net도 같이 찾아보면 좋음. ICLR 2026에 실린 논문임.
청킹 때문에 그럼. 사람 뇌도 그렇게 하잖음. 입도를 올리면 조합 수랑 필요한 연산량이 같이 늘어남. GPT-4 토크나이저가 코드 구조용 확장 토큰을 써서 한동안 코딩 쪽에서 앞섰음. 토크나이저 어휘가 생각보다 차이를 많이 만듦.
이상한 논문임. 모델은 원래 바이트별 토큰도 다 갖고 있음. 개별 바이트 읽고 쓰는 것도 잘 함. 멀티바이트 토큰이랑 같이 쓸 뿐.
바이트 토큰을 추가하는 게 아니라 전부 바이트 토큰으로만 가는 게 핵심임. 'strawberry'에서 R 개수 세는 실패 같은 토큰화 문제를 피하려는 거임.