LLM 토큰마다 폭이 동일한 폰트 컴파일러 공개, 인터·gg sans에 DeepSeek·클로드 등 토크나이저를 적용해 디스코드·슬랙 테마로 설치 가능
- 폰트와 토크나이저를 입력하면 모든 토큰이 같은 폭이 되는 토큰 스페이스 폰트를 브라우저에서 컴파일하는 도구임
- 베이스 폰트로 Inter, gg sans(Discord), SF Compact, SF Pro widths, Roboto, Lora, SF Mono, Ubuntu Mono, JetBrains Mono, Bebas Neue, Caveat과 업로드한 TTF·OTF·WOFF·WOFF2를 선택함
- 토크나이저 프리셋으로 DeepSeek V4.1 Flash, ctok v4.8·v4.7·v3, o200k_base·cl100k_base·p50k_base·r50k_base, Kimi K3, GLM-5.3, Llama 3, Qwen 3.6, Gemini 3.5 Flash와 Hugging Face tokenizer.json 업로드를 제공함
- claude 계열 ctok 모드는 최소 비용 분할에 유니코드 정규화를 근사하고 독립 구성 요소당 256단계 탐색 제한을 두며 메시지 프레임은 제외하고 v3·v4.7은 앞쪽 공백 정규화 오류가 있음
- 디스코드용 Vesktop 테마는 특정 사용자 ID에만 폰트를 적용할 수 있고 ThemeAttributes 플러그인이 필요하며 코드 블록은 기존 고정폭 폰트를 유지함. 슬랙은 에이전트 표시 이름이나 멤버 ID에 대응하는 메시지만 바꾸는 유저스크립트를 제공함
Hacker News opinions
사파리에서 커닝이 엉망이던데 크롬에선 멀쩡하더라.
파이어폭스 155에서 이 페이지가 100% CPU로 그냥 멈춰 버림. 이런 증상은 처음 봐서 오히려 인상적임
난 파이어폭스 156에서 테스트했는데 멀쩡하던데
윈도우 10에 파이어폭스 152인데 버터처럼 부드럽게 돌아감. 경험담 나눠 봄
어시스턴트한테 공감이 가게 만든다고? 읽고 보니 진짜 그럼. 생각보다 괜찮은 아이디어임
중국어는 어떻게 나올까? 한자는 토큰이 글자 하나에 일대일로 대응해서 그냥 일반 텍스트랑 똑같아 보이고 문장부호만 줄 가운데로 감. 그럼 중국어가 오히려 NLP에서 토큰 효율이 좋단 얘기인가? 의미가 토큰 조각에 쪼개지지 않으니
독일어 넣었더니 영어보다 단어가 훨씬 많이 쪼개지더라. 토크나이저가 영어 중심이라 당연한 결과임. FLORES-200 기준 상대 토큰 수를 보면 영어 1.00x, 독일어 1.31x, 한국어 1.47x, 일본어 1.66x, 암하라어 5.78x, 산탈리어 13.70x까지 감. 출처는 'Tokenizer Fairness in 2026'이고 Petrov 등의 NeurIPS 2023 논문 재현 연구임