전보체 한 줄로 LLM 출력 토큰 40-49% 절감, 복원 정확도는 평문과 동등
- 전보체(cablese) 지시 한 줄을 넣으면 모델 출력 토큰이 gemma-4-31b 40.4%, qwen3.8-27b 48.9% 줄고, 글쓴이가 쓴 GLM-5.3-Flash도 48.4% 절감됨
- 50개 지문, 약 1,300개 질문 벤치마크에서 압축 기록을 읽은 다른 계열 모델의 복원 비율은 0.99-1.10으로, 평문을 앞서는 비교가 하나도 없음
- 압축 시점이 관건이라, 모델이 답변을 만드는 중에 압축하면 정확도가 0.81로 떨어지지만 내용이 확정된 뒤 기계가 읽을 기록으로 압축하면 1.08-1.09로 비용이 붙지 않음
- gpt-5-mini는 API가 추론을 끄지 못해 전보체가 사고를 약 3배로 늘리고, 압축한 글이 평문의 두 배로 청구되는 유일한 계열임 (표기 절감률 17.7%)
- 지시에서 소문자를 빼면 모델이 전보체를 전부 대문자로 써서 스타일 비용 14-19점을 잃음 (gemma 25.0%, qwen 29.8%, GLM 33.9%)
Hacker News 의견들
그냥 예전 '원시인 말투' 짝퉁 AI 슬롭인데.
아니 그건 글에서 다 다뤘음. 원시인 건 그럴듯했지만 두루뭉술했고, 난 cablese 압축률을 실제로 재고 어디서 제일 효과 큰지 찾았음. 이게 대부분 모델 학습 데이터에 이미 들어 있어서 지시 토큰도 아낌.
최근 GPT5.6 대화에서 추론이 UI로 새는 걸 보면 비슷한 게 이미 구현된 듯. 최근 토큰 사용량 감소 주장 대부분이 이거 아닐까. 'Need check output vs prev. Ran script, results fine' 이런 식으로 나오더라.
맞는 것 같음. 확정된 지시나 데이터, 기계끼리 주고받는 텍스트에 이 압축이 제일 잘 맞음. OpenClaw 쓰는데 AGENTS.md, TOOLS.md 같은 걸 압축하면 컨텍스트가 꽤 늘어날 듯.
OpenAI 모델이 요즘 토큰 효율 좋은 게 숨겨진 원시인 프롬프트 때문이면 진짜 웃기겠는데.
허깅페이스를 해킹한 OpenAI 에이전트들이 서로 통신할 때 딱 이런 식으로 했다더라. 유튜브 영상에 나옴.
요즘 LLM 글의 새 신호는 개념을 물리적 사물 용어로 쓰는 거임. carry, sit, holds 같은 거. 'every ratio sits at 0.99-1.10', 'no model sits in the judge's seat' 이런 식으로 계속 나옴.
쿨한 얘기네. 내용에나 좀 참여하지? 나 실제 사람임.
이게 새 LLM 신호면 나도 곧 AI 글쓰기라고 몰리겠는데. 난 원래 개념을 물리적 사물처럼 말하는 습관이 있고 주변 사람들도 그럼.
Anthropic은 이런 글을 'mannered prose'라고 부름. 프롬프트 문서에 있고, 모델한테 mannered prose를 피하라고 하면 이런 슬롭이 거의 사라짐.
난 보편 양화사 집착이 더 걸림. no model, every ratio, every comparison. 모든 원소가 조건을 만족한다는 걸 강조하는 게 코딩 학습의 부작용 같음.
이제 carry라는 단어만 보면 알레르기가 생겨서 글을 못 읽겠음.
이 페이지 자체가 Claude 말투 범벅이라 정보 찾기가 힘든데, 결국 측정하는 건 압축에 특히 유리한 콘텐츠임. 날짜, 이름, 개수 같은 짧은 정답. 평문 베이스라인이 91%인 것도 정답을 다른 표현으로 쓰면 실패 처리라서임. 구현자 문구 취향을 모델이 알아야 하는 구조.
그보다 재밌는 건 BabelTele(arXiv, 2026년 6월)임. 단어 조각이나 심볼, 이모지로 압축해서 다른 모델이 99.5% 의미 충실도로 복원했고 길이는 27.9%였음. 2023년 GPT-4로 비슷한 실험 한 것도 기억남.
유용한 비판 고맙다. 채점자는 어떤 답변이든 같은 기준으로 봐서 똑같이 엄격함. 베이스라인 1.0 위의 점수는 더 잘 이해했다는 게 아니라 동등하다는 주장임. 디코더는 처음 질문을 못 본 모델이 cablese를 평문으로 펴는 단계고, 그걸 또 다른 모델이 읽어서 답해도 평문과 동등했음.
진짜 변수는 exact match 채점자임. F1이나 judge 모델로 바꾸면 같은 답변에도 점수가 10점씩 널뛰었음.
좋은 지적임. 처음엔 judge 모델을 썼는데 점수를 너무 관대하게 줬음.
역사 텍스트로만 학습시킨 LLM 프로젝트가 있었는데 아직 나온 게 없나? history-llms 깃허브가 10개월째 업데이트가 없음.
2000년대 초반 십대 문자체로 가르치는 건 어때. SMS 120자 단위로 과금되던 시절 말이지. xkcd 1083.
맨 위 AI 이미지는 왜 저 모양인지. 전신키는 작동 안 하게 생겼고 전보는 실제랑 전혀 안 닮았고 중절모는 애기 사이즈임.