무관해 보이는 단어 10개로 임베딩 '원' 기하를 위조해 맥주 내기에서 이기다
- Dhruva Karkada의 논문(arXiv 2602.15029)은 12개 월(month) 임베딩이 PCA 공간에서 원을 그리고 Gram 행렬이 순환행렬(circulant)에 가까워진다고 보였고, 이 결과는 트위터에서 화제가 됨
- Jamie Simon은 맥주 한 잔을 걸고 무관해 보이는 단어 10개를 골라 word2vec 임베딩에서도 같은 원과 순환 Gram 행렬을 만들 수 있다고 주장했고 실제로 성공함
- 탐색은 25000개 어휘에서 최악의 점을 버리고 최적 대체 단어를 넣는 반복 방식이며, 목적함수를 PCA상의 '원처럼 보임'에서 목표 순환 Gram 행렬 일치로 바꾼 뒤 통했음. 어휘 조합은 약 3×10^37개, 정보량으로 124비트
- 단서도 붙음. 위조한 집합의 순환행렬 비대각 진폭은 월 집합의 절반에도 못 미쳤고, 10개에서는 통했지만 50개 규모(1700년부터 2020년까지 연도 같은 결과)는 위조하지 못함
- PCA/MDS 저차원 기하를 겨냥한 탐색은 통계적 제약이 충분치 않으면 우연히도 걸려들며, 이는 일부 자동 특징 탐색 알고리즘과 확장 가능한 해석가능성(scalable interpretability) 연구에 제약이 됨
Hacker News opinions
재밌는 확장판이 있을 것 같은데, 기존 원 위에서 한 점만 빼고 나머지 전부에서 최대한 먼 점들을 골라서 반복하면 무한대(∞) 모양도 찾을 수 있지 않을까
나도 최근에 'be succinct', 'avoid mannered prose' 같은 스타일 프롬프트가 LLM 출력에 미치는 영향 분석했는데, 유사도 행렬을 MDS로 2차원 축소하니 비슷하게 원형 관계가 나오더라. PCA/MDS 자체나 Gemma 출력 분포의 아티팩트인지 궁금함
포커 결과 예측에 비슷한 짓 해봤다가 술값 다 냈음. 수학이 내 편이 아니었음
이걸 상대랑 내기하는 건 상대를 과적합시키는 거임. 그냥 맥주 사주는 게 낫다
지도교수님 보시면 고차원 통계를 논문이 아니라 맥주값에 쓰는 걸 자랑스러워하실 듯
궁금한 게 있는데, 이 매핑이 선택한 집합에 의존하는 건가? 25k 단어 전부 매핑해놓고 원을 이루는 10개만 고르는 것도 되나? 글에서는 안 맞는 단어를 하나씩 교체했으니 나머지 단어 위치는 별로 안 변했을 것 같음
가장 좋은 바(bar) 내기는 기술적으로 치팅이 아니라 그냥 선형대수를 악용하는 거임
'고차원 통계를 논문이 아니라 맥주값에 쓰는 것이 학위의 올바른 사용법'이라는 말이 맞다. 논문은 원이 존재함을 증명하는 곳이고, 술집은 그게 모든 것에 존재함을 확인하는 곳임