Anthropic, 작은 트랜스포머의 인컨텍스트 학습을 설명하는 '인덕션 헤드' 제시
- Anthropic 연구진은 2층 이하의 attention-only 트랜스포머를 분석 대상으로 삼아, 96층에 attention과 MLP를 교차 배치한 GPT-3 같은 대형 모델보다 단순한 조건에서 내부 계산을 추적함
- 논문은 트랜스포머 연산을 수학적으로 동등한 관점에서 다시 표현해, 작은 모델이 내부에서 수행하는 계산을 해석하려는 틀을 제시함
- 작은 모델에서 특정 attention head인 인덕션 헤드(induction heads)가 인컨텍스트 학습을 설명한다고 보고함
- 연구진은 기계적 해석 가능성을 복잡한 바이너리를 사람이 읽는 소스 코드로 역공학하는 작업에 비유하며, 모델의 알려지지 않은 능력과 안전 문제를 체계적으로 찾는 방법으로 제안함
Hacker News opinions
Distill Circuits가 비전 모델을 역공학했다는데, 실제로 어디까지 성공했는지 궁금함.
Distill은 결국 중단됐음. 2021년에 hiatus 공지를 냈고, 지금 상황이 여기까지 온 셈임.
이 글은 여러 번 읽으려 했는데 너무 길더라. 끝까지 읽을 만한 가치가 있는지 모르겠음.
분야나 관심도에 따라 다르지만, 일반 호기심으로도 읽을 가치는 큼. word2vec급으로 꼽을 만하다고 봄.
Neel Nanda의 유튜브 해설이 꽤 좋았음. 그것도 길지만 내용 자체가 복잡해서 짧게 끝낼 방법은 없어 보임.
LLM이 보인 낯선 능력에 비해 기계적 해석 가능성 연구에 대중 관심이 너무 적다고 느낌. 이 글과 뒤이은 transformer-circuits.pub 글들은 몇 년 뒤 고전적인 기초 연구로 평가될 것 같음.
나는 이 논문을 교과서 몇 장으로 풀어줬으면 좋겠음. Q, K, V 비유 대신 더 큰 동등 행렬로 attention을 다시 보는 관점이 특히 좋았고, residual stream은 단순 우회로가 아니라 임베딩부터 출력까지 이어지는 주 통신 버스라는 설명이 설득력 있었음.