GPT-2 소형 모델을 단계별로 조작해 보는 Transformer 인터랙티브 설명 페이지가 해커뉴스에 올라와
- 조지아텍 폴로클럽이 GPT-2 small(12개 블록, 12개 헤드, 768차원 임베딩, 토큰 어휘 50,257개)을 예로 들어 임베딩, 트랜스포머 블록, 확률 세 단계를 직접 클릭하며 따라가는 인터랙티브 시각화를 공개함
- 화면에는 Q/K/V 생성, 헤드별 분할, 닷 프로덕트와 마스킹, 소프트맥스, GELU 활성화, 잔차 연결과 레이어 정규화까지 실제 수치(-25.3, 3.0 등)가 그대로 표시됨
- GPT-2 가중치 다운로드가 600MB라 크롬북이 두 번 뻗었다는 댓글이 나올 만큼 브라우저 자원을 많이 씀
- 댓글에서는 절대 위치 인코딩과 드롭아웃이 최신 모델 레시피와 다르다는 지적이 나옴. 최신 모델은 RoPE를 쓰고 드롭아웃은 잘 안 쓴다는 것
- 어텐션 행렬을 Value 벡터에 곱하는 과정이 입력에 따라 가중치가 즉석에서 만들어지는 밀집층처럼 동작한다는 점을 짚은 댓글이 달림
Hacker News opinions
어텐션 행렬이 Value에 곱해지는 부분이 제일 신기함. 입력에 따라 가중치가 그때그때 만들어지는 밀집층처럼 동작하는데, 보통 설명글에서는 이걸 잘 안 짚더라.
이거 크롬북으로 열었다가 그냥 죽었음. 예제 섹션에 GPT-2 모델 받는 동안 쓰라고 적혀 있는데 600MB라니 너무 큼.
GPT-2 기준이라 절대 위치 인코딩을 쓰는 게 좀 걸림. 요즘 모델은 RoPE 쓰니까 이걸 최신 모델 설명으로 오해하면 안 됨.
그건 교육용이라 단순화한 거임. 디테일 다 넣으려면 아무도 못 배운다.
bbycroft.net/llm도 진짜 잘 만들어놨음. 이거랑 같이 보면 이해가 훨씬 잘 됨.
The Illustrated Transformer는 아직도 입문용으로 최고임. 저자 책도 괜찮고.
키, 쿼리, 밸류가 왜 따로 있는지 계속 헷갈렸는데, 임베딩을 '이 토큰이 던지는 질문', '이 토큰이 답하는 질문', '그 답' 공간으로 각각 투영하는 거라고 보면 이해됨.
temperature 설명에서 safety라는 단어는 좀 아님. 온도 0으로 뽑은 텍스트는 놀라움이 없어서 오히려 인위적으로 느껴짐.
드롭아웃 설명은 요즘 레시피에 안 들어가니까 빼는 게 맞다고 봄.
EE 전공자 입장에서 transformer라는 단어는 볼 때마다 헷갈림. 변압기인 줄 알고 들어왔다가 매번 낚임.
어텐션 부분이 계속 안 와닿았는데 이 시각화 클릭해보면서 좀 잡혔음. Welch Labs 영상도 같이 보면 좋음.