backprop 없이 트랜스포머 사전학습하는 Dust, EGGROLL보다 1만 배 효율 주장
- Dust는 토큰마다 활성값을 독립적으로 교란하는 노드 교란 기반 0차 최적화로, 각 토큰이 가상 population 구성원이 되어 forward pass 한 번에 전부 평가되며 backprop 없이 트랜스포머 사전학습에서 backprop과 경쟁 가능한 첫 사례라고 주장함
- 1M 토큰부터 Dust가 최신 가중치 공간 ES인 EGGROLL보다 1,000배에서 10,000배 효율적이라고 추정함
- 0차 방법은 큰 네트워크에 확장되지 않는다는 통념과 반대로 243M 파라미터 모델이 120배 작은 모델보다 대부분의 population 크기에서 population 효율이 더 높음
- population이 커질수록 Dust의 gradient 추정이 backprop과 더 잘 정렬되고, 최대 1B 토큰까지 모든 규모에서 정렬이 유지됨
- compute가 풍부해지면 backprop을 능가할 수 있다는 Bitter Lesson 논변을 내세우지만 실험 규모는 1B 토큰까지임
Hacker News 의견들
backprop보다 계산 효율은 떨어지지만 병렬화는 더 쉽다는 얘기인가? 그렇게 이해했는데 맞나.
꼭 그렇진 않음. backprop도 행렬곱 덩어리라 병렬화 잘 됨. Dust는 backward pass를 건너뛰는 쪽이고, NPC(Neural Predictive Coding) 같은 건 완전 비동기라서 각 가중치가 따로 발화 가능함. 다만 업계가 forward-backward 시스템에 돈을 너무 많이 묻어놔서 NPC 하드웨어가 나오고 수십억 파라미터까지 확장을 증명하지 않는 한 backprop 대체품이 이기긴 어려울 듯.
대규모에서는 0차 방법이 깊이 방향으로 더 잘 병렬화됨. 버블 없이 파이프라인 병렬로 아주 깊은 모델을 학습할 수 있음.
backprop으로 만든 체크포인트를 이걸로 파인튜닝하면 추가 이득이 있을까? 단계별로 적용해서 학습 궤적이 어떻게 바뀌는지 보고 싶음.
243M 모델이 120배 작은 모델을 대부분 population 크기에서 이긴다는 게 제일 놀라운 부분임. 큰 네트워크가 population 효율이 더 좋아짐.
두 알고리즘 다 ERM 원리에 따른 같은 Pareto frontier에 묶여 있음. backprop은 수렴하려면 헤시안 조건수에 제약받는데, 그 제약을 없애는 건 큰 진전임. 진화적 방법이 다시 나오는 건 반가운데 비용이 크고 순진한 게 문제.
backprop 대신 가중치를 교란한 forward pass를 수천 번 돌려서 gradient를 몬테카를로로 추정한다? 별로 영리하지 않고 쓸모도 없음. 동형암호나 영지식 증명, 블록체인 컴퓨팅 같은 부류임.
몇 년마다 derivative-free 최적화가 화제가 되는데 하나도 영향력을 못 냈음. 신경망 목적함수는 매끄럽고 gradient는 파라미터가 많을수록 더 유용함. gradient 기반과 derivative-free 사이의 복잡도 격차는 최근에 증명됐고, Muon 같은 구조 특화 1차 옵티마이저가 더 유망함.
비매끄러운 목적함수에도 Clarke generalized subdifferential 같은 방향 정보를 쓰는 게 낫다. 굳이 0차 방법으로 갈 이유가 없음.
계산 비용이 크고 현실적으로 불가능해 보이는데 장점이 뭔가? 주제를 잘 몰라서 진짜 궁금함.
Bitter Lesson 논변에는 회의적임. loss가 nonconvex인 문제를 0차 방법이 정면으로 푸는 것도 아니고 Dust도 smoothing을 함. convexity 얘기가 논문에 아예 없는 게 이상하고, 시뮬레이터가 gradient 정보를 안 주는 경우에나 주 옵션일 듯.
수십 배 수준의 compute 효율 개선이 오고 있음. 0차 탐색이 후보를 찾고 1차 학습이 그걸 공고히 하는 혼합이 가능할지도 모름.