Jane Street 인턴, 자기회귀 디퓨전으로 주식 호가 이벤트 생성 실험
- Jane Street 인턴 Kavish가 4년치 미국 주식 데이터로 이벤트 단위 자기회귀 디퓨전 모델을 만들어 다음 시장 이벤트를 하나씩 생성함
- 완전 연속 디퓨전은 주문 가격의 뾰족한 분포나 정수 시각에 몰리는 주문 도착을 잘 따라가지 못해 실제 시장 데이터의 거친 특성에 맞지 않았음
- DDPM은 학습 중 발산했고 flow matching이 훨씬 안정적으로 동작함
- 이벤트 종류는 trade와 BBO 업데이트를 구분하는 2범주 헤드가 확률로 뽑고, 연속 값은 그 종류에 조건을 건 디퓨전 헤드가 생성하는 구조임
Hacker News opinions
과거 수익률이 미래를 보장 안 한다는 말은 많이 듣는데, 인덱스 펀드 자체가 '과거에 이겼으니 미래에도 이긴다'는 논리 위에 있는 거임. 돈이 계속 몰리면서 자기 충족적으로 가격이 오르는 면도 있고, 그걸 차익거래로 깎을 자금은 부족함.
단타에서는 모델보다 데이터 양이 진짜 해자라고 봄. 집에서 보는 개인은 휴리스틱에 기대는데, 기관은 같은 캔들 패턴을 확률로 바로 점수 매기더라.
맞긴 한데 보장은 안 하는 거임. 상관관계가 인과를 함의하지는 않는다는 말도 엄밀히는 함의는 하고 증명은 못 한다는 뜻임.
시장은 모드가 있고 행동이 전환되는데, 예측 모델은 그 전환에 번번이 당하더라.
정확한 모델은 시장이 그 통찰을 흡수하는 순간 쓸모가 없어짐. 결국 효율적 시장 가설 얘기임.
야구 베팅 모델 돌리는데, 내 예측이 Vegas 라인이랑 너무 비슷해지면 엣지가 사라지더라. 그래서 AI로 걸러서 위험 감수할 구간만 고름.
트레이딩 모델 평균 수명이 18개월쯤이라고 들었음. 느린 헤지펀드는 5년 넘게 가는 모델도 있다는 소문인데, 그건 체결 모델이 아니라 펀더멘털 쪽이라고 함.
이 글 재밌게 읽음. 카테고리를 수동으로 나눈 게 bitter lesson에 걸리는 부분 같은데, 저지연이랑 설명 가능성 때문에 이런 방식이 필요한 거 같음.
Heitz 2023 보면 DDIM은 시작 지점에서 1/α 항이 발산하는데 flow matching은 안 그럼. DDPM 손실은 log-SNR을 제한하고 중요도 샘플링을 해야 하는데 Kavish가 그걸 빼먹어서 발산한 듯함.