Jane Street 인턴, 자기회귀 디퓨전으로 시장 데이터 생성에 도전

Can you use autoregressive diffusion to generate market data?

Jane Street의 2026년 여름 인턴 Kavish는 자기회귀 디퓨전을 이용해 시장 데이터를 생성하는 모델을 연구했다. 4년치 미국 주식 데이터로 학습한 결과, DDPM은 불안정하게 발산했지만 flow matching이 훨씬 안정적이었다. 시장 데이터의 연속성과 이산성이 뒤섞인 특성 때문에 'atom smoothing' 기법을 도입해 급격한 불연속성을 완화했다. 아직 현실적인 생성기로 쓰기엔 부족하지만, 어떤 부분을 범주형으로 예측하고 어떻게 분포를 표현할지에 대한 중요한 통찰을 제공한다.

시장 데이터의 책 이벤트는 연속적인 공간('매도 호가 크기 10% 증가')과 이산적인 행동 공간('매수 호가를 1틱 개선')에 동시에 존재한다. 이는 같은 것을 보는 두 가지 방식이다. 시장 데이터를 생성하려면 이 혼합을 올바르게 모델링해야 한다.
  1. armcat

    여기서 진짜 중요한 이야기는 시계열 데이터에 디퓨전 모델을 적용하는 이 멋진 설명이다. 그 데이터는 이산적이지도 연속적이지도 않다. 디퓨전 모델이 다양한 시나리오에 적용되는 걸 보는 건 항상 흥미롭다. 디퓨전 언어 모델도 마찬가지다.

  2. stult

    시장에 대해 안정적으로 정확할 수 있는 모델은 존재하지 않는다. 왜냐하면 시장은 정확한 어떤 모델의 통찰을 필연적으로 흡수해 그것이 더 이상 정확하지 않게 될 때까지 반영하기 때문이다.

  3. arjie

    놀라운 인턴십이다. 글도 꽤 밀도 있다. 모든 내용이 유익하다.

    세부 묘사가 재미있을 정도인데, 미래 인턴을 겨냥한 거라 이해는 된다. 주문 도착 간격이 왜 정규분포일 거라 기대하지? 분명히 주문이 하나 도착하면 다른 주문들의 확률을 끌어올리는, Hawkes 같은 효과가 있을 텐데. 학생들 말문을 트이게 하려는 재미있는 작은 장치인 셈이다.

    Jane Street 인턴들은 언제나처럼 인상적이다.

이 날의 다른 글

2026-10-10