Jane Streetのインターンが自己回帰拡散モデルで市場データ生成に挑む
Can you use autoregressive diffusion to generate market data?
Jane Streetの2026年夏インターンKavish氏が、自己回帰拡散モデルを用いて市場データの生成に挑戦した。4年分の米国株データを使い、DDPMとフローマッチングを比較。DDPMは発散したが、フローマッチングは安定して機能した。市場データは連続的かつ離散的という根本的な難しさがあり、同氏は「atom smoothing」という手法でスパイクを平滑化。限界分布の改善と分類器によるリアリズム評価で成果を示したが、実用的な生成にはまだ課題が残る。
完全に連続的な拡散モデルは、現実の市場データが持つギザギザした性質には適していなかった。
HNでの議論
23- armcat
本当に興味深いのは、離散的でも連続的でもない時系列データに拡散モデルを適用するという、この素晴らしい解説の方だ。拡散モデルがさまざまなシナリオで応用されるのを見るのはいつも魅力的で、拡散言語モデルでも同じことが言える。
- stult
市場を正確にモデル化し続けられるモデルは存在しない。なぜなら市場は、正確なモデルの洞察を、それがもはや正確でなくなるまで必然的に取り込んでしまうからだ。
- arjie
驚くべきインターンシップだ。かなり密度の濃い記事でもある。すべてがためになる。
細部へのこだわりが面白いが、将来のインターンに向けたものだと考えると納得もいく。なぜ注文の到着間隔が正規分布だと期待するのか?注文が1件来ると他の注文の確率も上がるはずだ、Hawkes過程のように。学生に議論させるための、ちょっとした小技だろう。
Jane Streetのインターンは相変わらず見事だ。