時系列予測が「不合理なほど難しい」理由:データ生成過程の本質に迫る

The unreasonable difficulty of time series forecasting

時系列予測が、画像認識や自然言語処理などの機械学習タスクと比べてなぜこれほど難しいのかを、著者が自身のベンチマーク実験と理論的考察から解説。統計モデルからTransformer、LightGBM、基盤モデル、LLMまでを主要データセットで比較した結果、強い季節性を持つ系列では単純な統計モデルが優勢な一方、複雑なモデルは方向感覚を失いナイーブ予測を下回ることも。その根本原因として、時系列がiidではなく「データ生成過程」から生じる単一の軌跡である点を挙げ、低いS/N比、実質的なデータ不足、分布シフトの深刻さを指摘。さらに、学習可能性の条件(定常性、エルゴード性、自己相関)と、過程の統計的性質を知ることと予測可能性が別物であることを、ホワイトノイズの例を交えて説明する。

時系列データは「データ生成分布」ではなく「データ生成過程」から生じるものであり、その重要な含意は、データの系列が個々のiidデータ点ではなく、経路全体にわたる同時確率分布であるということだ。

この日のほかの記事

2026-07-21