시계열 예측이 유난히 어려운 이유

The unreasonable difficulty of time series forecasting

시계열 예측이 일반적인 머신러닝 문제보다 훨씬 어려운 이유를 분석한 글입니다. 저자는 통계 모델, 신경망, 트리 기반 모델, 제로샷 파운데이션 모델, LLM까지 다양한 모델을 여러 데이터셋에 적용한 벤치마크를 제시하며, 강한 계절성을 가진 시계열에서는 단순한 통계 모델이 뛰어난 성능을 보이는 반면, 환율이나 비트코인 같은 사건 기반 시계열에서는 정교한 모델조차 단순 예측을 넘지 못한다는 점을 보여줍니다. 이러한 결과의 근본 원인으로 시계열 데이터가 iid가 아닌 데이터 생성 프로세스에서 비롯되며, 낮은 신호 대 잡음비, 유효 표본 크기의 부족, 심각한 분포 변화를 겪는다는 점을 꼽습니다. 또한 예측 가능성의 조건인 정상성, 에르고딕성, 자기상관의 역할과 한계를 설명합니다.

시계열 데이터는 데이터 생성 분포가 아니라 데이터 생성 프로세스에서 비롯되며, 이는 데이터가 개별 iid 데이터 포인트가 아니라 전체 경로에 대한 결합 확률 분포임을 의미한다.

이 날의 다른 글

2026-07-21