大規模言語モデルが表形式データ予測で失敗する理由:次元の呪いが決定的要因に

Why Large Language Models Fail at Tabular Prediction

大規模言語モデルが表形式データ予測で失敗する理由:次元の呪いが決定的要因に

大規模言語モデル(LLM)は多くのタスクで優れた性能を発揮する一方、表形式データの予測分析では古典的な機械学習モデルに及ばないことが知られています。本研究では、最先端のLLMを純粋な推論モード(ツールやファインチューニングなし)で用い、その失敗原因を5つの仮説で体系的に検証しました。ノイズや非線形分離、CSV形式、数値のトークン化、クエリあたりのテスト点数は失敗の原因ではないと判明。一方、入力の次元数が増加すると、LLMの精度は低下する一方、古典的なベースラインは横ばいか向上しました。252の古典的モデルとの比較では、2次元では距離ベースの局所的手法と高い一致を示すものの、高次元ではどの古典的モデルもLLMの予測を再現できませんでした。この結果は、LLMの能力が次元とともに溶解することを示し、表形式データにおけるLLMの限界を説明しています。

我々の結果は、LLMの能力が次元とともに溶解し、その様子をノイズで劣化させた古典的学習者では模倣できないことを示している。

同じ日のその他の記事

2026-08-04