コーディングエージェントは未来の編集を予測している:LLMの潜在プログラミング地平線
Coding agents think ahead of time

ソフトウェアエンジニアリングタスクを解くコーディングエージェントは、数十ステップにわたりコードを編集しテストを実行しますが、その内部で言語モデルがプログラムについて何を表現しているかはほとんどわかっていません。本研究では、残差ストリームが進化するプログラムの特性を線形にエンコードしていることを示します。ロジスティック回帰プローブが、コードがパース可能か、テストスイートを通過するか、失敗テスト数を減らすか、リグレッションを導入するかを、AUC最大0.83でデコードできます。さらに驚くべき発見は、これらの表現がエージェント自身の編集よりも先に進んでいることです。将来の編集の結果を予測するプローブは、実際の編集がディスクに書き込まれる前から、最大約25ステップ先まで偶然を上回る性能を達成します。これを「潜在プログラミング地平線」と呼びます。プローブは再トレーニングなしでベンチマーク間を転移します。
エージェントの内部表現は、エージェント自身の編集よりも先に進んでいます。