モデルが大きくなるほどデータ重みを無視し始める理由
A study of sequence weighting at scale

Jane Streetが自社のdense LMとMoE LM、そしてQwen 2.5を用いて、学習時のsequence weightがloss削減にどう効くかを測る指標p*を大規模に調査。小規模モデルは重みに関係なく一般的パターンを学び、中規模では重みに比例したデータ固有パターンを学び、大規模では再び重みに依存せず全パターンを獲得するという非単調な傾向を発見した。
大規模モデルは、重みに関係なくデータに存在するすべてのパターンを学習する。