dplyrのntile()を信頼するな——統計的正確性を損なう落とし穴

The Trouble with 'Ntile()'

dplyrのntile()を信頼するな——統計的正確性を損なう落とし穴

tidyverseを愛用するデータサイエンティストが、dplyr::ntile()の意外な挙動に警鐘を鳴らす。この関数は分位ベースのビニング用ではなく、体重のような「連続」変数に適用すると、中央値付近の同値が原因で誤ったグループ分けを引き起こす。175行の模擬データで14人(8%)が中央値に集中する例を示し、実データでも2%程度のクラスタリングは珍しくないと指摘。統計分析での使用を避けるよう強く勧める。

これは、統計的な正確性が重要などんな目的にも使うべきではないという警告です。

この日のほかの記事

2026-09-22