dplyr::ntile() 함수, 통계적 정확성에 치명적 결함
The Trouble with 'Ntile()'

데이터 과학 블로그 'Notes from a data witch'에서 dplyr의 ntile() 함수가 통계적으로 정확한 분위 기반 그룹화에 적합하지 않다고 경고한다. 약물 개발 데이터를 예로 들어, 체중과 같이 반올림된 변수에서 중앙값에 동점 값이 몰리는 현상을 설명하고, ntile()이 이러한 동점 값을 임의로 배정해 분석 결과를 왜곡할 수 있음을 보여준다. 저자는 통계적 정확성이 중요한 작업에는 ntile()을 사용하지 말 것을 당부한다.
ntile()은 데이터를 분위 기반 그룹으로 나누는 도구가 결코 아니며, 데이터 분석에 사용하면 분명히 오작동할 것이다. 부디 주의하길 바란다.