ntile() 的那些坑
作者是一名 R tidyverse 使用者,长期批评 base R 行为粗糙而 tidyverse 工具补齐了这些坑。这篇文章主要讨论 dplyr 中 ntile 的坑:ntile 按行数均匀分组而不是按取值均匀分组,当存在大量重复值(如 9000 人中 8999 人分数相同、1 人不同)时,结果会严重偏离预期(可能出现 8999 人进第 1 组、1 人进第 2 组之类不直观情况)。 作者给出了替代方案:用 ntile 按唯一值分组、或直接按数值切分区间(cut / 自定义分位数),并提醒在数据分布高度偏斜或重复值多时,n tile 的“均匀 n 组”语义容易让人误以为每个组人数相等。 适合做 R 数据分析、数据分箱/分层时阅读,可作为数据陷阱案例收藏。 








