15.17
研究人员通常使用某种集中趋势的度量来总结其数据——即用一个分数代表整组数据点。
最直接的度量是众数——即出现频率最高的数值——在计算职业类别等分类数据的总数时尤为有用。此处的众数为 writer,因为报告的职业中以写作者占多数。
另一种度量是中位数——即一组按数值大小顺序排列的数据中的真实中间点。此处,工资的中位数为 65,000 美元……一半员工的工资等于或高于此值……另一半则等于或低于此中点。当数值个数为偶数时,中位数由两个中间数值的平均数确定。
最后,数值数据最常用的度量是均值——即算术平均数,等于所有数值的总和除以数据点的个数。
例如,所有收入的总和将除以就业人数——在此情况下,得出的平均值为 140,000 美元。由于该指标在计算时考虑了数据集中的所有数值,研究人员通常更倾向于报告平均值。
在正态分布中,众数、均值和中位数的值大致相等,且恰好位于曲线的中心位置。然而,在偏态分布中——即当极高或极低的数值更为普遍且权重更大时——这些测量值并不相等。
如果大多数参与者的收入较低,由于少数极高收入值的影响,平均值会升高。因此,平均值对极端值的敏感性可能导致数据被人为地高估或低估。在这种情况下,中位数或众数将作为更准确的衡量指标。
最终,衡量集中趋势的最佳方法是考虑手头数据分布模式的方法。
数据集的"中心"也是描述数据位置的一种方式。描述数据"中心"最常用的两个指标是均值(平均值)和中位数。术语"均值"和"平均值"常被互换使用,这种词语替换是常见的做法。"算术平均"是其技术术语,而"平均值"在技术上指一个中心位置。然而,在非统计学专业人士的实际使用中,"平均值"一词通常被接受为"算术平…