11.8
在无相关性的数据集中,对于给定的 x 值,y 的最佳预测值是其均值。
如果变量之间存在线性相关关系,可以通过将 x 值代入回归方程来预测 y 值。
预测的 y 值与样本均值 y-bar 之间的垂直距离称为解释偏差。两个变量之间的关系可以解释这种偏差。
数据点与预测的 y 值之间的垂直距离称为未解释偏差或残差。变量之间的关系无法解释这种偏差;它可能仅由随机因素引起,或涉及其他变量所致。
未解释偏差与已解释偏差之和构成总偏差。
将所有数据点的偏差平方后求和,可得到未解释变异、已解释变异和总变异的量。
解释变异量与总变异量的比值即为r平方值,也称为决定系数。它表示回归线能够解释的因变量y值变异所占的比例。
任何数据集的一个重要特征是数据的变化。在某些数据集中,数据值会集中在平均值的附近;而在其他的一些数据集中,数据值则会与平均值之间的距离较远。最常见的变异度量或分布度量是标准差,即方差的平方根。
在散点图上绘制自变量和因变量时,直线的斜率就是用来描述两个变量之间变化率的值。斜率告诉了我们,当自变量(x…