最小二乘法线性回归的数学原理
线性回归分析的核心在于寻找一条直线,使所有观测点到该直线的垂直距离平方和达到最小,这一方法被称为普通最小二乘法(OLS)。在线性回归计算器中,该算法严格遵循 NIST/SEMATECH 统计方法手册的标准规范进行构建。
为了在处理数值差异极大的数据集时避免精度损失,计算器在底层采用补偿求和法,分两遍计算各变量围绕其均值的离差平方和与协方差:
- 自变量离差平方和:Sxx = Σ(xᵢ − x̄)²
- 因变量离差平方和:Syy = Σ(yᵢ − ȳ)²
- 协方差:Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
基于上述基础累加值,即可推导出回归方程的两个核心参数——斜率 b 与截距 a:
- 斜率:b = Sxy ÷ Sxx
- 截距:a = ȳ − b·x̄
其中,x̄ 和 ȳ 分别代表自变量和因变量的算术平均值。
回归系数的统计学解释
拟合完成后的回归方程可写作 ŷ = a + bx。这两个系数具有明确的物理与实际意义:
- 斜率 b:代表自变量每变动一个单位时,因变量的平均变化量。在输出结果中,其物理意义体现为“平均而言,x 每增加 1,y 就会变化
‹slope›”。 - 截距 a:代表自变量为零时因变量的预测值。在输出结果中,其物理意义体现为“当 x 为 0 时,拟合线位于 y =
‹intercept›处”。
为了评估这些估计值的可靠性,计算器会计算其标准误差。残差均方(MSE)的计算公式为 MSE = SSE ÷ (n − 2),其中残差平方和 SSE = Σ(yᵢ − ŷᵢ)²。由此可得残差标准差 s = √MSE。
斜率的标准误差为 SE(b) = s ÷ √Sxx,而截距的标准误差为 SE(a) = s · √(1÷n + x̄² ÷ Sxx)。利用 t = 估计值 ÷ 标准误差,可以在自由度为 n − 2 的 t 分布下进行双侧显著性检验,从而计算出 p 值,以评估自变量与因变量之间是否存在显著的线性关系。
变异解释度:r 与 R² 的区别
在回归分析中,总平方和(SST,即 Syy)被拆分为两个部分:由拟合线解释的平方和(SSR = SST − SSE)以及残差平方和(SSE)。
- R²(决定系数):计算公式为 R² = SSR ÷ SST。它代表了因变量的总变异中,能被自变量通过线性模型解释的比例。
- 相关系数 r:其大小等于 √R²,其符号与斜率 b 相同,亦可通过 Sxy ÷ √(Sxx·Syy) 直接求得。r 衡量的是两个变量之间线性相关的方向与强度。
- 调整后 R²:由于引入无意义的自变量也会使 R² 增加,因此在评估模型时会使用调整后 R² = 1 − (1 − R²)(n − 1) ÷ (n − 2) 来修正自由度带来的偏差。
均值置信区间与单值预测区间的差异
当利用拟合出的回归方程在特定的自变量值 x₀ 处预测因变量 ŷ₀ = a + b·x₀ 时,计算器会提供两种不同性质的区间估计:
- 均值置信区间:针对在该 x₀ 处所有可能历史观测值的平均响应。其标准误差为 s · √(1÷n + (x₀ − x̄)² ÷ Sxx)。
- 单值预测区间:针对在 x₀ 处某一个全新独立观测值的预测。由于单个新观测值本身存在随机波动,其标准误差必须将此波动纳入,公式为 s · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx)。
由于单值预测区间的标准误差公式中多了一项“1”,因此在相同的置信水平下,单值预测区间总是比均值置信区间更宽。随着预测点 x₀ 逐渐偏离样本均值 x̄,这两种区间的宽度都会呈抛物线状向两侧变宽。
数据输入规范与异常边界处理
本工具支持“成对行”与“两个列表”两种数据布局。在输入数据时,需遵循以下格式与边界规则:
- 分隔符规则:使用英文句点作为小数点时,列表数值可用空格、逗号或换行符分隔;使用逗号作为小数点时,列表数值须用空格、分号或换行符分隔。
- 自动忽略表头:若成对输入的第一行两个元素均为非数字,系统会将其视作电子表格的表头行并自动跳过,方便直接复制粘贴。
- 外推提示:若输入的预测值 x 超出了原始数据的取值范围,系统会在预测结果中显示“超出数据范围”,并提示“标记的行所使用的 x 值超出了你输入的数据范围,因此该拟合线已被延伸到现有数据之外”。
- 数据规模限制:数据点数需介于 2 至 50,000 个之间(文本大小不超过 1 MB),预测值最多支持 50 个。
异常边界状态说明
在特定极端数据分布下,计算器会输出相应的状态提示:
- 恰好两个点:“两个点可以精确确定一条直线,因此没有多余的数据来估计不确定性。”
- 完美拟合:“所有数据点都精确地落在拟合线上,因此没有残差波动,无法估计置信区间或 p 值。”
- 因变量无变异:“所有的 y 值都相同,因此拟合线是水平的,r、R² 和显著性检验均未定义。”
- 自变量无变异(垂直线):触发错误提示“所有的 x 值都相同,这将导致拟合线呈垂直状态,且计算斜率时除数为零。”并停止计算。
隐私保护与本地计算说明
本工具充分保护用户的个人数据隐私。你的数据点和所有统计数据均保留在此浏览器中,绝不会被上传。所有的回归拟合、矩阵运算、残差分析以及图表绘制均在用户的本地设备上实时完成,无需与任何外部服务器进行数据交互。
常见问题解答
我把哪一列放在 x 中有关系吗?
是的。最小二乘法使垂直偏差最小化,因此它将 y 视为被解释变量,将 x 视为解释变量。如果将它们对调,你将得到不同的斜率和截距 —— 只有 r 和 R² 保持不变。请将你想要预测的变量放在 y 中;如果列放反了,点击对调按钮即可直接在原位重写它们。
R² 究竟能告诉我什么?
R² 是指 y 的上下波动中由拟合线所解释的比例:0.96 意味着 96% 的波动与 x 一致,而 4% 的波动无法被解释。它并不能说明直线是否是正确的拟合形状 —— 明显的曲线同样可以获得很高的得分 —— 因此请结合残差图来阅读它。相关系数 r 是 R² 的平方根,并带有斜率的符号,这就是为什么下行线的 r 值为负数。
为什么预测结果会提供两个区间?
它们回答的是不同的问题。均值置信区间回答的是:在特定的 x 处,所有个体的平均 y 值落在哪里,因此它只考虑拟合线本身的不确定性。而单值预测区间回答的是:一个新的观测值会落在哪里,这需要加上数据点在拟合线周围的离散程度 —— 正是因为多了这一项,单值预测区间总是比均值置信区间更宽。随着 x 远离数据的中心,这两个区间都会变宽。
较小的 p 值是否意味着 x 导致了 y?
不能。p 值只回答一个特定的小问题:如果真实的斜率确实为 0,那么这种规模的样本有多大概率产生一个与 0 偏差至少如此之大的斜率?较小的 p 值仅仅意味着“两者完全没有关系”这一解释显得很牵强,仅此而已。因果关系需要研究设计的支持 —— 影响两个变量的第三因素,或者非独立收集的样本,同样很容易产生极小的 p 值。