线性回归计算器

对成对数据进行最小二乘法拟合,一站式查看其斜率、R²、p 值、置信区间、残差和预测值。

数据

先输入 x,然后输入 y。从电子表格中复制的两列可以直接粘贴,包含表头行。使用英文句点表示小数,例如 12.5。
选填。最多 50 个数值,用空格分隔。

回归线

最小二乘法拟合线

系数

估计值标准误差tp{level}% 置信区间

方差解释

变异源df平方和均方Fp

拟合与残差

预测结果

均值置信区间覆盖了该 x 处的平均 y 值。单值预测区间覆盖了一个新的观测值,因此它总是更宽。

xŷ均值 {level}%单值 {level}%

逐点分析

xyŷy − ŷ

公式与代入计算

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    你的数据点和所有统计数据均保留在此浏览器中,绝不会被上传。

    常见问题

    R² 究竟能告诉我什么?

    R² 是指 y 的上下波动中由拟合线所解释的比例:0.96 意味着 96% 的波动与 x 一致,而 4% 的波动无法被解释。它并不能说明直线是否是正确的拟合形状 —— 明显的曲线同样可以获得很高的得分 —— 因此请结合残差图来阅读它。相关系数 r 是 R² 的平方根,并带有斜率的符号,这就是为什么下行线的 r 值为负数。

    较小的 p 值是否意味着 x 导致了 y?

    不能。p 值只回答一个特定的小问题:如果真实的斜率确实为 0,那么这种规模的样本有多大概率产生一个与 0 偏差至少如此之大的斜率?较小的 p 值仅仅意味着“两者完全没有关系”这一解释显得很牵强,仅此而已。因果关系需要研究设计的支持 —— 影响两个变量的第三因素,或者非独立收集的样本,同样很容易产生极小的 p 值。

    为什么预测结果会提供两个区间?

    它们回答的是不同的问题。均值置信区间回答的是:在特定的 x 处,所有个体的平均 y 值落在哪里,因此它只考虑拟合线本身的不确定性。而单值预测区间回答的是:一个新的观测值会落在哪里,这需要加上数据点在拟合线周围的离散程度 —— 正是因为多了这一项,单值预测区间总是比均值置信区间更宽。随着 x 远离数据的中心,这两个区间都会变宽。

    我把哪一列放在 x 中有关系吗?

    是的。最小二乘法使垂直偏差最小化,因此它将 y 视为被解释变量,将 x 视为解释变量。如果将它们对调,你将得到不同的斜率和截距 —— 只有 r 和 R² 保持不变。请将你想要预测的变量放在 y 中;如果列放反了,点击对调按钮即可直接在原位重写它们。

    最小二乘法线性回归的数学原理

    线性回归分析的核心在于寻找一条直线,使所有观测点到该直线的垂直距离平方和达到最小,这一方法被称为普通最小二乘法(OLS)。在线性回归计算器中,该算法严格遵循 NIST/SEMATECH 统计方法手册的标准规范进行构建。

    为了在处理数值差异极大的数据集时避免精度损失,计算器在底层采用补偿求和法,分两遍计算各变量围绕其均值的离差平方和与协方差:

    • 自变量离差平方和:Sxx = Σ(xᵢ − x̄)²
    • 因变量离差平方和:Syy = Σ(yᵢ − ȳ)²
    • 协方差:Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)

    基于上述基础累加值,即可推导出回归方程的两个核心参数——斜率 b 与截距 a:

    • 斜率:b = Sxy ÷ Sxx
    • 截距:a = ȳ − b·x̄

    其中,x̄ 和 ȳ 分别代表自变量和因变量的算术平均值。

    回归系数的统计学解释

    拟合完成后的回归方程可写作 ŷ = a + bx。这两个系数具有明确的物理与实际意义:

    • 斜率 b:代表自变量每变动一个单位时,因变量的平均变化量。在输出结果中,其物理意义体现为“平均而言,x 每增加 1,y 就会变化 ‹slope›”。
    • 截距 a:代表自变量为零时因变量的预测值。在输出结果中,其物理意义体现为“当 x 为 0 时,拟合线位于 y = ‹intercept› 处”。

    为了评估这些估计值的可靠性,计算器会计算其标准误差。残差均方(MSE)的计算公式为 MSE = SSE ÷ (n − 2),其中残差平方和 SSE = Σ(yᵢ − ŷᵢ)²。由此可得残差标准差 s = √MSE。

    斜率的标准误差为 SE(b) = s ÷ √Sxx,而截距的标准误差为 SE(a) = s · √(1÷n + x̄² ÷ Sxx)。利用 t = 估计值 ÷ 标准误差,可以在自由度为 n − 2 的 t 分布下进行双侧显著性检验,从而计算出 p 值,以评估自变量与因变量之间是否存在显著的线性关系。

    变异解释度:r 与 R² 的区别

    在回归分析中,总平方和(SST,即 Syy)被拆分为两个部分:由拟合线解释的平方和(SSR = SST − SSE)以及残差平方和(SSE)。

    • R²(决定系数):计算公式为 R² = SSR ÷ SST。它代表了因变量的总变异中,能被自变量通过线性模型解释的比例。
    • 相关系数 r:其大小等于 √R²,其符号与斜率 b 相同,亦可通过 Sxy ÷ √(Sxx·Syy) 直接求得。r 衡量的是两个变量之间线性相关的方向与强度。
    • 调整后 R²:由于引入无意义的自变量也会使 R² 增加,因此在评估模型时会使用调整后 R² = 1 − (1 − R²)(n − 1) ÷ (n − 2) 来修正自由度带来的偏差。

    均值置信区间与单值预测区间的差异

    当利用拟合出的回归方程在特定的自变量值 x₀ 处预测因变量 ŷ₀ = a + b·x₀ 时,计算器会提供两种不同性质的区间估计:

    1. 均值置信区间:针对在该 x₀ 处所有可能历史观测值的平均响应。其标准误差为 s · √(1÷n + (x₀ − x̄)² ÷ Sxx)。
    2. 单值预测区间:针对在 x₀ 处某一个全新独立观测值的预测。由于单个新观测值本身存在随机波动,其标准误差必须将此波动纳入,公式为 s · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx)。

    由于单值预测区间的标准误差公式中多了一项“1”,因此在相同的置信水平下,单值预测区间总是比均值置信区间更宽。随着预测点 x₀ 逐渐偏离样本均值 x̄,这两种区间的宽度都会呈抛物线状向两侧变宽。

    数据输入规范与异常边界处理

    本工具支持“成对行”与“两个列表”两种数据布局。在输入数据时,需遵循以下格式与边界规则:

    • 分隔符规则:使用英文句点作为小数点时,列表数值可用空格、逗号或换行符分隔;使用逗号作为小数点时,列表数值须用空格、分号或换行符分隔。
    • 自动忽略表头:若成对输入的第一行两个元素均为非数字,系统会将其视作电子表格的表头行并自动跳过,方便直接复制粘贴。
    • 外推提示:若输入的预测值 x 超出了原始数据的取值范围,系统会在预测结果中显示“超出数据范围”,并提示“标记的行所使用的 x 值超出了你输入的数据范围,因此该拟合线已被延伸到现有数据之外”。
    • 数据规模限制:数据点数需介于 2 至 50,000 个之间(文本大小不超过 1 MB),预测值最多支持 50 个。

    异常边界状态说明

    在特定极端数据分布下,计算器会输出相应的状态提示:

    • 恰好两个点:“两个点可以精确确定一条直线,因此没有多余的数据来估计不确定性。”
    • 完美拟合:“所有数据点都精确地落在拟合线上,因此没有残差波动,无法估计置信区间或 p 值。”
    • 因变量无变异:“所有的 y 值都相同,因此拟合线是水平的,r、R² 和显著性检验均未定义。”
    • 自变量无变异(垂直线):触发错误提示“所有的 x 值都相同,这将导致拟合线呈垂直状态,且计算斜率时除数为零。”并停止计算。

    隐私保护与本地计算说明

    本工具充分保护用户的个人数据隐私。你的数据点和所有统计数据均保留在此浏览器中,绝不会被上传。所有的回归拟合、矩阵运算、残差分析以及图表绘制均在用户的本地设备上实时完成,无需与任何外部服务器进行数据交互。

    常见问题解答

    我把哪一列放在 x 中有关系吗?

    是的。最小二乘法使垂直偏差最小化,因此它将 y 视为被解释变量,将 x 视为解释变量。如果将它们对调,你将得到不同的斜率和截距 —— 只有 r 和 R² 保持不变。请将你想要预测的变量放在 y 中;如果列放反了,点击对调按钮即可直接在原位重写它们。

    R² 究竟能告诉我什么?

    R² 是指 y 的上下波动中由拟合线所解释的比例:0.96 意味着 96% 的波动与 x 一致,而 4% 的波动无法被解释。它并不能说明直线是否是正确的拟合形状 —— 明显的曲线同样可以获得很高的得分 —— 因此请结合残差图来阅读它。相关系数 r 是 R² 的平方根,并带有斜率的符号,这就是为什么下行线的 r 值为负数。

    为什么预测结果会提供两个区间?

    它们回答的是不同的问题。均值置信区间回答的是:在特定的 x 处,所有个体的平均 y 值落在哪里,因此它只考虑拟合线本身的不确定性。而单值预测区间回答的是:一个新的观测值会落在哪里,这需要加上数据点在拟合线周围的离散程度 —— 正是因为多了这一项,单值预测区间总是比均值置信区间更宽。随着 x 远离数据的中心,这两个区间都会变宽。

    较小的 p 值是否意味着 x 导致了 y?

    不能。p 值只回答一个特定的小问题:如果真实的斜率确实为 0,那么这种规模的样本有多大概率产生一个与 0 偏差至少如此之大的斜率?较小的 p 值仅仅意味着“两者完全没有关系”这一解释显得很牵强,仅此而已。因果关系需要研究设计的支持 —— 影响两个变量的第三因素,或者非独立收集的样本,同样很容易产生极小的 p 值。