線性迴歸計算器

擬合最小平方法迴歸線,一站式讀取其斜率、R²、p 值、信賴區間、殘差與預測值。

資料

先輸入 x,再輸入 y。從試算表複製的兩欄資料可以直接貼上,包含標題列。小數點使用句點,例如 12.5。
選填。最多 50 個數值,以空格分隔。

迴歸線

最小平方法迴歸線

係數

項目估計值標準誤tp{level}% 信賴區間

變異數分析

變異來源自由度 (df)平方和均方Fp

擬合與殘差

預測結果

平均值信賴區間涵蓋該 x 下的平均 y 值。個別值預測區間涵蓋單一個新觀測值,因此範圍總是較寬。

xŷ平均值 {level}%個別值 {level}%

逐點分析

xyŷy − ŷ

公式與代入計算

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    您的資料點與所有統計數據均保留在此瀏覽器中,絕不會被上傳。

    常見問題

    R² 實際上告訴了我什麼?

    R² 是 y 的上下起伏變異中,可由迴歸線解釋的比例:0.96 代表有 96% 的變異與 x 一致,而有 4% 則無法解釋。它無法說明直線是否為正確的擬合形狀 — 明顯的曲線仍可能獲得極高的分數 — 因此請務必配合殘差圖一起解讀。相關係數 r 是 R² 的平方根並帶有斜率的正負號,這也是為什麼遞減的迴歸線其 r 值會是負數。

    極小的 p 值是否代表 x 導致了 y?

    不會。p 值僅回答一個狹隘的問題:如果真實斜率為 0,在相同樣本大小下,有多大的機率會得到與 0 相差至少如此之遠的斜率?極小的 p 值僅代表「兩者毫無關係」這個解釋顯得牽強,僅此而已。因果關係需要研究設計的支持 — 影響這兩個欄位的第三個潛在因素,或是非獨立收集的樣本,都同樣容易產生極小的 p 值。

    為什麼預測結果會提供兩種區間?

    這兩個區間回答不同的問題。平均值信賴區間探討的是在特定 x 下,所有對象的平均 y 值落在哪裡,因此僅計算迴歸線本身的誤差。個別值預測區間探討的是單一個新觀測值會落在哪裡,這必須加上資料點圍繞迴歸線的離散程度 — 正是因為多了這項變異,個別值預測區間總是比平均值信賴區間更寬。當 x 越遠離資料的中心時,這兩個區間都會變寬。

    我把哪一個欄位放在 x 有關係嗎?

    是的。最小平方法會將垂直距離最小化,因此它將 y 視為被解釋變數,將 x 視為解釋變數。將兩者對調會得到不同的斜率與截距 — 只有 r 與 R² 會保持不變。請將您想要預測的變數放在 y;如果欄位放反了,可以使用對調按鈕直接在原處重寫。

    最小平方法線性迴歸的數學原理

    線性迴歸是統計學中用來建模兩個連續變數之間關係的經典方法。本計算器採用普通最小平方法(Ordinary Least Squares, OLS),在二維空間中尋找一條直線,使得所有觀測點到該直線的垂直距離(即殘差)平方和達到最小。

    為了確保在高精度計算時不會因為數值捨入而損失精確度,本工具在計算離差平方和時,採用了雙遍補償求和演算法(Compensated Summation)來計算圍繞平均值的離差:

    • 自變數離差平方和:Sxx = Σ(xᵢ − x̄)²
    • 應變數離差平方和:Syy = Σ(yᵢ − ȳ)²
    • 共變異離差平方和:Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)

    透過上述基礎變數,即可推導出迴歸線的兩大核心參數:

    • 斜率 b:b = Sxy ÷ Sxx
    • 截距 a:a = ȳ − b·x̄

    其中,x̄ 與 ȳ 分別代表自變數與應變數的算術平均值。當您輸入資料後,計算器會即時進行運算,並在「公式與代入計算」區域中依序呈現以下推導步驟,方便您驗證計算過程:

    1. 平均值:x̄ = ‹sumX› ÷ ‹n› = ‹meanX› 且 ȳ = ‹sumY› ÷ ‹n› = ‹meanY›
    2. 離差平方和與共變異:Sxx = ‹sxx› 且 Sxy = ‹sxy›
    3. 斜率:b = Sxy ÷ Sxx = ‹sxy› ÷ ‹sxx› = ‹slope›
    4. 截距:a = ȳ − b·x̄ = ‹meanY› − (‹slope›‹meanX› = ‹intercept›

    迴歸係數與統計顯著性檢定

    擬合出迴歸線後,評估斜率與截距的統計顯著性是推論統計的重要步驟。本工具會計算係數的標準誤,並進行雙尾 t 檢定,以確認自變數對應變數是否具有顯著影響。

    在「係數」表格中,各欄位分別對應「項目」、「估計值」、「標準誤」、「t」、「p」以及「‹level›% 信賴區間」。其背後的數學公式如下:

    • 殘差標準差 s:s = √(SSE ÷ (n − 2)),其中 SSE 為殘差平方和(Σ(yᵢ − ŷᵢ)²)。
    • 斜率標準誤 SE(b):SE(b) = s ÷ √Sxx。
    • 截距標準誤 SE(a):SE(a) = s · √(1÷n + x̄² ÷ Sxx)。
    • t 統計量:t = 估計值 ÷ 其標準誤。

    在自由度為 n − 2 的條件下,利用正規化不完全 Beta 函數計算出雙尾 p 值。若單一自變數模型中,斜率的 t 檢定與整體 F 檢定所得到的 p 值完全相同。

    變異數分析與擬合優度指標

    為了評估迴歸模型對資料的解釋能力,計算器提供了「變異數分析」表格,將總變異拆解為可解釋與不可解釋的部分:

    變異來源 自由度 (df) 平方和 均方 F p
    迴歸解釋變異 1 SSR MSR = SSR ÷ 1 MSR ÷ MSE p 值
    殘差(未解釋變異) n − 2 SSE MSE = SSE ÷ (n − 2)
    總計 n − 1 SST

    透過變異數的拆解,我們可以定義出以下指標來衡量模型的擬合優度:

    • R²(決定係數):R² = SSR ÷ SST,代表 y 的總變異中可由迴歸線解釋的比例。
    • 調整後 R²:1 − (1 − R²)(n − 1) ÷ (n − 2),排除了樣本數對解釋力的虛增影響。
    • 相關係數 r:r = √R²,其正負號與斜率 b 相同,用以表示兩變數間的線性相關強度與方向。

    預測區間與殘差分析

    當您在「預測特定 x 的 y 值」輸入預測點時,計算器會計算出預測值 ŷ₀ = a + b·x₀,並提供兩種不同定義的區間:

    1. 平均值 ‹level›%:針對特定 x₀ 下,所有可能 y 平均值的信賴區間。其標準誤為 s · √(1÷n + (x₀ − x̄)² ÷ Sxx)。
    2. 個別值 ‹level›%:針對單一新觀測值的預測區間。由於必須額外考慮個體圍繞迴歸線的隨機波動,其標準誤為 s · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx)。因此,個別值預測區間的範圍永遠比平均值信賴區間更寬。

    若您輸入的預測 x 值超出了原始資料的範圍,系統會在預測結果中標記「超出資料範圍」,並顯示提示:「標記的資料列所使用的 x 值超出了您輸入的資料範圍,因此該線段是延伸至現有資料之外的預測。」

    此外,在「擬合與殘差」圖表中,您可以觀察「包含最小平方法迴歸線與其平均值信賴帶的散佈圖」與「殘差對 x 的分佈圖,分佈在零線周圍」,藉此檢查資料是否符合線性關係與常態分佈假設。

    資料輸入規範與邊界條件

    本計算器支援「成對資料列」與「兩組清單」兩種版面配置。為了確保計算順利進行,請遵循以下輸入規則與系統限制:

    • 資料量限制:最少需輸入 2 個點,上限為 50,000 個點且複製文字不超過 1 MB。預測值輸入上限為 50 個。
    • 小數點與分隔符號
      • 使用句點(.)作為小數點時,清單數值需以空格、逗號或換行分隔。
      • 使用逗號(,)作為小數點時,清單數值需以空格、分號或換行分隔。
    • 自動忽略標頭:若成對資料的第一列包含非數值文字,系統會自動將其視為試算表的標頭列並予以忽略,方便您直接複製貼上。
    • 特殊邊界狀況
      • 剛好兩個點:系統會顯示「兩個點會剛好決定一條線,因此沒有多餘的資訊可用於估計不確定性。」
      • 完美擬合:若所有點皆在線上,系統會顯示「資料點完全落在迴歸線上,因此沒有殘差變異,無法估計信賴區間或 p 值。」
      • 所有 y 值相同:系統會顯示「所有的 y 值皆相同,因此迴歸線為水平線,r、R² 與顯著性檢定皆無定義。」
      • 所有 x 值相同:系統會停止計算並顯示錯誤訊息:「所有的 x 值皆相同,這會導致迴歸線呈垂直狀態,且斜率計算會除以零。」

    隱私保護與本地運算說明

    本工具非常重視您的資料隱私。您的資料點與所有統計數據均保留在此瀏覽器中,絕不會被上傳。所有的矩陣運算、公式代入、圖表繪製與統計檢定皆完全在您的本機瀏覽器中即時完成,不會與任何外部伺服器進行資料交換。


    常見問題

    我把哪一個欄位放在 x 有關係嗎?

    是的。最小平方法會將垂直距離最小化,因此它將 y 視為被解釋變數,將 x 視為解釋變數。將兩者對調會得到不同的斜率與截距 — 只有 r 與 R² 會保持不變。請將您想要預測的變數放在 y;如果欄位放反了,可以使用對調按鈕直接在原處重寫。

    R² 實際上告訴了我什麼?

    R² 是 y 的上下起伏變異中,可由迴歸線解釋的比例:0.96 代表有 96% 的變異與 x 一致,而有 4% 則無法解釋。它無法說明直線是否為正確的擬合形狀 — 明顯的曲線仍可能獲得極高的分數 — 因此請務必配合殘差圖一起解讀。相關係數 r 是 R² 的平方根並帶有斜率的正負號,這也是為什麼遞減的迴歸線其 r 值會是負數。

    為什麼預測結果會提供兩種區間?

    這兩個區間回答不同的問題。平均值信賴區間探討的是在特定 x 下,所有對象的平均 y 值落在哪裡,因此僅計算迴歸線本身的誤差。個別值預測區間探討的是單一個新觀測值會落在哪裡,這必須加上資料點圍繞迴歸線的離散程度 — 正是因為多了這項變異,個別值預測區間總是比平均值信賴區間更寬。當 x 越遠離資料的中心時,這兩個區間都會變寬。

    極小的 p 值是否代表 x 導致了 y?

    不會。p 值僅回答一個狹隘的問題:如果真實斜率為 0,在相同樣本大小下,有多大的機率會得到與 0 相差至少如此之遠的斜率?極小的 p 值僅代表「兩者毫無關係」這個解釋顯得牽強,僅此而已。因果關係需要研究設計的支持 — 影響這兩個欄位的第三個潛在因素,或是非獨立收集的樣本,都同樣容易產生極小的 p 值。