運作原理與雙重計算模式
本計算器提供兩種分析數據離散度與常態分佈的計算模式:
- 從數據集:直接貼上原始數值,系統會即時計算出平均值、方差、標準差,並列出每個數值對應的 z 分數。
- 從摘要數值:在 z = (x - μ) / σ 公式中輸入任意三個已知數值,系統會自動求解第四個未知數,並同步計算出常態分佈曲線概率。
所有計算與數據處理均在用戶的網頁瀏覽器中本地進行,輸入的數據和計算結果絕不會被上傳至外部伺服器。
數據集輸入規範與限制
在「從數據集」模式下,用戶可於「數據集」文字輸入框中貼上或輸入數值。
- 格式支援:數值之間可以透過空格、逗號、分號或換行進行分隔。根據用戶的地區設定,小數點可使用句點(例如
82.5)或逗號(例如82,5)。 - 數據量限制:數據集總數必須在 50,000 個數值以內。
- 極限條件:
- 若選擇「樣本 ÷ n − 1」標準差,數據集必須包含至少 2 個數值。若只有 1 個數值,會觸發錯誤提示:「樣本需要至少 2 個數值 —— 只有一個數值時,分母 n − 1 為零。」
- 若選擇「總體 ÷ n」標準差,則必須輸入至少 1 個數值,否則會顯示:「請輸入至少一個數值。」
- 若輸入非數字字元,系統會顯示:「「
‹token›」不是數字(第‹position›個值)。」
總體與樣本標準差的數學原理
標準差用於衡量數據點與平均值之間的離散程度。本計算器提供兩種標準差計算約定:
- 總體標準差 (σ):適用於數據集已包含所關注的整個群體之情況。計算時分母為 n。
- 樣本標準差 (s):當數據僅為更大群體中的一個樣本,且旨在估算該群體的離散程度時使用。計算時分母為 n - 1(即貝塞爾修正),用以修正樣本帶有的向下偏差。
逐步計算公式與代入
計算器會在「公式與代入計算」區域詳細列出每一步驟:
- 平均值:平均值 = 總和 ÷ n
- 離差平方和 (SS):SS = Σ(x - 平均值)²
- 方差:
- 總體方差:σ² = SS ÷ n
- 樣本方差:s² = SS ÷ (n - 1)
- 標準差:
- 總體標準差:σ = √(σ²)
- 樣本標準差:s = √(s²)
若數據集中所有數值完全相同,數據便沒有任何離散度。此時標準差為 0,系統會顯示錯誤提示:「所有數值均相同,因此標準差為 0,z 分數未定義。」 同時在公式區域顯示:「所有數值均等於平均值,因此 SS = 0 且標準差為 0 —— 除以 0 是未定義的。」
Z 分數公式與代數求解
z 分數(又稱標準分數)代表一個特定數值距離平均值有多少個標準差。其基本公式為:
z = (x - μ) / (σ)
在「從摘要數值」模式下,用戶必須在「數值 x」、「平均值 μ」、「標準差 σ」及「z 分數 z」四個欄位中填寫剛好三個,並將需要求解的欄位留空。若未遵守此規則,系統會提示:「請剛好留空四個欄位中的其中一個。」
根據留空的欄位,計算器會採用相應的代數變形進行求解:
| 求解目標 | 代數公式與代入顯示 |
|---|---|
| 求得的 z 分數 z | z 分數:z = (x − μ) ÷ σ = (‹x› − ‹mu›) ÷ ‹sigma› = ‹result› |
| 求得的數值 x | 數值:x = μ + z·σ = ‹mu› + (‹z›)·‹sigma› = ‹result› |
| 求得的平均值 μ | 平均值:μ = x − z·σ = ‹x› − (‹z›)·‹sigma› = ‹result› |
| 求得的標準差 σ | 標準差:σ = (x − μ) ÷ z = (‹x› − ‹mu›) ÷ ‹z› = ‹result› |
摘要模式的邊界與錯誤限制
- 標準差非零與正數限制:標準差必須為正數。若輸入 0,會顯示:「標準差不能為 0 —— 除以 σ 是未定義的。」;若輸入負數,則顯示:「標準差必須為正數。」
- 無解情況:若輸入 z = 0 但 x ≠ μ,則沒有任何正數標準差能滿足公式,系統會提示:「沒有正數 σ 能滿足此條件:當 z = 0 時,數值必須等於平均值。」
- 無限解情況:若 z = 0 且 x = μ,任何正數標準差皆成立,系統會提示:「當 z = 0 且 x = μ 時,任何正數 σ 均成立,因此 σ 沒有唯一答案。」
- 代數結果為負:若計算得出的標準差為負數,系統會顯示:「代數計算得出 σ =
‹value›,但標準差不能為 負數。請檢查 x − μ 和 z 的正負號。」 - 數值溢出:若任何輸入或中間計算超出系統極限,會顯示:「數值或中間計算結果超出了支援的數字範圍。」
常態分佈與概率映射
當求得 z 分數後,計算器會假設數值符合常態分佈,並提供標準常態曲線下的面積與概率分析:
- $P(X < x)$:數值小於 x 的累積概率(即標準常態分佈函數 Φ(z))。
- $P(X > x)$:數值大於 x 的概率。
- P(|X - μ| > |x - μ|):雙尾概率,即數值與平均值的偏差大於 x 與平均值偏差的概率。
- x 的百分位數:將累積概率轉化為百分位數表示。
計算器亦會繪製「包含平均值和標準差區間的數值數軸」(標示平均值、±1 標準差、±2 標準差及 ±3 標準差)以及「z 左側區域陰影顯示的標準常態分佈曲線」,幫助用戶直觀理解數據分佈。
常見問題
z 分數是否假設我的數據呈常態分佈?
不是。z 分數僅僅是一種重新縮放的線性變換,用以表示一個數值距離平均值有多少個標準差,它適用於任何標準差不為零的數據集。只有在計算常態分佈概率(如 $P(X < x)$)與百分位數時,計算器才假設數據呈常態分佈。對於偏態數據,實際的數據分佈比例可能會與常態曲線預測的概率有所偏差。
我應該在甚麼時候除以 n − 1 而不是 n?
當你的數據只是來自更大群體的「樣本」,且你想估算整個群體的離散程度時,應選擇除以 n - 1(即樣本標準差 s),這能修正樣本因規模限制而產生的向下偏差。如果你輸入的數據已是你想研究的整個「總體」(例如全班學生的完整成績),則應除以 n(即總體標準差 σ)。
為甚麼當所有數值都相同時,z 分數會未定義?
因為計算 z 分數的公式中,分母是標準差。當數據集中所有數值完全相同時,數據之間沒有任何離散度,因此標準差為 0。在數學上,除以 0 是未定義的,這代表所有數據點都剛好落在平均值上,無法用單一的 z 分數來表達其相對位置。