調查加權與樣本校準
在進行問卷調查時,樣本的統計分佈往往與實際母體存在偏差。調查加權計算器提供了一個便捷的線上工具,採用耙梳法(Raking,即反覆比例擬合演算法),將受訪者數據校準至已知的母體邊際分佈。
本工具完全在您的瀏覽器中進行本地端運算,受訪者資料與計算出的權重均保留在此瀏覽器中,絕不會被上傳。
耙梳法與事後分層的差異
當調查僅需依據單一類別變數(例如僅依據性別)進行調整時,計算器會執行單一邊際行為:每個類別直接獲得「目標比例 ÷ 目前比例」的調整因子,在單一循環內即可完成校準。這就是傳統的事後分層(Post-Stratification)。
然而,當需要同時校準多個變數(例如性別、年齡與地區)時,直接進行多維交叉分層會導致細分單元格(Cells)過多,甚至出現樣本數為零的空單元格。耙梳法(Raking)則是在不要求交叉組合的情況下,依次對各個變數的邊際分佈進行循環調整,直到所有邊際分佈在設定的相對容許度內達到收斂。
輸入資料格式與限制
為了確保演算法順利執行,輸入的數據必須符合以下格式與限制:
1. 受訪者資料 (Respondents)
- 格式要求:必須包含一個標題列與至少一列受訪者資料。支援定位鍵(Tab)、分號或 CSV 逗號作為分隔符號。在小數點符號不是點號(Dot)的地區,請使用定位鍵或分號,以便小數點保留在儲存格內。
- 限制:字數不能超過 2,000,000 個字元,且最多只能使用 20,000 列受訪者資料。受訪者表格需要至少兩個具備名稱的欄位,且標題列不得有空白,每個受訪者資料欄位都需要唯一的標題名稱。
2. 母體邊際 (%) (Targets)
- 格式要求:必須剛好有三個儲存格,依序為:變數、類別與百分比。
- 限制:最多只能使用 500 列目標、6 個校準變數,且每個變數最多 100 個目標類別。每個變數的目標百分比總和必須剛好為 100%,且個別目標值必須介於 0% 到 100% 之間(含)。
3. 基準權重與結果欄位(選填)
- 基準權重欄位:選填且無因次。若留空,則所有人的初始權重皆預設為 1。若提供,該欄位數值必須為大於 0 的有限值。
- 結果欄位:選填的有限數值欄位,用於比較加權前後的平均值,結果將保留該欄位本身的單位。
演算法公式與標準化
計算器在運算過程中,會依據以下公式進行計算與標準化:
1. 調整因子計算
在每一次疊代中,針對特定變數與類別進行調整:
factor = 目標總和 ÷ 目前總和
具體代入公式為:
‹variable› / ‹category›:因子 = 目標總和 ÷ 目前總和 = ‹target› ÷ ‹current› = ‹factor›
2. 權重標準化
為了保持樣本規模的直觀性,計算器會將最終權重標準化至平均值為 1,使其總和等於受訪者人數:
Σ w = n
具體代入公式為:
將最終權重標準化至平均值為 1,使其總和等於受訪者人數:Σw = n = ‹count›。
3. Kish 權重效應與有效樣本數
不等權重會降低統計精確度。計算器提供以下診斷指標:
- Kish 權重效應:
Kish 權重效應 = n·Σw² ÷ (Σw)² = ‹count›·‹sumSquares› ÷ ‹sum›² = ‹effect›。 - 有效樣本數:
有效樣本數 = (Σw)² ÷ Σw² = ‹sum›² ÷ ‹sumSquares› = ‹effective›。
這些權重僅與您提供的邊際匹配,不與您未提供的變數匹配。Kish 診斷僅反映權重不等值;它不包含集群、分層或完整的調查變異數估計。
診斷、警告與錯誤訊息
計算器在執行時會即時回傳診斷狀態,並在數據不合規時顯示對應的錯誤:
- 邊際匹配成功:顯示「所有
‹margins›個母體邊際皆已匹配」。 - 初始已匹配:若無須調整,顯示「初始權重已與所有要求的邊際匹配。」。
- 極端權重警告:若最大權重與最小權重差異過大,顯示「邊際已匹配,但最大權重是最小權重的
‹ratio›倍;在使用前請先檢查有效樣本數。」。 - 未收斂警告:若達到最大疊代次數限制仍未收斂,顯示「在收斂前已達到疊代次數限制(
‹iterations›)。顯示最後的權重僅供診斷,不作為校準結果。」。 - 零儲存格錯誤:若某類別有目標值但在樣本中無受訪者,顯示「“
‹variable›/‹category›”具有大於零的目標,但沒有可用的樣本權重,因此不存在有限解。」。
當計算成功收斂後,點擊「複製加權數據」可複製完整的受訪者表格,系統會自動追加 raking_adjustment 與 raking_weight 欄位(若名稱重複則會加上數字字尾)。
常見問題解答 (FAQ)
我應該使用什麼作為基準權重?
請使用在進行母體校準前的權重——通常是每位受訪者最終抽取機率的倒數,並加上您的研究所需的任何前期無回應調整。如果您沒有機率權重,請將此欄位留空,讓所有人的初始權重皆為 1。這會產生校準權重,但並不會將便利樣本轉化為機率樣本。
什麼是耙梳法?什麼時候單一邊際就只是事後分層?
耙梳法(Raking)每次調整一個已知的母體邊際,然後循環調整,直到在進行後續調整後,先前的邊際仍能保持匹配。如果您只提供一個類別變數,則只需一個循環即可:每個類別都會獲得常見的「目標比例 ÷ 目前比例」調整。多個邊際並不會強制其未列出的交叉組合也達到匹配。
為什麼目標會無解或無法收斂?
如果某個類別在樣本中沒有任何受訪者,就無法建立大於零的目標。當有多個變數時,觀測到的組合也可能使原本看似合理的邊際變得互不相容。極短的疊代限制或極端的初始權重也可能在達到要求的容許度之前停止。目標稽核與最差目標記錄會顯示仍存在不匹配的地方;請勿將這些最後的權重視為已校準。
Kish 權重效應是完整的調查設計效應嗎?
否。它僅衡量與權重不等值相關的精確度損失:權重相等時值為 1,而權重變異越大則會降低有效樣本數。集群、分層、有限母體校正以及結果與校準變數之間的關係,都可能改變實際的變異數。若要計算標準誤與信賴區間,請使用支援完整抽樣設計的軟體。