Kalkulačka váženia prieskumu

Vykonajte raking údajov respondentov na známe okraje populácie a potom skontrolujte každú finálnu váhu, rezíduum cieľa a efektívnu veľkosť vzorky.

Vzorka a cieľové hodnoty

Vložte záhlavie a až 20,000 riadkov s respondentmi (2,000,000 znakov). Použite tabulátory alebo bodkočiarky, aby desatinná čiarka vášho regionálneho nastavenia zostala vo vnútri každej bunky.
Použite premennú, kategóriu a cieľové percento (0 % – 100 %): najviac 500 riadkov, 6 premenných a 100 kategórií pre každú. Každá premenná musí pokrývať všetky vybrané kategórie a mať súčet 100 %.
Voliteľný a bezrozmerný. Ponechajte prázdny, ak chcete u všetkých začať s váhou 1. Hodnoty musia byť konečné a väčšie ako 0.
Voliteľný konečný číselný stĺpec používaný iba na porovnanie vážených priemerov; výsledky si zachovávajú vlastnú jednotku stĺpca.
Bezrozmerná. Zastavte, keď je relatívna chyba každého cieľa na úrovni tejto hodnoty alebo pod ňou (1e-12 až 1e-2).
Ak sa tento limit dosiahne pred konvergenciou, posledné váhy zostanú len na diagnostické účely (1 až 500).

Kalibrované váhy

Zhoda okrajov

Audit cieľových hodnôt

PremennáKategóriaVzorka nCieľVáženýRezíduum

Faktory úpravy v prvom cykle

PremennáKategóriaAktuálny súčetCieľový súčetFaktor

Protokol konvergencie

IteráciaMax. relatívna chybaNajhorší cieľ

Váhy respondentov

RiadokIDZákladná váhaÚpravaFinálna váhaVýsledok

Algoritmus a substitúcia

Smc = Σ wi for i in category c

Tmc = n × targetmc ÷ 100

amc = Tmc ÷ Smc

wi ← wi × amc

wi,final = di × adjustmenti

DEFFKish = n·Σwi² ÷ (Σwi

neff = (Σwi)² ÷ Σwi²

    Vaše údaje o respondentoch a vypočítané váhy zostávajú v tomto prehliadači a nikdy sa neodosielajú.

    Časté otázky

    Čo je raking a kedy je jeden okraj len poststratifikáciou?

    Raking upravuje vždy jeden známy okraj populácie a potom cyklicky prechádza cez ostatné, kým predchádzajúce okraje po neskorších úpravách stále súhlasia. Ak zadáte iba jednu kategorickú premennú, stačí jeden cyklus: každá kategória dostane známu úpravu v podobe podielu cieľa ÷ aktuálny podiel. Viaceré okraje nevynucujú zhodu ich neuvedených krížových kombinácií.

    Čo by som mal použiť ako základnú váhu?

    Použite váhu, ktorá patrí pred kalibráciu populácie – zvyčajne prevrátenú hodnotu pravdepodobnosti konečného výberu každého respondenta po akýchkoľvek predchádzajúcich úpravách chýbajúcej odozvy, ktoré váš prieskum vyžaduje. Ak nemáte pravdepodobnostné váhy, ponechajte pole prázdne, aby všetci začínali s hodnotou 1. Tým sa vytvoria kalibračné váhy, ale z príležitostného výberu sa tým nestane pravdepodobnostný výber.

    Je Kishov vplyv váhy úplným efektom dizajnu prieskumu?

    Nie. Meria iba stratu presnosti spojenú s nerovnomernými váhami: rovnaké váhy dávajú hodnotu 1 a premenlivejšie váhy znižujú efektívnu veľkosť vzorky. Zhlukovanie, stratifikácia, korekcie konečnej populácie a to, ako výsledok súvisí s kalibračnými premennými, môžu zmeniť skutočný rozptyl. Na výpočet štandardných chýb a intervalov spoľahlivosti použite softvér, ktorý pozná kompletný dizajn vzorky.

    Prečo cieľ nemusí mať riešenie alebo prečo môže zlyhať konvergencia?

    Kladný cieľ nemožno vytvoriť z kategórie bez vybraného respondenta. Pri viacerých premenných môžu pozorované kombinácie spôsobiť, že inak primerane vyzerajúce okraje budú nekompatibilné. Veľmi krátky limit iterácií alebo extrémne počiatočné váhy môžu zastaviť výpočet pred dosiahnutím požadovanej tolerancie. Audit cieľov a protokol najhorších cieľov ukazujú, kde nesúlad pretrváva; nepovažujte tieto posledné váhy za kalibrované.

    Úvod do kalibrácie prieskumov

    Kalibrácia údajov z prieskumov je základným krokom pri spracovaní sociologických, marketingových a verejných prieskumov. Jej cieľom je upraviť štruktúru výberového súboru (vzorky) tak, aby zodpovedala známym parametrom celej populácie, napríklad údajom zo sčítania obyvateľov. V praxi sa často stáva, že napriek snahe o reprezentatívny výber sú niektoré demografické skupiny vo vzorke zastúpené nadmerne (napr. ženy alebo staršie vekové skupiny) a iné nedostatočne.

    Proces kalibrácie priraďuje každému respondentovi individuálnu váhu. Ak má skupina vo vzorke nižšie zastúpenie, než aké jej prislúcha v populácii, respondenti z tejto skupiny dostanú váhu väčšiu ako 1. Naopak, nadmerne zastúpené skupiny získajú váhu menšiu ako 1. Použitím týchto váh pri následnej analýze sa dosiahne, že vážené percentuálne podiely kategórií presne kopírujú známe populačné okraje.

    Raking vs. poststratifikácia

    Pri kalibrácii údajov sa využívajú dva hlavné prístupy v závislosti od počtu kalibračných premenných a dostupnosti populačných údajov:

    1. Poststratifikácia (jednorozmerná úprava): Ak sa vzorka upravuje iba podľa jednej kategorickej premennej (napríklad iba podľa krajov), nástroj vykoná kalibráciu v jedinom cykle. Každému respondentovi sa priradí jednoduchý koeficient vypočítaný ako podiel cieľového a aktuálneho zastúpenia danej kategórie.
    2. Raking (iteratívne proporcionálne aproximovanie - IPF): Ak je potrebné zosúladiť vzorku podľa viacerých premenných súčasne (napr. vek, pohlavie aj vzdelanie), priama poststratifikácia by vyžadovala poznať presné veľkosti všetkých kombinovaných podskupín v populácii (napr. presný počet mladých mužov s vysokoškolským vzdelaním). Keďže tieto podrobné kombinované údaje často nie sú k dispozícii, raking rieši tento problém tak, že postupne upravuje jeden známy okraj populácie po druhom. Algoritmus cyklicky prechádza cez všetky premenné a upravuje váhy dovtedy, kým sa všetky marginálne distribúcie nezhodujú s cieľmi v rámci nastavenej tolerancie. Raking pritom nevynucuje zhodu pre neuvedené krížové kombinácie premenných.

    Príprava údajov a systémové limity

    Pre úspešný výpočet je potrebné pripraviť dve tabuľky, ktoré sa vkladajú priamo do rozhrania nástroja:

    Údaje respondentov

    Tabuľka s respondentmi musí obsahovať riadok so záhlavím a jeden riadok pre každého respondenta. Podporované sú formáty s oddeľovačmi vo forme tabulátorov, bodkočiarok alebo čiariak (CSV). V regionálnych nastaveniach, ktoré nepoužívajú bodku ako desatinný znak, sa odporúča použiť tabulátory alebo bodkočiarky, aby desatinná čiarka zostala vo vnútri bunky.

    Platia nasledujúce systémové obmedzenia:

    • Maximálna veľkosť vloženého textu je 2 000 000 znakov.
    • Maximálny počet riadkov s respondentmi je 20 000.
    • Tabuľka musí obsahovať aspoň dva pomenované stĺpce bez prázdneho záhlavia a každý stĺpec musí mať jedinečný názov.

    Okraje populácie (%)

    Tabuľka cieľových hodnôt musí obsahovať presne tri stĺpce: premennú, kategóriu a cieľové percento.

    Platia nasledujúce limity pre ciele:

    • Maximálne 500 riadkov s cieľmi.
    • Maximálne 6 kalibračných premenných.
    • Maximálne 100 cieľových kategórií na jednu premennú.
    • Ciele pre každú premennú musia mať súčet presne 100 % a jednotlivé cieľové percentá musia byť v rozsahu od 0 % do 100 % vrátane.
    • Každá premenná musí pokrývať všetky kategórie, ktoré sa nachádzajú vo vzorke.

    Význam základných váh a posunu výsledku

    Nástroj umožňuje zadať voliteľný Stĺpec so základnou váhou. Základné váhy predstavujú bezrozmerné počiatočné relatívne váhy, ktoré odrážajú pravdepodobnosť výberu respondenta do vzorky alebo predchádzajúce úpravy chýbajúcej odozvy. Ak sa tento stĺpec nepoužije, každý respondent začína s predvolenou váhou 1. Hodnoty v tomto stĺpci musia byť konečné čísla väčšie ako 0.

    Ďalším voliteľným parametrom je Stĺpec s výsledkom. Ak sa zadá tento konečný číselný stĺpec, nástroj vypočíta a porovná počiatočný a finálny vážený priemer danej veličiny, pričom výsledky si zachovávajú pôvodnú jednotku tohto stĺpca. To umožňuje analytikom priamo sledovať, ako proces kalibrácie zmenil hlavné sledované ukazovatele prieskumu.

    Diagnostika, Kishov efekt a efektívna veľkosť vzorky

    • Kishov vplyv váhy = n·Σw² ÷ (Σw)² = ‹count›·‹sumSquares› ÷ ‹sum›² = ‹effect›.
    • Efektívna veľkosť vzorky = (Σw)² ÷ Σw² = ‹sum›² ÷ ‹sumSquares› = ‹effective›.

    Tieto váhy zodpovedajú okrajom, ktoré ste zadali, nie premenným, ktoré ste nezadali. Kishova diagnostika odráža iba nerovnomerné váhy; nezahŕňa zhlukovanie, stratifikáciu ani úplný odhad rozptylu prieskumu.

    Riešenie chýb a diagnostika zlyhania rakingu

    Rakingový algoritmus nemusí vždy úspešne konvergovať. Medzi najčastejšie príčiny zlyhania patria:

    • Podmienka nulovej bunky (Zero-Cell Condition): Ak má určitá kategória v populácii kladný cieľ, ale vo vzorke sa nenachádza ani jeden respondent s touto vlastnosťou (alebo je súčet ich počiatočných váh 0), riešenie neexistuje a nástroj zobrazí chybu.
    • Nekompatibilné ciele: Pri viacerých premenných môžu vzájomné kombinácie kategórií spôsobiť, že okraje nie je možné matematicky zosúladiť.
    • Dosiahnutie limitu iterácií: Ak algoritmus nedosiahne nastavenú relatívnu toleranciu (nastaviteľnú od 1e-12 do 1e-2) v rámci maximálneho počtu iterácií (nastaviteľného od 1 do 500), proces sa zastaví.

    Nástroj v prípade problémov alebo špecifických stavov zobrazuje varovania a chybové hlásenia:

    • Pri úspešnom zosúladení sa zobrazí hlavný štítok: Všetkých ‹margins› okrajov populácie sa zhoduje.
    • Ak sa dosiahne limit bez konvergencie, zobrazí sa stav: Zastavené s maximálnou relatívnou chybou ‹residual› spolu s upozornením: „Pred konvergenciou sa dosiahol limit iterácií (‹iterations›). Posledné váhy sú zobrazené na diagnostické účely, nie ako kalibrované výsledky.“.
    • Ak sú výsledné váhy príliš rozkolísané, nástroj varuje: „Okraje sa zhodujú, ale najväčšia váha je ‹ratio›-násobkom najmenšej; pred ich použitím skontrolujte efektívnu veľkosť vzorky.“.
    • Ak počiatočné váhy už zodpovedajú cieľom, zobrazí sa: „Počiatočné váhy už zodpovedajú každému požadovanému okraju.“.

    Spracovanie údajov a ochrana súkromia

    Všetky výpočty prebiehajú lokálne priamo v internetovom prehliadači používateľa. Žiadne údaje o respondentoch ani cieľové hodnoty sa neodosielajú na externé servery, čo zaisťuje ochranu spracovávaných dát.

    Po úspešnej kalibrácii je možné použiť tlačidlo Kopírovať vážené údaje. Tým sa do schránky skopíruje kompletná tabuľka respondentov, do ktorej sú pridané stĺpce raking_adjustment a raking_weight. Ak už stĺpce s týmito názvami v pôvodnej tabuľke existovali, nástroj k nim pridá číselný sufix, aby sa predišlo duplicitným záhlaviam. Pre zachovanie rýchlej odozvy prehliadača sa na obrazovke vykresľuje maximálne prvých 500 riadkov, avšak funkcia kopírovania exportuje kompletnú sadu údajov.


    Často kladené otázky (FAQ)

    Čo by som mal použiť ako základnú váhu?

    Použite váhu, ktorá patrí pred kalibráciu populácie – zvyčajne prevrátenú hodnotu pravdepodobnosti konečného výberu každého respondenta po akýchkoľvek predchádzajúcich úpravách chýbajúcej odozvy, ktoré váš prieskum vyžaduje. Ak nemáte pravdepodobnostné váhy, ponechajte pole prázdne, aby všetci začínali s hodnotou 1. Tým sa vytvoria kalibračné váhy, ale z príležitostného výberu sa tým nestane pravdepodobnostný výber.

    Prečo cieľ nemusí mať riešenie alebo prečo môže zlyhať konvergencia?

    Kladný cieľ nemožno vytvoriť z kategórie bez vybraného respondenta. Pri viacerých premenných môžu pozorované kombinácie spôsobiť, že inak primerane vyzerajúce okraje budú nekompatibilné. Veľmi krátky limit iterácií alebo extrémne počiatočné váhy môžu zastaviť výpočet pred dosiahnutím požadovanej tolerancie. Audit cieľov a protokol najhorších cieľov ukazujú, kde nesúlad pretrváva; nepovažujte tieto posledné váhy za kalibrované.

    Je Kishov vplyv váhy úplným efektom dizajnu prieskumu?

    Nie. Meria iba stratu presnosti spojenú s nerovnomernými váhami: rovnaké váhy dávajú hodnotu 1 a premenlivejšie váhy znižujú efektívnu veľkosť vzorky. Zhlukovanie, stratifikácia, korekcie konečnej populácie a to, ako výsledok súvisí s kalibračnými premennými, môžu zmeniť skutočný rozptyl. Na výpočet štandardných chýb a intervalov spoľahlivosti použite softvér, ktorý pozná kompletný dizajn vzorky.

    Čo je raking a kedy je jeden okraj len poststratifikáciou?

    Raking upravuje vždy jeden známy okraj populácie a potom cyklicky prechádza cez ostatné, kým predchádzajúce okraje po neskorších úpravách stále súhlasia. Ak zadáte iba jednu kategorickú premennú, stačí jeden cyklus: každá kategória dostane známu úpravu v podobe podielu cieľa ÷ aktuálny podiel. Viaceré okraje nevynucujú zhodu ich neuvedených krížových kombinácií.