Вовед во калибрација на анкети
Калибрацијата на анкетите е статистичка постапка со која се прилагодуваат податоците од анкетираните испитаници за да одговараат на познатите демографски или географски карактеристики на целната популација. Честопати, поради природата на пригодните примероци или поради разликите во стапките на одговор кај одредени групи, структурата на собраниот примерок отстапува од реалната популација. Преку процесот на пондерирање, на секој испитаник му се доделува математички фактор (тежина) кој го зголемува или намалува неговото влијание во вкупните резултати, со цел маргиналните дистрибуции на примерокот да се усогласат со целните маргини на популацијата.
Овој бесплатен онлајн „Калкулатор за пондерирање анкети“ овозможува брза и прецизна калибрација на вашите податоци директно во веб-прелистувачот. Алатката го користи етаблираниот алгоритам за рејкинг (raking) или итеративно пропорционално вклопување (iterative proportional fitting) за автоматско прилагодување на тежините.
Рејкинг наспроти пост-стратификација
Прилагодувањето на примерокот може да се изврши на два основни начини во зависност од достапните податоци и бројот на променливи:
- Пост-стратификација (Post-Stratification): Овој метод бара познавање на целосните вкрстени фреквенции во популацијата (на пример, точниот процент на мажи на возраст од 18 до 24 години во одреден регион). Доколку се користи само една категоријална променлива за калибрација, алатката ја извршува пресметката во еден единствен циклус, применувајќи едноставно прилагодување од типот „целен удел ÷ тековен удел“ за секоја категорија.
- Рејкинг (Raking / Iterative Proportional Fitting): Кога се калибрира според повеќе променливи (на пример, пол, возраст и регион посебно), вкрстените податоци за популацијата често се недостапни или примерокот содржи празни ќелии за одредени комбинации. Рејкингот го решава ова со тоа што ги прилагодува тежините последователно за секоја маргина поединечно, кружејќи низ нив во повеќе циклуси (итерации) сè додека сите маргинални дистрибуции истовремено не се усогласат со целните вредности во рамките на дефинираната толеранција. Важно е да се напомене дека овие тежини ги соодветствуваат само маргините што сте ги внеле, а не и нивните ненаведени вкрстени комбинации.
Подготовка на податоците и влезни параметри
За успешно извршување на калибрацијата, потребно е правилно да ги подготвите и внесете вашите податоци во соодветните полиња на алатката:
Податоци за испитаниците (Respondents)
Во полето Податоци за испитаниците се внесува табела која содржи заглавие во првиот ред и по еден испитаник во секој следен ред.
- Формати: Поддржани се вредности разделени со табулатори (tabs), точки-запирки (semicolons) или запирки (CSV). Доколку во вашата локална средина дециналниот знак е запирка, користете табулатори или точки-запирки за дециналниот знак да остане во рамките на својата ќелија.
- Ограничувања: Максималната големина на табелата е 2,000,000 карактери и најмногу 20,000 редови со испитаници. Табелата мора да содржи најмалку две колони со уникатни и пополнети заглавија.
Маргини на популација (%) (Population margins)
Во ова поле се внесуваат целните проценти на популацијата. Табелата мора да содржи точно три колони: променлива, категорија и целен процент.
- Ограничувања: Дозволени се најмногу 500 целни редови, до 6 променливи за калибрација и најмногу 100 категории по променлива. Секоја променлива во целните маргини мора да ги опфати категориите присутни во примерокот. Целните проценти за секоја поединечна променлива мора да изнесуваат точно 100%, а вредностите мора да бидат во опсег од 0% до 100%.
Дополнителни поставки
- Колона за базна тежина: Изборно поле каде се наведува името на колоната со почетните релативни тежини (на пример, пресметани врз основа на веројатноста за избор на испитаникот). Доколку се остави празно, секој испитаник започнува со стандардна тежина 1. Вредностите мора да бидат конечни броеви поголеми од 0.
- Колона за исход: Изборна нумеричка колона за споредба на почетната и конечната пондерирана средна вредност.
- Релативна толеранција: Бездимензионален параметар кој одредува кога алгоритмот треба да запре со прилагодувањето (дозволен опсег од 1e-12 до 1e-2).
- Максимум итерации: Максимален број на циклуси на алгоритмот (од 1 до 500).
- Прикажани децимали: Избор за приказ на 4, 6 или 8 децимални места во извештаите (не влијае на прецизноста на пресметките).
Дијагностика и толкување на резултатите
‹variable› / ‹category›: фактор = целна сума ÷ тековна сума = ‹target› ÷ ‹current› = ‹factor›Нормализирајте ги конечните тежини на средна вредност 1, така што нивната сума ќе биде еднаква на бројот на испитаници: Σw = n = ‹count›.Ефект на тежината на Kish = n·Σw² ÷ (Σw)² = ‹count›·‹sumSquares› ÷ ‹sum›² = ‹effect›.Ефективна големина на примерокот = (Σw)² ÷ Σw² = ‹sum›² ÷ ‹sumSquares› = ‹effective›.
Овие тежини се совпаѓаат со маргините што ги внесовте, а не со променливите што не ги внесовте. Дијагностиката на Kish ја одразува само нееднаквоста на тежините; таа не вклучува кластерирање, стратификација или целосна процена на варијансата на анкетата.
Правила, предупредувања и грешки при ракување
При пресметките може да се појават специфични состојби кои бараат внимание:
- Состојба на празна ќелија (Zero-Cell Condition): Доколку некоја категорија има позитивна цел во популацијата, но во примерокот нема ниту еден испитаник (или збирот на почетните тежини е 0), алгоритмот не може да пресмета конечно решение и ја прикажува грешката:
“‹variable› / ‹category›” има позитивна цел, но нема употреблива тежина во примерокот, па затоа не постои конечно решение.. - Неуспешна конвергенција: Доколку се достигне лимитот на итерации пред да се задоволи толеранцијата, се прикажува предупредувањето:
Достигнат е лимитот на итерации (‹iterations›) пред конвергенција. Последните тежини се прикажани за дијагностика, а не како калибрирани резултати.. - Екстремни тежини: Доколку односот меѓу најголемата и најмалата тежина е премногу голем, се појавува предупредувањето:
Маргините се совпаднаа, но најшироката тежина е ‹ratio› пати поголема од најмалата; проверете ја ефективната големина на примерокот пред да ги користите.. - Веќе усогласени податоци: Доколку почетните тежини веќе совршено одговараат на целите, алатката ќе пријави:
Почетните тежини веќе се совпаѓаат со секоја побарана маргина..
Локална обработка и приватност
Сите пресметки се извршуваат локално во вашиот веб-прелистувач. Податоците за испитаниците и пресметаните тежини остануваат во овој прелистувач и никогаш не се испраќаат на сервер. По завршување на процесот, со кликнување на копчето за копирање на пондерираните податоци, комплетната табела со додадени колони raking_adjustment и raking_weight се зачувува во вашиот клипборд.
Често поставувани прашања (FAQ)
Што треба да користам како базна тежина?
Користете ја тежината што соодветствува пред калибрацијата на популацијата — обично инверзната вредност од веројатноста за конечен избор на секој испитаник, по сите претходни прилагодувања за неодговор кои ги бара вашето истражување. Доколку немате тежини на веројатност, оставете го полето празно за да започнат сите со 1. Тоа создава калибрациски тежини, но не го претвора пригодниот примерок во примерок на веројатност.
Зошто некоја цел може да нема решение или да не конвергира?
Позитивна цел не може да се создаде од категорија во која нема анкетиран испитаник. При повеќе променливи, набљудуваните комбинации исто така можат да направат инаку разумни маргини да бидат некомпатибилни. Многу краток лимит на итерации или екстремни почетни тежини можат да го прекинат процесот пред да се достигне бараната толеранција. Ревизијата на целите и дневникот за најлоша цел покажуваат каде останува несовпаѓањето; не третирајте ги тие последни тежини како калибрирани.
Дали ефектот на тежината на Kish е целосниот ефект на дизајнот на анкетата?
Не. Тој ја мери само загубата на прецизност поврзана со нееднаквите тежини: еднаквите тежини даваат 1, а поваријабилните тежини ја намалуваат ефективната големина на примерокот. Кластерирањето, стратификацијата, корекциите за конечна популација и начинот на кој исходот е поврзан со променливите за калибрација можат да ја променат реалната варијанса. Користете софтвер што го зема предвид целосниот дизајн на примерокот за стандардни грешки и интервали на доверба.
Што е рејкинг и кога една маргина е само пост-стратификација?
Рејкингот (raking) прилагодува една по една позната маргина на популацијата, а потоа кружи низ нив сè додека претходните маргини сè уште се совпаѓаат по подоцнежните прилагодувања. Доколку внесете само една категоријална променлива, еден циклус е доволен: секоја категорија го добива познатото прилагодување „целен удел ÷ тековен удел“. Повеќекратните маргини не ги принудуваат нивните ненаведени вкрстени комбинации да се совпаѓаат.