Калькулятор зважування вибірки

Зважуйте дані респондентів методом рейкінгу під відомі маргінальні розподіли населення, а потім аналізуйте кожну кінцеву вагу, залишки та ефективний розмір вибірки.

Вибірка та цільові показники

Вставте рядок заголовків та до 20,000 рядків респондентів (до 2,000,000 символів). Використовуйте табуляцію або крапку з комою, щоб десятковий роздільник вашої локалі залишався всередині кожної комірки.
Використовуйте стовпці: змінна, категорія та цільовий відсоток (0%–100%): не більше 500 рядків, 6 змінних та 100 категорій для кожної. Кожна змінна повинна охоплювати всі категорії у вибірці та давати в сумі 100%.
Необов'язково та безрозмірно. Залиште порожнім, щоб почати з ваги 1 для всіх. Значення мають бути скінченними та більшими за 0.
Необов'язковий числовий стовпець із кінцевими значеннями, який використовується лише для порівняння зважених середніх; результати зберігають власну одиницю виміру стовпця.
Безрозмірна величина. Зупинити процес, коли відносна помилка кожного цільового показника не перевищує це значення (від 1e-12 до 1e-2).
Останні ваги залишаються лише діагностичними, якщо цей ліміт буде досягнуто до збіжності (від 1 до 500).

Калібровані ваги

Збіг маргінальних розподілів

Аудит цільових показників

ЗміннаКатегоріяВибірка nЦільове значенняЗваженоЗалишок

Коригувальні коефіцієнти першого циклу

ЗміннаКатегоріяПоточна сумаЦільова сумаФактор

Журнал збіжності

ІтераціяМакс. відносна похибкаНайгірший цільовий показник

Ваги респондентів

РядокIDБазова вагаКоригуванняКінцева вагаПоказник

Алгоритм та підстановка

Smc = Σ wi for i in category c

Tmc = n × targetmc ÷ 100

amc = Tmc ÷ Smc

wi ← wi × amc

wi,final = di × adjustmenti

DEFFKish = n·Σwi² ÷ (Σwi

neff = (Σwi)² ÷ Σwi²

    Ваші дані респондентів та розраховані ваги залишаються в цьому браузері й ніколи не завантажуються на сервер.

    Поширені запитання

    Що таке рейкінг і коли один маргінальний розподіл є просто постстратифікацією?

    Рейкінг (зважування методом ітеративного пропорційного підгону) коригує один відомий маргінальний розподіл генеральної сукупності за раз, а потім циклічно повторює цей процес для інших, доки попередні маргінальні розподіли не почнуть збігатися після наступних коригувань. Якщо ви вкажете лише одну категоріальну змінну, достатньо буде одного циклу: кожна категорія отримає звичне коригування «цільова частка ÷ поточна частка». Кілька маргінальних розподілів не змушують їхні неперелічені перехресні комбінації збігатися автоматично.

    Що слід використовувати як базову вагу?

    Використовуйте вагу, яка передує калібруванню за генеральною сукупністю — зазвичай це величина, обернена до ймовірності відбору кожного респондента, після будь-яких попередніх коригувань на невідповіді, яких вимагає ваше дослідження. Якщо у вас немає ймовірнісних ваг, залиште поле порожнім, щоб почати з ваги 1 для всіх. Це дозволить отримати калібрувальні ваги, але не перетворить неімовірнісну вибірку на ймовірнісну.

    Чи є ефект зважування Kish повним ефектом дизайну дослідження?

    Ні. Він вимірює лише втрату точності, пов'язану з неоднаковими вагами: рівні ваги дають коефіцієнт 1, а більша варіативність ваг зменшує ефективний розмір вибірки. Кластеризація, стратифікація, поправки на кінцеву генеральну сукупність та зв'язок цільової змінної з калібрувальними змінними — усе це може змінити реальну дисперсію. Для розрахунку стандартних помилок та довірчих інтервалів використовуйте програмне забезпечення, яке враховує повний дизайн вибірки.

    Чому цільовий розподіл може не мати рішення або не збігатися?

    Позитивну цільову частку неможливо створити для категорії, яка не представлена в жодного респондента у вибірці. При використанні кількох змінних спостережувані комбінації також можуть зробити несумісними навіть ті маргінальні розподіли, які окремо виглядають цілком логічно. Дуже малий ліміт ітерацій або екстремальні початкові ваги можуть зупинити процес до досягнення потрібної похибки. Аудит цільових показників та журнал найгірших результатів показують, де саме залишається розбіжність; не вважайте ці останні ваги каліброваними.

    Вступ до калібрування вибірки

    Калібрування вибірки є стандартною процедурою в практиці соціологічних та маркетингових досліджень, яка дозволяє усунути систематичні зсуви у зібраних даних. Коли структура вибірки за ключовими демографічними або соціальними характеристиками (наприклад, стать, вік, регіон) відрізняється від відомих параметрів генеральної сукупності, результати прямого аналізу можуть бути викривленими.

    Процес калібрування полягає в розрахунку індивідуальних статистичних ваг для кожного респондента. Ці ваги коригують внесок кожного учасника опитування так, щоб зважені маргінальні розподіли вибірки точно відповідали відомим цільовим показникам генеральної сукупності. Безкоштовний онлайн-інструмент «Калькулятор зважування вибірки» автоматизує цей процес безпосередньо у вашому веб-браузері. Усі надані дані респондентів та розраховані ваги залишаються в цьому браузері й ніколи не завантажуються на сервер, що гарантує конфіденційність роботи з первинними матеріалами.

    Рейкінг порівняно з постстратифікацією

    Для приведення структури вибірки у відповідність до параметрів генеральної сукупності найчастіше застосовують два методи: класичну постстратифікацію та рейкінг (метод ітеративного пропорційного підгону, або IPF).

    • Постстратифікація вимагає знання точних часток для кожної окремої комбінації ознак у генеральній сукупності (наприклад, відсоток молодих жінок з вищою освітою в конкретному регіоні). Зі збільшенням кількості змінних кількість таких комірок зростає геометрично, що часто призводить до появи порожніх або занадто малих груп у вибірці.
    • Рейкінг вирішує цю проблему, працюючи лише з одновимірними маргінальними розподілами (наприклад, окремо загальний розподіл за статтю, окремо за віком і окремо за освітою). Алгоритм послідовно коригує ваги для однієї змінної за раз, повторюючи цей цикл ітеративно. Процес триває доти, доки всі маргінальні розподіли вибірки одночасно не збіжаться з цільовими параметрами з мінімальною похибкою.

    Якщо в інструменті вказано лише одну категоріальну змінну, калібрування завершується за один цикл, оскільки один маргінальний розподіл є просто постстратифікацією. У цьому випадку кожна категорія отримує просте коригування, де коефіцієнт дорівнює відношенню цільової частки до поточної частки.

    Підготовка даних та вимоги до імпорту

    Для успішного розрахунку ваг необхідно правильно підготувати дві таблиці: дані респондентів та маргінальні розподіли населення.

    1. Дані респондентів (Respondents)

    Ця таблиця повинна містити рядок заголовків та по одному рядку на кожного респондента.

    • Формат: Підтримуються роздільники у вигляді табуляції, крапки з комою або коми CSV. Якщо у вашій локалі як десятковий роздільник використовується кома, вставляйте дані з розділенням табуляцією або крапкою з комою, щоб десятковий роздільник залишався всередині своєї комірки.
    • Обмеження: Обсяг даних не повинен перевищувати 2,000,000 символів, а кількість рядків респондентів — не більше 20,000. Таблиця повинна мати щонайменше два названих стовпці без порожніх заголовків, і кожен заголовок має бути унікальним.

    2. Маргінальні розподіли населення (%) (Targets)

    Ця таблиця містить цільові параметри генеральної сукупності й повинна складатися рівно з трьох стовпців: змінна, категорія та цільовий відсоток.

    • Обмеження: Допускається не більше 500 цільових рядків, до 6 змінних калібрування та не більше 100 категорій на одну змінну. Цільові значення мають бути в межах від 0% до 100% включно, а сума часток для кожної змінної повинна становити рівно 100%. Кожна категорія, присутня у вибірці, повинна мати відповідний цільовий рядок.

    Розуміння базових ваг та додаткових параметрів

    Калькулятор дозволяє налаштувати процес зважування за допомогою додаткових параметрів:

    • Стовпець базової ваги: Визначає початкові відносні ваги респондентів перед початком калібрування. Зазвичай сюди вносять величини, обернені до ймовірності відбору (дизайнерські ваги), або ваги, скориговані на невідповіді. Якщо залишити це поле порожнім, усім респондентам автоматично присвоюється початкова вага 1. Значення в цьому стовпці мають бути скінченними числами, більшими за 0.
    • Стовпець результату: Необов'язковий числовий стовпець із даними респондентів, який використовується для оцінки впливу зважування на аналізовані показники. Інструмент порівнює початкове та кінцеве зважене середнє значення, зберігаючи оригінальні одиниці виміру цього стовпця.
    • Відносна похибка: Гранична точність (від 1e-12 до 1e-2), при досягненні якої алгоритм припиняє ітерації.
    • Максимальна кількість ітерацій: Ліміт циклів підгону (від 1 до 500).

    Математична основа та нормалізація ваг

    • ‹variable› / ‹category›: коефіцієнт = цільова сума ÷ поточна сума = ‹target› ÷ ‹current› = ‹factor›
    • Нормалізуйте кінцеві ваги до середнього значення 1, щоб їхня сума дорівнювала кількості респондентів: Σw = n = ‹count›.
    • Ефект зважування Kish = n·Σw² ÷ (Σw)² = ‹count›·‹sumSquares› ÷ ‹sum›² = ‹effect›.
    • Ефективний розмір вибірки = (Σw)² ÷ Σw² = ‹sum›² ÷ ‹sumSquares› = ‹effective›.

    Ці ваги відповідають лише тим маргінальним розподілам, які ви надали, а не змінним, які ви не вказували. Діагностика Kish відображає лише неоднаковість ваг; вона не включає кластеризацію, стратифікацію або повну оцінку дисперсії дослідження.

    Діагностика помилок та попереджень

    У процесі роботи калькулятор виконує сувору валідацію даних та налаштувань. Нижче наведено основні повідомлення про помилки та правила їх виправлення:

    Помилки вхідних даних респондентів

    • Додайте рядок заголовка та щонайменше один рядок респондента. — виникає, якщо поле даних порожнє.
    • Таблиця респондентів повинна мати щонайменше два названих стовпці без порожніх заголовків. — вимагається мінімум дві змінні для аналізу.
    • Кожен стовпець даних респондентів повинен мати унікальний заголовок. — дублювання назв стовпців заборонено.
    • Рядок ‹line› має ‹actual› комірок; заголовок має ‹expected›. — невідповідність структури таблиці.
    • Використовуйте не більше ніж ‹max› рядків респондентів. — перевищено ліміт у 20,000 рядків.

    Помилки цільових показників та ваг

    • Цільовий рядок ‹line› повинен мати рівно три комірки: змінна, категорія та відсоток. — порушено структуру таблиці цільових значень.
    • Цільові показники для «‹variable›» в сумі дають ‹total›%; вони повинні давати в сумі рівно 100%. — сума часток категорій всередині однієї змінної має дорівнювати 100%.
    • «‹variable› / ‹category›» зустрічається в таблиці цільових показників більше одного разу. — виявлено дублювання цільових категорій.
    • Базова вага в рядку ‹line› має бути більшою за 0. — від'ємні або нульові значення базових ваг неприпустимі.

    Критичні помилки алгоритму

    • «‹variable› / ‹category›» має позитивний цільовий показник, але не має придатної ваги вибірки, тому скінченного рішення не існує. — виникає, коли категорія має нульову частоту у вибірці (Zero-Cell Condition), але позитивну ціль у генеральній сукупності.
    • Вага, сума або коригування вийшли за межі діапазону скінченних чисел. Змініть масштаб базових ваг і спробуйте знову. — математичне переповнення під час розрахунків.

    Попередження та статуси результатів

    • Якщо початкові ваги вже ідеально збалансовані, відображається статус: Початкові ваги вже відповідають кожному запитаному маргінальному розподілу..
    • Якщо ліміт ітерацій вичерпано до досягнення заданої точності: Досягнуто ліміту ітерацій (‹iterations›) до збіжності. Останні ваги показано для діагностики, а не як калібровані результати..
    • При отриманні занадто великого розкиду ваг з'являється попередження: Маргінальні розподіли збігаються, але найбільша вага перевищує найменшу в ‹ratio› разів; перевірте ефективний розмір вибірки перед їх використанням..

    Аналіз результатів та експорт

    Після успішного завершення розрахунків на екрані з'являється блок «Аудит цільових показників» та статус «Усі маргінальні розподіли (‹margins›) збігаються».

    У таблиці результатів респондентів відображається детальна інформація для кожного рядка (до перших 500 рядків для збереження швидкодії інтерфейсу). Для кожного респондента діє правило: початкова базова вага, помножена на коефіцієнт коригування, дорівнює кінцевій вазі.

    Кнопка «Копіювати зважені дані» дозволяє експортувати повну таблицю респондентів. До неї автоматично додаються два нові стовпці: raking_adjustment (коефіцієнт коригування) та raking_weight (кінцева вага). Якщо стовпці з такими назвами вже існували у вихідних даних, інструмент додасть до них числовий суфікс, щоб уникнути дублювання заголовків.


    Часті запитання (FAQ)

    Що слід використовувати як базову вагу?

    Використовуйте вагу, яка передує калібруванню за генеральною сукупністю — зазвичай це величина, обернена до ймовірності відбору кожного респондента, після будь-яких попередніх коригувань на невідповіді, яких вимагає ваше дослідження. Якщо у вас немає ймовірнісних ваг, залиште поле порожнім, щоб почати з ваги 1 для всіх. Це дозволить отримати калібрувальні ваги, але не перетворить неімовірнісну вибірку на ймовірнісну.

    Чому цільовий розподіл може не мати рішення або не збігатися?

    Позитивну цільову частку неможливо створити для категорії, яка не представлена в жодного респондента у вибірці. При використанні кількох змінних спостережувані комбінації також можуть зробити несумісними навіть ті маргінальні розподіли, які окремо виглядають цілком логічно. Дуже малий ліміт ітерацій або екстремальні початкові ваги можуть зупинити процес до досягнення потрібної похибки. Аудит цільових показників та журнал найгірших результатів показують, де саме залишається розбіжність; не вважайте ці останні ваги каліброваними.

    Чи є ефект зважування Kish повним ефектом дизайну дослідження?

    Ні. Він вимірює лише втрату точності, пов'язану з неоднаковими вагами: рівні ваги дають коефіцієнт 1, а більша варіативність ваг зменшує ефективний розмір вибірки. Кластеризація, стратифікація, поправки на кінцеву генеральну сукупність та зв'язок цільової змінної з калібрувальними змінними — усе це може змінити реальну дисперсію. Для розрахунку стандартних помилок та довірчих інтервалів використовуйте програмне забезпечення, яке враховує повний дизайн вибірки.

    Що таке рейкінг і коли один маргінальний розподіл є просто постстратифікацією?

    Рейкінг (зважування методом ітеративного пропорційного підгону) коригує один відомий маргінальний розподіл генеральної сукупності за раз, а потім циклічно повторює цей процес для інших, доки попередні маргінальні розподіли не почнуть збігатися після наступних коригувань. Якщо ви вкажете лише одну категоріальну змінну, достатньо буде одного циклу: кожна категорія отримає звичне коригування «цільова частка ÷ поточна частка». Кілька маргінальних розподілів не змушують їхні неперелічені перехресні комбінації збігатися автоматично.