Calculateur de pondération d'enquête

Ajustez par ratissage les données des répondants selon des marges de population connues, puis examinez chaque poids final, résidu cible et taille effective d'échantillon.

Échantillon et cibles

Collez un en-tête et jusqu'à 20,000 lignes de répondants (2,000,000 de caractères). Utilisez des tabulations ou des points-virgules pour que le séparateur décimal de votre région reste à l'intérieur de chaque cellule.
Utilisez la variable, la catégorie et le pourcentage cible (0 % à 100 %) : au maximum 500 lignes, 6 variables et 100 catégories chacune. Chaque variable doit couvrir toutes les catégories échantillonnées et totaliser 100 %.
Optionnelle et sans dimension. Laissez vide pour attribuer initialement un poids de 1 à tout le monde. Les valeurs doivent être finies et supérieures à 0.
Colonne numérique finie optionnelle utilisée uniquement pour comparer les moyennes pondérées; les résultats conservent l'unité de la colonne.
Sans dimension. S'arrêter lorsque l'erreur relative de chaque cible est égale ou inférieure à cette valeur (1e-12 à 1e-2).
Les derniers poids ne servent qu'au diagnostic si cette limite est atteinte avant la convergence (1 à 500).

Poids calés

Correspondance des marges

Audit des cibles

VariableCatégorien de l'échantillonCiblePondéréRésidu

Facteurs d'ajustement du premier cycle

VariableCatégorieSomme actuelleSomme cibleFacteur

Journal de convergence

ItérationErreur relative max.Pire cible

Poids des répondants

LigneIDPoids de baseAjustementPoids finalRésultat

Algorithme et substitution

Smc = Σ wi for i in category c

Tmc = n × targetmc ÷ 100

amc = Tmc ÷ Smc

wi ← wi × amc

wi,final = di × adjustmenti

DEFFKish = n·Σwi² ÷ (Σwi

neff = (Σwi)² ÷ Σwi²

    Vos données de répondants et les poids calculés restent dans ce navigateur et ne sont jamais téléversés.

    FAQ

    Qu'est-ce que le ratissage et quand une marge correspond-elle simplement à une poststratification?

    Le ratissage (raking) ajuste une marge de population connue à la fois, puis effectue des cycles successifs jusqu'à ce que les marges précédentes correspondent toujours après les ajustements ultérieurs. Si vous ne fournissez qu'une seule variable catégorielle, un seul cycle suffit : chaque catégorie reçoit l'ajustement habituel part cible ÷ part actuelle. Des marges multiples ne forcent pas leurs combinaisons croisées non répertoriées à correspondre.

    Que devrais-je utiliser comme poids de base?

    Utilisez le poids qui précède le calage sur la population — généralement l'inverse de la probabilité de sélection finale de chaque répondant, après tout ajustement pour non-réponse requis par votre étude. Si vous ne disposez pas de poids de probabilité, laissez le champ vide pour attribuer initialement la valeur 1 à tout le monde. Cela produit des poids de calage, mais ne transforme pas un échantillon de convenance en échantillon probabiliste.

    L'effet de pondération de Kish correspond-il à l'effet de plan complet de l'enquête?

    Non. Il mesure uniquement la perte de précision associée à des poids inégaux : des poids égaux donnent 1, et des poids plus variables réduisent la taille effective de l'échantillon. L'effet de grappe, la stratification, les corrections pour population finie et la relation entre le résultat et les variables de calage peuvent tous modifier la variance réelle. Utilisez un logiciel qui prend en compte l'ensemble du plan d'échantillonnage pour obtenir les erreurs types et les intervalles de confiance.

    Pourquoi une cible peut-elle n'avoir aucune solution ou ne pas converger?

    Une cible positive ne peut pas être créée à partir d'une catégorie sans répondant échantillonné. Avec plusieurs variables, les combinaisons observées peuvent également rendre incompatibles des marges qui semblent par ailleurs raisonnables. Une limite d'itérations très courte ou des poids initiaux extrêmes peuvent interrompre le calcul avant d'atteindre la tolérance demandée. L'audit des cibles et le journal de la pire cible montrent où subsiste l'écart; ne considérez pas ces derniers poids comme calés.

    Le calage des données d'enquête est une étape essentielle pour garantir que les résultats d'un sondage représentent fidèlement la population visée. Lorsque les caractéristiques démographiques d'un échantillon s'écartent des paramètres connus d'une population, l'application de poids de calage permet de corriger ces déséquilibres.

    Le Calculateur de pondération d'enquête utilise l'algorithme du ratissage (ou raking ratio estimation, basé sur l'ajustement proportionnel itératif) pour ajuster les données individuelles des répondants afin qu'elles correspondent aux marges de population cibles. Ce processus s'effectue localement: vos données de répondants et les poids calculés restent dans ce navigateur et ne sont jamais téléversés, garantissant ainsi la confidentialité de vos traitements.


    Principes du calage et algorithme de ratissage

    Le calage d'un échantillon consiste à ajuster les poids des répondants pour que les distributions marginales de l'échantillon concordent avec des totaux ou des pourcentages de population connus, souvent issus de recensements ou de bases de données administratives.

    Ratissage (Raking) vs Poststratification

    La poststratification classique consiste à diviser l'échantillon en cellules d'ajustement uniques basées sur le croisement de toutes les variables auxiliaires (par exemple, croiser chaque groupe d'âge par genre et par région). Cette méthode exige de connaître la taille de la population pour chaque cellule croisée et nécessite un échantillon suffisamment grand pour qu'aucune cellule ne soit vide.

    À l'inverse, le ratissage (ou raking) fonctionne uniquement à partir des distributions marginales unidimensionnelles (les marges de population). L'algorithme ajuste une marge de population connue à la fois, puis effectue des cycles successifs jusqu'à ce que les marges précédentes correspondent toujours après les ajustements ultérieurs. Si vous ne fournissez qu'une seule variable catégorielle, un seul cycle suffit: chaque catégorie reçoit l'ajustement habituel part cible ÷ part actuelle. Des marges multiples ne forcent pas leurs combinaisons croisées non répertoriées à correspondre.

    Le rôle des poids de base

    Avant d'entamer le calage sur les marges de population, chaque répondant possède un poids initial, appelé poids de base. Ce poids de base représente généralement l'inverse de la probabilité de sélection du répondant lors du plan d'échantillonnage, ajusté au besoin pour la non-réponse.

    Si aucun poids de base n'est fourni, le calculateur attribue par défaut une valeur initiale de 1 à chaque répondant. Les poids finaux sont ensuite normalisés pour obtenir une moyenne de 1, de sorte que leur somme soit égale au nombre de répondants: Σw = n = ‹count›.


    Préparation des données et paramètres d'entrée

    Pour exécuter le calcul de pondération, vous devez fournir deux tableaux de données distincts et configurer les paramètres de l'algorithme.

    1. Données des répondants

    Ce tableau doit contenir une ligne d'en-tête et une ligne par répondant (maximum 20 000 lignes et moins de 2 000 000 de caractères). Il doit comporter au moins deux colonnes nommées avec des en-têtes uniques.

    • Séparateurs: Le calculateur accepte les tabulations, les points-virgules ou les virgules comme délimiteurs. Dans les régions utilisant la virgule décimale, il est recommandé d'utiliser des tabulations ou des points-virgules afin que le séparateur décimal reste confiné à l'intérieur de sa cellule.
    • Colonne du poids de base (optionnelle): Spécifie la colonne contenant les poids de départ. Les valeurs doivent être des nombres finis supérieurs à 0.
    • Colonne de résultat (optionnelle): Permet de spécifier une variable numérique pour mesurer l'effet de la pondération sur sa moyenne.

    2. Marges de population (%)

    Ce tableau définit les cibles démographiques à atteindre. Il doit comporter exactement trois colonnes: la variable, la catégorie et le pourcentage cible (compris entre 0 % et 100 % inclusivement).

    • Limites: Le tableau accepte un maximum de 500 lignes cibles, 6 variables de calage et 100 catégories par variable.
    • Cohérence: Pour chaque variable, la somme des pourcentages cibles doit être exactement égale à 100 %. De plus, chaque catégorie présente dans l'échantillon pour une variable de calage doit posséder une cible correspondante.

    3. Paramètres de l'algorithme

    • Tolérance relative: Seuil d'arrêt de l'algorithme (valeur comprise entre 1e-12 et 1e-2). Le processus s'arrête lorsque l'écart relatif entre les marges de l'échantillon pondéré et les cibles est inférieur ou égal à ce seuil.
    • Itérations maximales: Nombre maximal de cycles d'ajustement autorisés (de 1 à 500).

    Diagnostics de pondération et précision statistique

    L'application de poids non uniformes réduit la variance de biais mais augmente la variance d'échantillonnage des estimateurs. Le calculateur fournit plusieurs indicateurs clés pour évaluer ce compromis.

    L'effet de pondération de Kish et la taille effective

    L'introduction de poids inégaux réduit la précision statistique globale. Cette perte de précision est mesurée par l'effet de pondération de Kish, calculé selon la formule suivante:

    Effet de pondération de Kish = n·Σw² ÷ (Σw)² = ‹count›·‹sumSquares› ÷ ‹sum›² = ‹effect›.

    Cet indicateur permet de calculer la taille effective de l'échantillon, qui représente la taille qu'aurait un échantillon aléatoire simple équivalent non pondéré:

    Taille effective de l'échantillon = (Σw)² ÷ Σw² = ‹sum›² ÷ ‹sumSquares› = ‹effective›.

    Ces diagnostics reflètent uniquement la dispersion des poids. Ces poids correspondent aux marges que vous avez fournies, et n'ajustent pas les variables non fournies. De plus, le diagnostic de Kish reflète uniquement les poids inégaux; il n'inclut pas l'effet de grappe, la stratification ou une estimation complète de la variance de l'enquête.

    Analyse des résultats et dépannage

    Une fois le calcul effectué, l'outil affiche un diagnostic de convergence et génère les tableaux d'audit.

    Statuts de convergence et alertes

    • Succès: Si l'algorithme converge, l'outil affiche le message « Les ‹margins› marges de population correspondent toutes ».
    • Poids extrêmes: Si le ratio entre le poids final le plus élevé et le plus faible est excessif, l'alerte suivante s'affiche: « Les marges correspondent, mais le poids le plus élevé est ‹ratio› fois plus grand que le plus petit; examinez la taille effective de l'échantillon avant de les utiliser. ».
    • Non-convergence: Si la limite d'itérations est atteinte sans satisfaire la tolérance, l'outil indique: « Limite d'itérations (‹iterations›) atteinte avant la convergence. Les derniers poids sont affichés à des fins de diagnostic et non comme des résultats calés. ».

    Résolution des erreurs courantes

    Le tableau suivant récapitule les erreurs fréquentes liées aux données d'entrée et les actions correctives associées:

    Message d'erreur Cause probable Solution
    « Le tableau des répondants doit contenir au moins deux colonnes nommées sans en-tête vide. » En-tête manquant ou mal formaté dans les données des répondants. Vérifiez la première ligne de votre fichier collé.
    « La ligne cible ‹line› doit contenir exactement trois cellules: variable, catégorie et pourcentage. » Ligne mal délimitée dans le tableau des cibles. Assurez-vous d'utiliser des tabulations ou des virgules pour séparer les trois colonnes requises.
    « Les cibles pour « ‹variable› » totalisent ‹total› %; elles doivent totaliser exactement 100 %. » Somme des pourcentages différente de 100 %. Ajustez les pourcentages de la variable concernée pour obtenir exactement 100 %.
    « « ‹variable› / ‹category› » a une cible positive mais aucun poids d'échantillon utilisable, il n'existe donc aucune solution finie. » Condition de cellule vide (aucun répondant dans l'échantillon pour cette catégorie cible). Regroupez cette catégorie avec une autre ou modifiez vos cibles de population.

    Une fois le calage réussi, vous pouvez cliquer sur le bouton « Copier les données pondérées » pour récupérer l'intégralité de votre tableau initial enrichi des colonnes raking_adjustment et raking_weight.


    Questions fréquemment posées

    Que devrais-je utiliser comme poids de base?
    Utilisez le poids qui précède le calage sur la population — généralement l'inverse de la probabilité de sélection finale de chaque répondant, après tout ajustement pour non-réponse requis par votre étude. Si vous ne disposez pas de poids de probabilité, laissez le champ vide pour attribuer initialement la valeur 1 à tout le monde. Cela produit des poids de calage, mais ne transforme pas un échantillon de convenance en échantillon probabiliste.

    Qu'est-ce que le ratissage et quand une marge correspond-elle simplement à une poststratification?
    Le ratissage (raking) ajuste une marge de population connue à la fois, puis effectue des cycles successifs jusqu'à ce que les marges précédentes correspondent toujours après les ajustements ultérieurs. Si vous ne fournissez qu'une seule variable catégorielle, un seul cycle suffit: chaque catégorie reçoit l'ajustement habituel part cible ÷ part actuelle. Des marges multiples ne forcent pas leurs combinaisons croisées non répertoriées à correspondre.

    Pourquoi une cible peut-elle n'avoir aucune solution ou ne pas converger?
    Une cible positive ne peut pas être créée à partir d'une catégorie sans répondant échantillonné. Avec plusieurs variables, les combinaisons observées peuvent également rendre incompatibles des marges qui semblent par ailleurs raisonnables. Une limite d'itérations très courte ou des poids initiaux extrêmes peuvent interrompre le calcul avant d'atteindre la tolérance demandée. L'audit des cibles et le journal de la pire cible montrent où subsiste l'écart; ne considérez pas ces derniers poids comme calés.

    L'effet de pondération de Kish correspond-il à l'effet de plan complet de l'enquête?
    Non. Il mesure uniquement la perte de précision associée à des poids inégaux: des poids égaux donnent 1, et des poids plus variables réduisent la taille effective de l'échantillon. L'effet de grappe, la stratification, les corrections pour population finie et la relation entre le résultat et les variables de calage peuvent tous modifier la variance réelle. Utilisez un logiciel qui prend en compte l'ensemble du plan d'échantillonnage pour obtenir les erreurs types et les intervalles de confiance.