Calculateur de pondération d'enquête

Ajustez vos données de répondants aux marges de population connues par raking, puis analysez chaque poids final, résidu cible et taille effective d'échantillon.

Échantillon et cibles

Collez un en-tête et jusqu'à 20,000 lignes de répondants (2,000,000 de caractères). Utilisez des tabulations ou points-virgules pour préserver la virgule décimale.
Utilisez les colonnes variable, catégorie et pourcentage cible (0 %–100 %) : au maximum 500 lignes, 6 variables et 100 catégories chacune. Chaque variable doit couvrir toutes les catégories échantillonnées et totaliser 100 %.
Facultatif et sans dimension. Laissez vide pour attribuer à chaque répondant un poids initial de 1. Les valeurs doivent être finies et supérieures à 0.
Colonne numérique finie facultative utilisée uniquement pour comparer les moyennes pondérées ; les résultats conservent l'unité de la colonne.
Sans dimension. Arrêter lorsque l'erreur relative de chaque cible est inférieure ou égale à cette valeur (1e-12 à 1e-2).
Les derniers poids restent uniquement diagnostiques si cette limite est atteinte avant la convergence (1 à 500).

Poids calés

Correspondance des marges

Audit des cibles

VariableCatégorien de l'échantillonCiblePondéréRésidu

Facteurs d'ajustement du premier cycle

VariableCatégorieSomme actuelleSomme cibleFacteur

Journal de convergence

ItérationErreur relative max.Pire cible

Poids des répondants

LigneIDPoids de baseAjustementPoids finalVariable d'intérêt

Algorithme et substitution

Smc = Σ wi for i in category c

Tmc = n × targetmc ÷ 100

amc = Tmc ÷ Smc

wi ← wi × amc

wi,final = di × adjustmenti

DEFFKish = n·Σwi² ÷ (Σwi

neff = (Σwi)² ÷ Σwi²

    Vos données de répondants et les poids calculés restent dans ce navigateur et ne sont jamais téléversés.

    FAQ

    Qu'est-ce que le raking et quand une marge correspond-elle à une simple post-stratification ?

    Le raking (redressement sur marges) ajuste une marge de population connue à la fois, puis effectue des cycles successifs jusqu'à ce que les marges précédentes correspondent toujours après les ajustements ultérieurs. Si vous ne fournissez qu'une seule variable catégorielle, un seul cycle suffit : chaque catégorie reçoit l'ajustement classique part cible ÷ part actuelle. Des marges multiples ne forcent pas leurs combinaisons croisées non répertoriées à correspondre.

    Que dois-je utiliser comme poids de base ?

    Utilisez le poids qui précède le calage sur marge — généralement l'inverse de la probabilité de sélection finale de chaque répondant, après tout ajustement pour non-réponse requis par votre étude. Si vous ne disposez pas de poids de probabilité, laissez le champ vide pour attribuer initialement 1 à tout le monde. Cela produit des poids de calage, mais ne transforme pas un échantillon de convenance en un échantillon probabiliste.

    L'effet de pondération de Kish correspond-il à l'effet global de plan de sondage ?

    Non. Il mesure uniquement la perte de précision associée à des poids inégaux : des poids égaux donnent 1, et des poids plus variables réduisent la taille effective de l'échantillon. L'effet de grappe, la stratification, les corrections pour population finie et la relation entre la variable d'intérêt et les variables de calage peuvent tous modifier la variance réelle. Utilisez un logiciel prenant en compte le plan de sondage complet pour obtenir les erreurs types et les intervalles de confiance.

    Pourquoi une cible peut-elle n'avoir aucune solution ou ne pas converger ?

    Une cible positive ne peut pas être créée à partir d'une catégorie sans répondant échantillonné. Avec plusieurs variables, les combinaisons observées peuvent également rendre incompatibles des marges par ailleurs raisonnables. Une limite d'itérations trop courte ou des poids initiaux extrêmes peuvent interrompre le calcul avant d'atteindre la tolérance demandée. L'audit des cibles et le journal de la pire cible indiquent où subsiste l'écart ; ne considérez pas ces derniers poids comme calés.

    Le calage des données d'enquête est une étape essentielle pour garantir que les résultats d'un sondage représentent fidèlement la population étudiée. Le Calculateur de pondération d'enquête permet d'ajuster les données individuelles des répondants afin qu'elles correspondent à des marges de population connues, en utilisant l'algorithme du raking (ou ajustement proportionnel itératif).

    Ce processus s'effectue localement: vos données de répondants et les poids calculés restent dans ce navigateur et ne sont jamais téléversés, garantissant la confidentialité de vos travaux de recherche.


    Introduction au calage d'enquête

    Lors de la réalisation d'une enquête, l'échantillon obtenu présente souvent des écarts par rapport à la structure de la population de référence. Par exemple, les jeunes ou certaines catégories socioprofessionnelles peuvent être sous-représentés. Le calage consiste à attribuer un poids multiplicateur à chaque répondant pour corriger ces déséquilibres.

    Le calculateur ajuste les poids de manière à ce que la somme pondérée des répondants pour chaque catégorie (comme le sexe, l'âge ou la région) soit rigoureusement égale aux proportions connues de la population générale. L'algorithme recalcule ces poids de manière itérative jusqu'à ce que toutes les distributions marginales de l'échantillon convergent vers les cibles définies.


    Raking vs. Post-stratification

    La méthode de post-stratification classique consiste à diviser l'échantillon en cellules croisées (par exemple, les femmes de 18 à 24 ans habitant en zone urbaine) et à appliquer un facteur de correction à chaque cellule. Cependant, cette méthode nécessite de connaître la taille de la population pour chaque croisement de variables, et se heurte rapidement au problème des cellules vides ou à très faible effectif dès que le nombre de critères augmente.

    Le raking (ou ajustement proportionnel itératif) résout cette limite en travaillant uniquement sur les distributions marginales (les totaux pour le sexe, les totaux pour l'âge, etc.) sans nécessiter le croisement complet des variables. L'algorithme ajuste successivement chaque variable l'une après l'autre. Si une seule variable catégorielle est fournie, l'outil complète sa calibration en un seul cycle, appliquant un simple ajustement de type part cible ÷ part actuelle à chaque catégorie. Lorsque plusieurs variables sont introduites, le raking effectue des cycles successifs jusqu'à ce que l'ensemble des marges correspondent simultanément.


    Préparation des données et paramètres d'entrée

    Pour utiliser le calculateur, vous devez fournir deux tableaux de données distincts:

    1. Données des répondants

    Ce tableau doit contenir une ligne d'en-tête et une ligne par répondant (maximum 20 000 lignes et 2 000 000 de caractères). Il doit comporter au moins deux colonnes nommées avec des en-têtes uniques.

    • Formats acceptés: Les colonnes peuvent être délimitées par des tabulations, des points-virgules ou des virgules (CSV). Dans les régions utilisant la virgule décimale, il est recommandé d'utiliser des tabulations ou des points-virgules pour éviter que la virgule de vos nombres ne soit interprétée comme un séparateur de colonne.
    • Colonne du poids de base (facultatif): Vous pouvez spécifier une colonne contenant les poids initiaux (par exemple, l'inverse de la probabilité de sélection). Ces valeurs doivent être des nombres finis supérieurs à 0. Si ce champ est laissé vide, chaque répondant reçoit un poids initial par défaut de 1.
    • Colonne de la variable d'intérêt (facultatif): Une colonne numérique finie qui permet de comparer la moyenne pondérée avant et après calage.

    2. Marges de population (%)

    Ce tableau définit les cibles démographiques à atteindre. Il doit comporter exactement trois colonnes: variable, catégorie et pourcentage cible.

    • Limites: Le tableau accepte un maximum de 500 lignes cibles, 6 variables de calage et 100 catégories cibles par variable.
    • Règles de cohérence: Pour chaque variable, la somme des pourcentages cibles doit être rigoureusement égale à 100 %. Chaque catégorie présente dans l'échantillon doit posséder une cible correspondante comprise entre 0 % et 100 %.

    3. Paramètres de l'algorithme

    • Tolérance relative: Seuil d'arrêt de l'algorithme (compris entre 1e-12 et 1e-2). Le calcul s'arrête lorsque l'écart relatif entre l'échantillon pondéré et la cible est inférieur ou égal à ce seuil.
    • Itérations maximales: Nombre maximal de cycles de calcul autorisés (de 1 à 500).

    Analyse des résultats et diagnostics de précision

    Une fois le calcul effectué, l'outil affiche un ensemble d'indicateurs pour évaluer la qualité du calage:

    Indicateurs de performance et de structure

    • Correspondance des marges: Affiche le message « Les ‹margins› marges de population correspondent toutes » ou, en cas d'arrêt précoce, « Arrêté avec une erreur relative maximale de ‹residual› ».
    • Taille effective de l'échantillon et Effet de pondération de Kish: L'introduction de poids inégaux augmente la variance des estimateurs. L'effet Kish mesure cette perte de précision. La taille effective représente la taille qu'aurait un échantillon aléatoire simple équivalent en termes de précision statistique.
    • Efficacité de la pondération: Pourcentage indiquant l'efficacité globale du plan pondéré par rapport à un échantillon non pondéré.

    Formules de calcul appliquées

    L'outil applique et affiche les équations suivantes pour normaliser les poids et calculer les diagnostics:

    • Ajustement initial par catégorie: ‹variable› / ‹category›: facteur = somme cible ÷ somme actuelle = ‹target› ÷ ‹current› = ‹factor›
    • Normalisation des poids (pour que la moyenne des poids soit égale à 1): Normaliser les poids finaux pour obtenir une moyenne de 1, de sorte que leur somme soit égale au nombre de répondants: Σw = n = ‹count›.
    • Effet de pondération de Kish: Effet de pondération de Kish = n·Σw² ÷ (Σw)² = ‹count›·‹sumSquares› ÷ ‹sum›² = ‹effect›.
    • Taille effective de l'échantillon: Taille effective de l'échantillon = (Σw)² ÷ Σw² = ‹sum›² ÷ ‹sumSquares› = ‹effective›.

    Ces poids correspondent uniquement aux marges fournies. Le diagnostic de Kish reflète exclusivement la variabilité des poids et n'intègre pas d'autres aspects du plan de sondage comme la stratification ou l'effet de grappe.


    Diagnostics d'erreur et alertes de l'algorithme

    Le calculateur intègre des contrôles rigoureux pour identifier les anomalies dans les données ou les paramètres:

    • Écarts de structure: Si le poids le plus grand est disproportionné par rapport au plus petit, l'outil affiche l'avertissement: « Les marges correspondent, mais le poids le plus grand est ‹ratio› fois supérieur au plus petit; inspectez la taille effective de l'échantillon avant de les utiliser. ».
    • Non-convergence: Si la limite d'itérations est atteinte sans satisfaire la tolérance, le message suivant apparaît: « Limite d'itérations (‹iterations›) atteinte avant la convergence. Les derniers poids sont affichés à des fins de diagnostic et non comme des résultats calés. ».
    • Absence de répondant (Zero-Cell): Si une catégorie possède une cible positive mais ne contient aucun répondant dans l'échantillon, le calcul est impossible et l'erreur suivante est générée: « “‹variable› / ‹category›” a une cible positive mais aucun poids d'échantillon utilisable, aucune solution finie n'existe donc. ».

    FAQ

    Qu'est-ce que le raking et quand une marge correspond-elle à une simple post-stratification?

    Le raking (redressement sur marges) ajuste une marge de population connue à la fois, puis effectue des cycles successifs jusqu'à ce que les marges précédentes correspondent toujours après les ajustements ultérieurs. Si vous ne fournissez qu'une seule variable catégorielle, un seul cycle suffit: chaque catégorie reçoit l'ajustement classique part cible ÷ part actuelle. Des marges multiples ne forcent pas leurs combinaisons croisées non répertoriées à correspondre.

    Que dois-je utiliser comme poids de base?

    Utilisez le poids qui précède le calage sur marge — généralement l'inverse de la probabilité de sélection finale de chaque répondant, après tout ajustement pour non-réponse requis par votre étude. Si vous ne disposez pas de poids de probabilité, laissez le champ vide pour attribuer initialement 1 à tout le monde. Cela produit des poids de calage, mais ne transforme pas un échantillon de convenance en un échantillon probabiliste.

    Pourquoi une cible peut-elle n'avoir aucune solution ou ne pas converger?

    Une cible positive ne peut pas être créée à partir d'une catégorie sans répondant échantillonné. Avec plusieurs variables, les combinaisons observées peuvent également rendre incompatibles des marges par ailleurs raisonnables. Une limite d'itérations trop courte ou des poids initiaux extrêmes peuvent interrompre le calcul avant d'atteindre la tolérance demandée. L'audit des cibles et le journal de la pire cible indiquent où subsiste l'écart; ne considérez pas ces derniers poids comme calés.

    L'effet de pondération de Kish correspond-il à l'effet global de plan de sondage?

    Non. Il mesure uniquement la perte de précision associée à des poids inégaux: des poids égaux donnent 1, et des poids plus variables réduisent la taille effective de l'échantillon. L'effet de grappe, la stratification, les corrections pour population finie et la relation entre la variable d'intérêt et les variables de calage peuvent tous modifier la variance réelle. Utilisez un logiciel prenant en compte le plan de sondage complet pour obtenir les erreurs types et les intervalles de confiance.