Calculadora de Ponderação de Pesquisa

Ajuste dados de respondentes a margens populacionais conhecidas por raking e inspecione cada peso final, resíduo de meta e tamanho efetivo da amostra.

Amostra e metas

Cole um cabeçalho e até 20,000 linhas de respondentes (2,000,000 de caracteres). Use tabulações ou ponto e vírgula para que a marca decimal do seu idioma permaneça dentro de cada célula.
Use variável, categoria e porcentagem de meta (0%–100%): no máximo 500 linhas, 6 variáveis e 100 categorias cada. Cada variável deve cobrir todas as categorias amostradas e somar 100%.
Opcional e sem dimensão. Deixe em branco para iniciar todos com peso 1. Os valores devem ser finitos e maiores que 0.
Coluna numérica finita opcional usada apenas para comparar médias ponderadas; os resultados mantêm a própria unidade da coluna.
Sem dimensão. Pare quando o erro relativo de cada meta estiver igual ou abaixo deste valor (1e-12 a 1e-2).
Os últimos pesos permanecem apenas para fins de diagnóstico se este limite for atingido antes da convergência (1 a 500).

Pesos calibrados

Correspondência de margens

Auditoria de metas

VariávelCategorian da amostraMetaPonderadoResíduo

Fatores de ajuste do primeiro ciclo

VariávelCategoriaSoma atualSoma da metaFator

Registro de convergência

IteraçãoErro relativo máx.Pior meta

Pesos dos respondentes

LinhaIDPeso baseAjustePeso finalResultado

Algoritmo e substituição

Smc = Σ wi for i in category c

Tmc = n × targetmc ÷ 100

amc = Tmc ÷ Smc

wi ← wi × amc

wi,final = di × adjustmenti

DEFFKish = n·Σwi² ÷ (Σwi

neff = (Σwi)² ÷ Σwi²

    Seus dados de respondentes e pesos calculados permanecem neste navegador e nunca são enviados para um servidor.

    FAQ

    O que é raking e quando uma margem é apenas pós-estratificação?

    O raking ajusta uma margem populacional conhecida de cada vez e, em seguida, passa ciclicamente por elas até que as margens anteriores ainda coincidam após os ajustes posteriores. Se você fornecer apenas uma variável categórica, um ciclo é suficiente: cada categoria recebe o conhecido ajuste de proporção da meta ÷ proporção atual. Múltiplas margens não forçam suas combinações cruzadas não listadas a coincidir.

    O que devo usar como peso base?

    Use o peso que pertence ao período anterior à calibração populacional — geralmente o inverso da probabilidade de seleção final de cada respondente, após qualquer ajuste de não resposta anterior que seu estudo exija. Se você não tiver pesos probabilísticos, deixe o campo em branco para iniciar todos em 1. Isso produz pesos de calibração, mas não transforma uma amostra de conveniência em uma amostra probabilística.

    O efeito de peso de Kish é o efeito de desenho amostral completo?

    Não. Ele mede apenas a perda de precisão associada a pesos desiguais: pesos iguais resultam em 1, e pesos mais variáveis reduzem o tamanho efetivo da amostra. Conglomeração, estratificação, correções de população finita e a relação do resultado com as variáveis de calibração podem alterar a variância real. Use um software que conheça o desenho amostral completo para erros padrão e intervalos de confiança.

    Por que uma meta pode não ter solução ou falhar em convergir?

    Uma meta positiva não pode ser criada a partir de uma categoria sem nenhum respondente amostrado. Com várias variáveis, as combinações observadas também podem tornar margens que de outra forma pareceriam razoáveis incompatíveis. Um limite de iterações muito curto ou pesos iniciais extremos podem interromper o processo antes da tolerância solicitada. A auditoria de metas e o registro de pior meta mostram onde a divergência permanece; não trate esses últimos pesos como calibrados.

    Introdução à Calibração de Pesquisas

    A calibração de dados amostrais é uma etapa fundamental na pesquisa quantitativa para garantir que as estimativas obtidas reflitam fielmente a população de estudo. Quando uma amostra apresenta desvios demográficos ou operacionais em relação a parâmetros populacionais conhecidos (como censo ou registros oficiais), os resultados brutos podem carregar vieses significativos. A calibração ajusta matematicamente a contribuição de cada respondente para que a composição da amostra coincida com as distribuições marginais da população.

    O processamento dos dados inseridos na ferramenta ocorre localmente. Seus dados de respondentes e pesos calculados permanecem neste navegador e nunca são enviados para um servidor. Isso garante que o tratamento das informações seja realizado inteiramente dentro do ambiente do seu navegador web.


    Raking vs. Pós-Estratificação

    A escolha do método de calibração depende diretamente do número de variáveis de controle e da disponibilidade de dados populacionais cruzados.

    A pós-estratificação simples divide a amostra em células exclusivas formadas pelo cruzamento de todas as variáveis de calibração (por exemplo, cruzando faixas etárias por gênero e por região). Esse método exige que se conheça a proporção populacional exata de cada célula combinada. Se houver muitas variáveis ou categorias, o número de células cresce exponencialmente, gerando células vazias na amostra (onde nenhum respondente foi coletado), o que inviabiliza o cálculo.

    O algoritmo de raking — também conhecido como ajuste proporcional iterativo (IPF) — resolve essa limitação trabalhando apenas com as margens unidimensionais de cada variável. Em vez de exigir a proporção de cada célula cruzada, o raking ajusta os pesos dos respondentes ciclicamente, uma variável de cada vez, até que todas as distribuições marginais da amostra coincidam simultaneamente com as metas populacionais estabelecidas.

    Sob uma única margem, o comportamento do algoritmo é simplificado. Se apenas uma variável categórica for fornecida, a calibração é concluída em um único ciclo, aplicando um ajuste direto de proporção da meta ÷ proporção atual para cada categoria.


    Preparação de Dados e Entradas do Sistema

    Para realizar a calibração, a ferramenta exige duas tabelas principais de entrada, além de parâmetros de controle opcionais:

    1. Dados dos respondentes

    Esta tabela deve conter uma linha de cabeçalho e uma linha para cada respondente, com um limite máximo de 20.000 linhas de respondentes e menos de 2,000,000 de caracteres.

    • Formatação: São aceitos delimitadores por tabulação, ponto e vírgula ou vírgulas de CSV. Em sistemas configurados em português, onde a vírgula é utilizada como separador decimal, recomenda-se o uso de tabulações ou ponto e vírgula para preservar a integridade dos valores numéricos dentro de suas respectivas células.
    • Regras de validação: A tabela deve conter pelo menos duas colunas nomeadas sem cabeçalho em branco, e cada cabeçalho de coluna deve ser exclusivo. Caso ocorram inconsistências, o sistema exibirá mensagens de erro específicas, como:
      • "Inclua uma linha de cabeçalho e pelo menos uma linha de respondente."
      • "A tabela de respondentes precisa de pelo menos duas colunas nomeadas sem cabeçalho em branco."
      • "Cada coluna de dados de respondentes precisa de um cabeçalho exclusivo."
      • "A linha ‹line› tem ‹actual› células; o cabeçalho tem ‹expected›."
      • "Não use mais de 2,000,000 de caracteres em nenhuma das tabelas coladas."
      • "Use no máximo ‹max› linhas de respondentes."

    2. Margens populacionais (%)

    Esta tabela define as metas de calibração e deve conter exatamente três colunas: variável, categoria e porcentagem de meta.

    • Limites: O sistema aceita no máximo 500 linhas de meta, 6 variáveis de calibração e 100 categorias de meta por variável.
    • Regras de validação: Cada variável de calibração deve somar exatamente 100% e cobrir todas as categorias presentes na amostra. As porcentagens individuais devem situar-se entre 0% e 100%. Erros de validação comuns incluem:
      • "A linha de meta ‹line› precisa de exatamente três células: variável, categoria e porcentagem."
      • "“‹token›” não é uma porcentagem de meta (linha de meta ‹line›)."
      • "A linha de meta ‹line› deve ser de 0% a 100%, inclusive."
      • "As metas para “‹variable›” somam ‹total›%; elas devem somar exatamente 100%."
      • "“‹variable› / ‹category›” aparece mais de uma vez na tabela de metas."
      • "Use no máximo ‹max› variáveis de calibração."
      • "“‹variable›” tem mais de ‹max› categorias de meta."
      • "Use no máximo ‹max› linhas de meta."
      • "Uma categoria de calibração está em branco na linha ‹line›. Nomeie valores ausentes explicitamente se eles fizerem parte da meta."
      • "A amostra contém “‹variable› / ‹category›”, mas a tabela de metas não."

    3. Configurações adicionais

    • Coluna de peso base: Campo opcional para definir pesos iniciais relativos e sem dimensão (por exemplo, inversos da probabilidade de seleção). Se deixado em branco, cada respondente recebe o peso inicial padrão de 1. Os valores inseridos devem ser finitos e maiores que 0. Erros associados:
      • "Os dados não contêm nenhuma coluna chamada “‹column›”."
      • "“‹token›” não é um peso base finito (linha ‹line›)."
      • "O peso base na linha ‹line› deve ser maior que 0."
    • Coluna de resultado: Campo opcional para avaliar o deslocamento de médias numéricas antes e depois da ponderação. Erro associado:
      • "“‹token›” não é um valor de resultado finito (linha ‹line›)."
    • Tolerância relativa: Critério de parada adimensional para a convergência do algoritmo, aceitando valores de 1e-12 a 1e-2. Erro associado:
      • "Escolha uma tolerância relativa de 1e-12 a 1e-2."
    • Máximo de iterações: Limite de ciclos de ajuste permitidos, aceitando inteiros de 1 a 500. Erro associado:
      • "Escolha um limite de iterações de 1 a 500."

    O Efeito de Peso de Kish e a Variância

    A aplicação de pesos desiguais aos respondentes reduz o poder estatístico da amostra. Para quantificar essa perda de precisão, a ferramenta calcula o Efeito de Peso de Kish e o Tamanho Efetivo da Amostra.

    A normalização dos pesos garante que a média dos pesos finais seja igual a 1, fazendo com que a soma dos pesos coincida com o tamanho da amostra original (n). A fórmula de normalização é expressa por:

    Σ w = n

    O Efeito de Peso de Kish avalia o incremento da variância decorrente da disparidade dos pesos. Ele é calculado pela seguinte fórmula:

    Efeito de peso de Kish = (n · Σ w²) / ((Σ w)²)

    O tamanho efetivo da amostra representa o tamanho de uma amostra aleatória simples equivalente que ofereceria o mesmo nível de precisão estatística. Ele é obtido por:

    Tamanho efetivo da amostra = ((Σ w)²) / (Σ w²)

    Esses pesos correspondem às margens que você forneceu, não a variáveis que você não forneceu. O diagnóstico de Kish reflete apenas pesos desiguais; ele não inclui conglomeração, estratificação ou uma estimativa completa da variância da pesquisa.


    Diagnóstico e Resolução de Problemas no Raking

    Durante a execução do algoritmo, o sistema monitora a convergência e pode apresentar diferentes estados e alertas de diagnóstico:

    • Sucesso na Convergência: Quando o erro relativo máximo atinge um valor igual ou inferior à tolerância configurada, o sistema exibe o cabeçalho principal "Todas as ‹margins› margens populacionais corresponderam" ou a mensagem "Convergiu na iteração ‹iterations›; todas as margens solicitadas correspondem.".
    • Pesos Iniciais Alinhados: Se os dados de entrada já estiverem perfeitamente calibrados com as metas, o sistema informa: "Os pesos iniciais já correspondem a todas as margens solicitadas.".
    • Falha de Convergência: Se o limite de iterações for atingido sem alcançar a tolerância definida, o sistema exibe "Parou com erro relativo máximo de ‹residual›" e o alerta: "O limite de iterações (‹iterations›) foi atingido antes da convergência. Os últimos pesos são mostrados para diagnóstico, não como resultados calibrados.".
    • Pesos Extremos: Se a calibração for bem-sucedida, mas gerar uma amplitude excessiva entre os pesos, o sistema exibe o aviso: "As margens corresponderam, mas o maior peso é ‹ratio› vezes o menor; inspecione o tamanho efetivo da amostra antes de usá-los.".
    • Condição de Célula Zero: Se uma categoria possuir meta populacional positiva, mas nenhum respondente correspondente na amostra (ou soma de peso base igual a zero), o cálculo é interrompido com o erro: "“‹variable› / ‹category›” tem uma meta positiva, mas nenhum peso amostral utilizável, portanto não existe solução finita.".
    • Estouro Numérico: Se os valores intermediários ultrapassarem os limites computacionais, o sistema reportará: "Um peso, soma ou ajuste saiu do intervalo numérico finito. Redimensione os pesos base e tente novamente.".

    Fórmulas e Substituições do Sistema

    Para fins de auditoria e transparência matemática, a ferramenta detalha as etapas de cálculo utilizando as seguintes estruturas de substituição:

    • Fatores de ajuste do primeiro ciclo: Mostra a correção inicial aplicada a cada categoria: ‹variable› / ‹category›: fator = soma da meta ÷ soma atual = ‹target› ÷ ‹current› = ‹factor›
    • Normalização: Normalize os pesos finais para média 1, de modo que a soma deles seja igual à contagem de respondentes: Σw = n = ‹count›.
    • Efeito de Kish: Efeito de peso de Kish = n·Σw² ÷ (Σw)² = ‹count›·‹sumSquares› ÷ ‹sum›² = ‹effect›.
    • Tamanho Efetivo: Tamanho efetivo da amostra = (Σw)² ÷ Σw² = ‹sum›² ÷ ‹sumSquares› = ‹effective›.

    Após a convergência, o botão "Copiar dados ponderados" permite exportar a tabela completa de respondentes acrescida das colunas raking_adjustment e raking_weight. Se esses nomes já existirem na tabela original, sufixos numéricos serão adicionados para evitar duplicidade de cabeçalhos. A interface exibe no máximo as primeiras 500 linhas para manter a responsividade do navegador, mas a cópia de dados exporta a totalidade dos registros ponderados.

    Perguntas Frequentes

    O que devo usar como peso base? Use o peso que pertence ao período anterior à calibração populacional — geralmente o inverso da probabilidade de seleção final de cada respondente, após qualquer ajuste de não resposta anterior que seu estudo exija. Se você não tiver pesos probabilísticos, deixe o campo em branco para iniciar todos em 1. Isso produz pesos de calibração, mas não transforma uma amostra de conveniência em uma amostra probabilística.

    Por que uma meta pode não ter solução ou falhar em convergir? Uma meta positiva não pode ser criada a partir de uma categoria sem nenhum respondente amostrado. Com várias variáveis, as combinações observadas também podem tornar margens que de outra forma pareceriam razoáveis incompatíveis. Um limite de iterações muito curto ou pesos iniciais extremos podem interromper o processo antes da tolerância solicitada. A auditoria de metas e o registro de pior meta mostram onde a divergência permanece; não trate esses últimos pesos como calibrados.

    O efeito de peso de Kish é o efeito de desenho amostral completo? Não. Ele mede apenas a perda de precisão associada a pesos desiguais: pesos iguais resultam em 1, e pesos mais variáveis reduzem o tamanho efetivo da amostra. Conglomeração, estratificação, correções de população finita e a relação do resultado com as variáveis de calibração podem alterar a variância real. Use um software que conheça o desenho amostral completo para erros padrão e intervalos de confiança.

    O que é raking e quando uma margem é apenas pós-estratificação? O raking ajusta uma margem populacional conhecida de cada vez e, em seguida, passa ciclicamente por elas até que as margens anteriores ainda coincidam após os ajustes posteriores. Se você fornecer apenas uma variável categórica, um ciclo é suficiente: cada categoria recebe o conhecido ajuste de proporção da meta ÷ proporção atual. Múltiplas margens não forçam suas combinações cruzadas não listadas a coincidir.