Calculadora de Regressão Linear

Ajuste uma linha de mínimos quadrados a dados emparelhados e veja sua inclinação, R², valor-p, intervalos de confiança, resíduos e previsões em um só lugar.

Dados

Coloque x primeiro, depois y. Duas colunas copiadas de uma planilha podem ser coladas diretamente, incluindo a linha de cabeçalho. Use vírgula para decimais, como 12,5.
Opcional. Até 50 valores, separados por espaços.

Linha de regressão

Linha de mínimos quadrados

Coeficientes

TermoEstimativaErro padrãotpIntervalo de {level}%

Variância explicada

FonteglSoma dos quadradosQuadrado médioFp

Ajuste e resíduos

Previsões

O intervalo da média cobre o y médio naquele x. O intervalo individual cobre uma nova observação, por isso é sempre mais amplo.

xŷMédia {level}%Individual de {level}%

Ponto a ponto

xyŷy − ŷ

Fórmula e substituição

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    Seus pontos de dados e todas as estatísticas permanecem neste navegador e nunca são enviados para um servidor.

    FAQ

    O que o R² realmente me diz?

    O R² é a proporção da variação vertical em y que a linha explica: 0,96 significa que 96% dela se alinha com x e 4% não. Ele não diz se uma linha reta era o formato correto — uma curva clara ainda pode obter uma pontuação alta —, portanto, analise-o junto ao gráfico de resíduos. A correlação r é a raiz quadrada do R² acompanhando o sinal da inclinação, razão pela qual r é negativo para uma linha descendente.

    Um valor-p pequeno significa que x causa y?

    Não. O valor-p responde apenas a uma pergunta estreita: se a inclinação real fosse 0, com que frequência uma amostra deste tamanho produziria uma inclinação pelo menos tão distante de 0? Um valor pequeno torna a explicação de “nenhuma relação” implausível, nada mais. A causalidade exige o desenho do estudo por trás dela — um terceiro fator que mova ambas as colunas, ou uma amostra que não tenha sido coletada de forma independente, produz valores-p pequenos com a mesma facilidade.

    Por que as previsões vêm com dois intervalos?

    Eles respondem a perguntas diferentes. O intervalo da média pergunta onde fica o y médio para todos naquele x, de modo que apenas a incerteza da própria linha importa. O intervalo individual pergunta onde uma nova observação irá cair, o que adiciona a dispersão dos pontos ao redor da linha — esse termo extra é o motivo pelo qual ele é sempre o mais amplo dos dois. Ambos se alargam à medida que x se afasta do centro dos seus dados.

    Faz diferença qual coluna eu coloco em x?

    Sim. Os mínimos quadrados minimizam as distâncias verticais, portanto tratam y como a variável explicada e x como a variável explicativa. Inverta-os e você obterá uma inclinação diferente e um intercepto diferente — apenas r e R² permanecem os mesmos. Coloque a variável que você deseja prever em y; se as colunas foram inseridas na ordem errada, o botão de inverter as reescreve no local.

    A regressão linear simples é um dos métodos estatísticos mais importantes para modelar a relação entre duas variáveis quantitativas. A Calculadora de Regressão Linear realiza o ajuste de uma linha de regressão por mínimos quadrados ordinários (OLS) diretamente no navegador web do usuário. O processamento ocorre localmente: seus pontos de dados e todas as estatísticas permanecem neste navegador e nunca são enviados para um servidor.

    O cálculo é executado de forma dinâmica e os resultados são atualizados à medida que o usuário digita, sem a necessidade de clicar em um botão de envio.


    Funcionamento e Entrada de Dados

    A ferramenta suporta dois formatos de entrada de dados através do seletor de Layout:

    • Linhas emparelhadas: Ideal para colar duas colunas copiadas diretamente de uma planilha. O utilitário identifica e ignora automaticamente a primeira linha caso ela contenha textos não numéricos, tratando-os como cabeçalhos de coluna.
    • Duas listas: Permite inserir os valores de x (preditora) e valores de y (resposta) em campos de texto separados. Ambos os campos devem conter exatamente a mesma quantidade de elementos.

    O comportamento dos separadores de dados adapta-se à convenção decimal escolhida:

    • Ponto decimal (ex: 12.5): Os valores nas listas devem ser separados por espaços, vírgulas ou quebras de linha.
    • Vírgula decimal (ex: 12,5): Os valores nas listas devem ser separados por espaços, pontos e vírgulas ou quebras de linha.

    Limites de Operação e Mensagens de Erro

    A calculadora opera de forma segura dentro de limites estabelecidos para garantir a estabilidade do navegador:

    • Volume de dados: Suporta de 2 a 50.000 pontos de dados (com limite de 1 MB de texto colado). Se o volume for excedido, exibe: Mantenha os dados abaixo de 50000 pontos.. Se houver menos de dois pontos, exibe: Insira pelo menos 2 pontos; um único ponto não define uma linha..
    • Previsões: Permite inserir até 50 valores de x para prever y. Caso exceda, exibe: Preveja no máximo 50 valores por vez..
    • Inconsistências de digitação: Se houver caracteres não numéricos ou linhas incompletas, o sistema aponta o local exato do erro com mensagens como “‹token›” não é um número (linha ‹position›)., “‹token›” não é um número (valor ‹position›). ou A linha ‹position› precisa de exatamente dois números: x e depois y.. Se as listas tiverem tamanhos diferentes, exibe: Existem ‹countX› valores de x e ‹countY› valores de y — as listas devem ter o mesmo comprimento..

    O Método dos Mínimos Quadrados e Derivação Matemática

    O objetivo da regressão linear simples é encontrar a equação da reta que minimiza a soma dos quadrados dos resíduos verticais (a diferença entre os valores observados de y e os valores preditos ŷ). A equação da reta é expressa como:

    ŷ = a + b·x

    Onde b é a inclinação (slope) e a é o intercepto (intercept). Para garantir a máxima precisão numérica e evitar a perda de significância ao lidar com números de magnitudes muito distantes, a calculadora computa as somas dos quadrados em duas passagens utilizando compensação de soma:

    1. Médias amostrais: x̄ = Σxᵢ ÷ n e ȳ = Σyᵢ ÷ n
    2. Somas dos quadrados em relação à média: Sxx = Σ(xᵢ − x̄)² Syy = Σ(yᵢ − ȳ)² Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
    3. Coeficientes: Inclinação: b = Sxy ÷ Sxx Intercepto: a = ȳ − b·x̄

    A ferramenta exibe o passo a passo completo dessas substituições na seção Fórmula e substituição:

    • Médias: x̄ = ‹sumX› ÷ ‹n› = ‹meanX› e ȳ = ‹sumY› ÷ ‹n› = ‹meanY›
    • Dispersão e covariância: Sxx = ‹sxx› e Sxy = ‹sxy›
    • Inclinação: b = Sxy ÷ Sxx = ‹sxy› ÷ ‹sxx› = ‹slope›
    • Intercepto: a = ȳ − b·x̄ = ‹meanY› − (‹slope›)·‹meanX› = ‹intercept›

    Interpretação dos Coeficientes e Significância

    Os resultados gerados no painel Linha de regressão traduzem os coeficientes matemáticos em termos práticos:

    • Inclinação b: Em média, y muda em ‹slope› para cada 1 unidade a mais em x.
    • Intercepto a: Onde x é 0, a linha fica em y = ‹intercept›.

    Tabela de Coeficientes e Testes de Hipótese

    A tabela de Coeficientes detalha a incerteza associada às estimativas de Inclinação b e Intercepto a:

    Termo Estimativa Erro padrão t p Intervalo de ‹level›%
    Inclinação b b SE(b) t p b ± t_crit × SE(b)
    Intercepto a a SE(a) t p a ± t_crit × SE(a)

    Onde o erro padrão da inclinação é SE(b) = s ÷ √Sxx, e o erro padrão do intercepto é SE(a) = s · √(1÷n + x̄² ÷ Sxx). A estatística t é calculada pela razão entre a estimativa e seu erro padrão, testada de forma bilateral sob n − 2 graus de liberdade. O valor-p é derivado através da função beta incompleta regularizada.


    Análise de Variância (ANOVA) e Ajuste do Modelo

    A variabilidade total dos dados de resposta (SST = Syy) é decomposta em duas partes: a variação explicada pela reta de regressão (SSR = SST − SSE) e a variação residual não explicada (SSE = Σ(yᵢ − ŷᵢ)²). Essa relação é apresentada na tabela Variância explicada:

    Fonte gl Soma dos quadrados Quadrado médio F p
    Explicado pela linha 1 SSR MSR = SSR ÷ 1 MSR ÷ MSE p
    Residual n − 2 SSE MSE = SSE ÷ (n − 2)
    Total n − 1 SST

    A dispersão residual s (erro padrão do modelo) é calculada como s = √MSE. O coeficiente de determinação R² representa a proporção da variação explicada: R² = SSR ÷ SST. O R² ajustado corrige essa métrica com base nos graus de liberdade: 1 − (1 − R²)(n − 1) ÷ (n − 2). A correlação r equivale a √R², preservando o sinal algébrico da inclinação b.


    Condições de Contorno e Casos Especiais

    A análise de regressão possui restrições matemáticas estritas que geram comportamentos específicos na ferramenta:

    • Apenas dois pontos: Dois pontos definem uma reta perfeita. A calculadora exibe: Dois pontos definem a linha exatamente, portanto não sobra nada para estimar a incerteza..
    • Ajuste perfeito: Se todos os pontos estiverem alinhados sobre a reta, a soma dos quadrados dos resíduos (SSE) é zero. O sistema informa: Os pontos estão exatamente sobre a linha, portanto não há dispersão residual e nenhum intervalo ou valor-p pode ser estimado..
    • Valores de Y constantes: Se todos os valores de y forem idênticos, a reta resultante é perfeitamente horizontal (b = 0). A ferramenta exibe: Todos os valores de y são iguais, portanto a linha é plana e r, R² e o teste de significância não estão definidos..
    • Valores de X constantes: Se todos os valores de x forem iguais, a reta seria vertical, o que causaria uma divisão por zero (Sxx = 0). O cálculo é interrompido com o erro: Todos os valores de x são iguais, portanto a linha seria vertical e a inclinação dividiria por zero..

    Perguntas Frequentes

    Faz diferença qual coluna eu coloco em x?
    Sim. Os mínimos quadrados minimizam as distâncias verticais, portanto tratam y como a variável explicada e x como a variável explicativa. Inverta-os e você obterá uma inclinação diferente e um intercepto diferente — apenas r e R² permanecem os mesmos. Coloque a variável que você deseja prever em y; se as colunas foram inseridas na ordem errada, o botão de inverter as reescreve no local.

    O que o R² realmente me diz?
    O R² é a proporção da variação vertical em y que a linha explica: 0,96 significa que 96% dela se alinha com x e 4% não. Ele não diz se uma linha reta era o formato correto — uma curva clara ainda pode obter uma pontuação alta —, portanto, analise-o junto ao gráfico de resíduos. A correlação r é a raiz quadrada do R² acompanhando o sinal da inclinação, razão pela qual r é negativo para uma linha descendente.

    Por que as previsões vêm com dois intervalos?
    Eles respondem a perguntas diferentes. O intervalo da média pergunta onde fica o y médio para todos naquele x, de modo que apenas a incerteza da própria linha importa. O intervalo individual pergunta onde uma nova observação irá cair, o que adiciona a dispersão dos pontos ao redor da linha — esse termo extra é o motivo pelo qual ele é sempre o mais amplo dos dois. Ambos se alargam à medida que x se afasta do centro dos seus dados.

    Um valor-p pequeno significa que x causa y?
    Não. O valor-p responde apenas a uma pergunta estreita: se a inclinação real fosse 0, com que frequência uma amostra deste tamanho produziria uma inclinação pelo menos tão distante de 0? Um valor pequeno torna a explicação de “nenhuma relação” implausível, nada mais. A causalidade exige o desenho do estudo por trás dela — um terceiro fator que mova ambas as colunas, ou uma amostra que não tenha sido coletada de forma independente, produz valores-p pequenos com a mesma facilidade.