Calculadora de Regressão Linear

Ajuste uma linha de mínimos quadrados a dados emparelhados e consulte o seu declive, R², valor p, intervalos de confiança, resíduos e previsões num único local.

Dados

Coloque primeiro o x, depois o y. Duas colunas copiadas de uma folha de cálculo são coladas diretamente, incluindo a linha de cabeçalho. Use uma vírgula para as décimas, como 12,5.
Opcional. Até 50 valores, separados por espaços.

Linha de regressão

Linha de mínimos quadrados

Coeficientes

TermoEstimativaErro padrãotpIntervalo de {level}%

Variância explicada

FonteglSoma dos quadradosQuadrado médioFp

Ajuste e resíduos

Previsões

O intervalo da média cobre o y médio para aquele x. O intervalo individual cobre uma nova observação, pelo que é sempre mais amplo.

xŷMédia {level}%Individual de {level}%

Ponto por ponto

xyŷy − ŷ

Fórmula e substituição

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    Os seus dados e todas as estatísticas permanecem neste navegador e nunca são enviados para um servidor.

    Perguntas Frequentes

    O que é que o R² realmente me diz?

    O R² é a proporção do movimento de subida e descida em y que é explicada pela linha: 0,96 significa que 96% do mesmo se alinha com x e 4% não. Não diz nada sobre se uma linha reta era a forma correta — uma curva clara ainda pode obter uma pontuação elevada — por isso, analise-o juntamente com o gráfico de resíduos. A correlação r é a raiz quadrada de R² com o sinal do declive, razão pela qual r é negativo para uma linha descendente.

    Um valor p pequeno significa que x causa y?

    Não. O valor p responde apenas a uma questão estreita: se o declive real fosse 0, com que frequência uma amostra deste tamanho produziria um declive pelo menos tão distante de 0? Um valor pequeno torna a hipótese de “ausência de relação” uma explicação pouco plausível, nada mais. A causalidade exige a conceção do próprio estudo — um terceiro fator que mova ambas as colunas, ou uma amostra que não tenha sido recolhida de forma independente, produz valores p pequenos com a mesma facilidade.

    Por que razão as previsões vêm com dois intervalos?

    Eles respondem a perguntas diferentes. O intervalo da média pergunta onde se situa o y médio para todos os indivíduos naquele x, pelo que apenas conta a incerteza da própria linha. O intervalo individual pergunta onde irá cair uma nova observação, o que adiciona a dispersão dos pontos em torno da linha — esse termo extra é a razão pela qual este é sempre o mais amplo dos dois. Ambos alargam à medida que x se afasta do centro dos seus dados.

    Importa qual a coluna que coloco em x?

    Sim. Os mínimos quadrados minimizam as diferenças verticais, pelo que tratam y como a variável a ser explicada e x como a variável explicativa. Se os inverter, obterá um declive diferente e uma interceção diferente — apenas r e R² permanecem inalterados. Coloque a variável que deseja prever em y; se as colunas tiverem sido inseridas na ordem errada, o botão de inversão reescreve-as no local.

    A modelação estatística através do método dos mínimos quadrados ordinários (OLS) permite quantificar a relação linear entre uma variável preditora (x) e uma variável de resposta (y). A Calculadora de Regressão Linear executa estes cálculos diretamente no seu navegador web, fornecendo uma análise estatística completa que inclui coeficientes, testes de hipóteses, intervalos de confiança, análise de resíduos e previsões.

    O Método dos Mínimos Quadrados Ordinários

    O objetivo da regressão linear simples é ajustar uma linha reta aos dados emparelhados de modo a minimizar a soma dos quadrados dos desvios verticais (os resíduos) entre os pontos observados e a linha ajustada. Este método baseia-se em fórmulas matemáticas precisas para determinar o declive e a interceção da reta.

    Para garantir a máxima precisão numérica, especialmente quando os dados contêm valores com ordens de magnitude muito distantes, os cálculos das somas dos quadrados em torno das médias são realizados em duas passagens com compensação de soma:

    • A dispersão de x é dada por: Sxx = Σ(xᵢ − x̄)²
    • A dispersão de y é dada por: Syy = Σ(yᵢ − ȳ)²
    • A covariação entre as duas variáveis é calculada como: Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)

    A partir destes valores intermédios, o declive (b) e a interceção (a) da reta de regressão são determinados:

    • Declive b: b = Sxy ÷ Sxx
    • Interceção a: a = ȳ − b·x̄

    Onde x̄ e ȳ representam as médias aritméticas das amostras de x e y, respetivamente.

    Interpretação dos Coeficientes e Variabilidade

    Os resultados gerados pela ferramenta permitem uma interpretação direta do comportamento do modelo:

    • Declive b: Em média, y varia ‹slope› por cada aumento de 1 unidade em x. Este valor indica a inclinação da reta e a direção da associação.
    • Interceção a: Onde x é 0, a linha situa-se em y = ‹intercept›. Representa o ponto onde a reta cruza o eixo vertical.

    A qualidade do ajuste e a força da relação linear são avaliadas através de diferentes métricas de correlação e determinação:

    • Correlação r: O coeficiente de correlação de Pearson (r) mede a força e a direção da relação linear, sendo calculado como r = Sxy ÷ √(Sxx·Syy). O seu sinal acompanha sempre o sinal do declive.
    • R² (Coeficiente de Determinação): Representa a proporção da variação total de y que é explicada pela reta de regressão, calculada por R² = SSR ÷ SST, onde SSR é a soma dos quadrados da regressão e SST é a soma total dos quadrados.
    • R² ajustado: Corrige o R² introduzindo os graus de liberdade, sendo útil para evitar a sobreavaliação do ajuste: Adjusted R² = 1 − (1 − R²)(n − 1) ÷ (n − 2).
    • Dispersão residual s: Mede o desvio padrão dos resíduos em torno da linha ajustada, calculado através de s = √(SSE ÷ (n − 2)), onde SSE é a soma dos quadrados dos resíduos.

    Testes de Hipóteses e Significância Estatística

    Para determinar se a relação linear observada é estatisticamente significativa, a ferramenta realiza testes de hipóteses sobre os coeficientes. O erro padrão do declive é calculado como SE(b) = s ÷ √Sxx, enquanto o erro padrão da interceção é SE(a) = s · √(1÷n + x̄² ÷ Sxx).

    A estatística t para o declive é obtida através da razão entre a estimativa e o seu erro padrão: t = b ÷ SE(b). O valor p associado é calculado de forma bicaudal com base na distribuição t de Student com n − 2 graus de liberdade, recorrendo à função beta incompleta regularizada. Na regressão linear simples com um único preditor, o teste F global da tabela de Variância explicada (ANOVA) é equivalente ao quadrado da estatística t do declive, resultando exatamente no mesmo valor p.

    Intervalos de Confiança e Previsões

    Ao introduzir valores no campo "Prever y em x", a ferramenta calcula a estimativa pontual ŷ₀ = a + b·x₀ e apresenta dois intervalos distintos com base no nível de confiança selecionado (90%, 95% ou 99%):

    1. Intervalo para a média (Média ‹level›%): Representa a incerteza associada à estimativa do valor médio de y para um determinado x₀. O erro padrão aplicável é s · √(1÷n + (x₀ − x̄)² ÷ Sxx).
    2. Intervalo individual (Individual ‹level›%): Representa a incerteza ao prever o valor de uma nova observação isolada. O seu erro padrão é s · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx). Devido à variabilidade adicional da própria observação em torno da reta, o intervalo individual é sempre mais amplo do que o intervalo da média. Ambos os intervalos alargam-se à medida que o valor de x₀ se afasta da média amostral x̄.

    Se um valor de x introduzido para previsão estiver fora do intervalo dos dados observados, a tabela exibe a etiqueta "fora dos dados" acompanhada do aviso: "As linhas assinaladas utilizam um x que está além dos valores introduzidos, pelo que a linha está a ser estendida para lá do que os dados mostram.".

    Regras de Entrada de Dados e Casos Limite

    A calculadora suporta a introdução de dados através de duas disposições: "Linhas emparelhadas" ou "Duas listas". A formatação dos dados deve respeitar as seguintes regras de separação de acordo com a convenção decimal escolhida:

    • Ponto decimal: Os valores nas listas devem ser separados por espaços, vírgulas ou quebras de linha.
    • Vírgula decimal: Os valores nas listas devem ser separados por espaços, pontos e vírgulas ou quebras de linha.

    A primeira linha de dados colada a partir de uma folha de cálculo é automaticamente ignorada se contiver texto não numérico, permitindo a colagem direta de colunas com cabeçalhos.

    Existem condições matemáticas limite que afetam a execução dos cálculos:

    • Exatamente dois pontos: A reta é ajustada perfeitamente. É exibida a mensagem: "Dois pontos definem a linha exatamente, pelo que não resta nada a partir do qual estimar a incerteza.".
    • Ajuste perfeito: Se todos os pontos estiverem alinhados sobre a reta, a dispersão residual é nula. É exibida a mensagem: "Os pontos situam-se exatamente sobre a linha, pelo que não existe dispersão residual e nenhum intervalo ou valor p pode ser estimado.".
    • Valores de Y constantes: Se todos os valores de y forem idênticos, a reta é horizontal. É exibida a mensagem: "Todos os valores de y são iguais, pelo que a linha é plana e r, R² e o teste de significância não estão definidos.".
    • Valores de X constantes: Se todos os valores de x forem idênticos, a reta seria vertical. O cálculo é interrompido com o erro: "Todos os valores de x são iguais, pelo que a linha seria vertical e o declive dividiria por zero.".

    Privacidade e Processamento Local

    A segurança e a privacidade dos dados são asseguradas pelo método de processamento da ferramenta. Os seus dados e todas as estatísticas permanecem neste navegador e nunca são enviados para um servidor. Toda a computação matemática e a geração de gráficos ocorrem localmente no dispositivo do utilizador.

    Perguntas Frequentes

    Importa qual a coluna que coloco em x?
    Sim. Os mínimos quadrados minimizam as diferenças verticais, pelo que tratam y como a variável a ser explicada e x como a variável explicativa. Se os inverter, obterá um declive diferente e uma interceção diferente — apenas r e R² permanecem inalterados. Coloque a variável que deseja prever em y; se as colunas tiverem sido inseridas na ordem errada, o botão de inversão reescreve-as no local.

    O que é que o R² realmente me diz?
    O R² é a proporção do movimento de subida e descida em y que é explicada pela linha: 0,96 significa que 96% do mesmo se alinha com x e 4% não. Não diz nada sobre se uma linha reta era a forma correta — uma curva clara ainda pode obter uma pontuação elevada — por isso, analise-o juntamente com o gráfico de resíduos. A correlação r é a raiz quadrada de R² com o sinal do declive, razão pela qual r é negativo para uma linha descendente.

    Por que razão as previsões vêm com dois intervalos?
    Eles respondem a perguntas diferentes. O intervalo da média pergunta onde se situa o y médio para todos os indivíduos naquele x, pelo que apenas conta a incerteza da própria linha. O intervalo individual pergunta onde irá cair uma nova observação, o que adiciona a dispersão dos pontos em torno da linha — esse termo extra é a razão pela qual este é sempre o mais amplo dos dois. Ambos alargam à medida que x se afasta do centro dos seus dados.

    Um valor p pequeno significa que x causa y?
    Não. O valor p responde apenas a uma questão estreita: se o declive real fosse 0, com que frequência uma amostra deste tamanho produziria um declive pelo menos tão distante de 0? Um valor pequeno torna a hipótese de “ausência de relação” uma explicação pouco plausível, nada mais. A causalidade exige a conceção do próprio estudo — um terceiro fator que mova ambas as colunas, ou uma amostra que não tenha sido recolhida de forma independente, produz valores p pequenos com a mesma facilidade.