A regressão linear simples é um dos métodos estatísticos mais importantes para modelar a relação entre duas variáveis quantitativas. A Calculadora de Regressão Linear realiza o ajuste de uma linha de regressão por mínimos quadrados ordinários (OLS) diretamente no navegador web do usuário. O processamento ocorre localmente: seus pontos de dados e todas as estatísticas permanecem neste navegador e nunca são enviados para um servidor.
O cálculo é executado de forma dinâmica e os resultados são atualizados à medida que o usuário digita, sem a necessidade de clicar em um botão de envio.
Funcionamento e Entrada de Dados
A ferramenta suporta dois formatos de entrada de dados através do seletor de Layout:
- Linhas emparelhadas: Ideal para colar duas colunas copiadas diretamente de uma planilha. O utilitário identifica e ignora automaticamente a primeira linha caso ela contenha textos não numéricos, tratando-os como cabeçalhos de coluna.
- Duas listas: Permite inserir os valores de x (preditora) e valores de y (resposta) em campos de texto separados. Ambos os campos devem conter exatamente a mesma quantidade de elementos.
O comportamento dos separadores de dados adapta-se à convenção decimal escolhida:
- Ponto decimal (ex:
12.5): Os valores nas listas devem ser separados por espaços, vírgulas ou quebras de linha. - Vírgula decimal (ex:
12,5): Os valores nas listas devem ser separados por espaços, pontos e vírgulas ou quebras de linha.
Limites de Operação e Mensagens de Erro
A calculadora opera de forma segura dentro de limites estabelecidos para garantir a estabilidade do navegador:
- Volume de dados: Suporta de 2 a 50.000 pontos de dados (com limite de 1 MB de texto colado). Se o volume for excedido, exibe:
Mantenha os dados abaixo de 50000 pontos.. Se houver menos de dois pontos, exibe:Insira pelo menos 2 pontos; um único ponto não define uma linha.. - Previsões: Permite inserir até 50 valores de x para prever y. Caso exceda, exibe:
Preveja no máximo 50 valores por vez.. - Inconsistências de digitação: Se houver caracteres não numéricos ou linhas incompletas, o sistema aponta o local exato do erro com mensagens como
“‹token›” não é um número (linha ‹position›).,“‹token›” não é um número (valor ‹position›).ouA linha ‹position› precisa de exatamente dois números: x e depois y.. Se as listas tiverem tamanhos diferentes, exibe:Existem ‹countX› valores de x e ‹countY› valores de y — as listas devem ter o mesmo comprimento..
O Método dos Mínimos Quadrados e Derivação Matemática
O objetivo da regressão linear simples é encontrar a equação da reta que minimiza a soma dos quadrados dos resíduos verticais (a diferença entre os valores observados de y e os valores preditos ŷ). A equação da reta é expressa como:
ŷ = a + b·x
Onde b é a inclinação (slope) e a é o intercepto (intercept). Para garantir a máxima precisão numérica e evitar a perda de significância ao lidar com números de magnitudes muito distantes, a calculadora computa as somas dos quadrados em duas passagens utilizando compensação de soma:
- Médias amostrais: x̄ = Σxᵢ ÷ n e ȳ = Σyᵢ ÷ n
- Somas dos quadrados em relação à média: Sxx = Σ(xᵢ − x̄)² Syy = Σ(yᵢ − ȳ)² Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
- Coeficientes: Inclinação: b = Sxy ÷ Sxx Intercepto: a = ȳ − b·x̄
A ferramenta exibe o passo a passo completo dessas substituições na seção Fórmula e substituição:
Médias: x̄ = ‹sumX› ÷ ‹n› = ‹meanX› e ȳ = ‹sumY› ÷ ‹n› = ‹meanY›Dispersão e covariância: Sxx = ‹sxx› e Sxy = ‹sxy›Inclinação: b = Sxy ÷ Sxx = ‹sxy› ÷ ‹sxx› = ‹slope›Intercepto: a = ȳ − b·x̄ = ‹meanY› − (‹slope›)·‹meanX› = ‹intercept›
Interpretação dos Coeficientes e Significância
Os resultados gerados no painel Linha de regressão traduzem os coeficientes matemáticos em termos práticos:
- Inclinação b:
Em média, y muda em ‹slope› para cada 1 unidade a mais em x. - Intercepto a:
Onde x é 0, a linha fica em y = ‹intercept›.
Tabela de Coeficientes e Testes de Hipótese
A tabela de Coeficientes detalha a incerteza associada às estimativas de Inclinação b e Intercepto a:
| Termo | Estimativa | Erro padrão | t | p | Intervalo de ‹level›% |
|---|---|---|---|---|---|
| Inclinação b | b | SE(b) | t | p | b ± t_crit × SE(b) |
| Intercepto a | a | SE(a) | t | p | a ± t_crit × SE(a) |
Onde o erro padrão da inclinação é SE(b) = s ÷ √Sxx, e o erro padrão do intercepto é SE(a) = s · √(1÷n + x̄² ÷ Sxx). A estatística t é calculada pela razão entre a estimativa e seu erro padrão, testada de forma bilateral sob n − 2 graus de liberdade. O valor-p é derivado através da função beta incompleta regularizada.
Análise de Variância (ANOVA) e Ajuste do Modelo
A variabilidade total dos dados de resposta (SST = Syy) é decomposta em duas partes: a variação explicada pela reta de regressão (SSR = SST − SSE) e a variação residual não explicada (SSE = Σ(yᵢ − ŷᵢ)²). Essa relação é apresentada na tabela Variância explicada:
| Fonte | gl | Soma dos quadrados | Quadrado médio | F | p |
|---|---|---|---|---|---|
| Explicado pela linha | 1 | SSR | MSR = SSR ÷ 1 | MSR ÷ MSE | p |
| Residual | n − 2 | SSE | MSE = SSE ÷ (n − 2) | ||
| Total | n − 1 | SST |
A dispersão residual s (erro padrão do modelo) é calculada como s = √MSE. O coeficiente de determinação R² representa a proporção da variação explicada: R² = SSR ÷ SST. O R² ajustado corrige essa métrica com base nos graus de liberdade: 1 − (1 − R²)(n − 1) ÷ (n − 2). A correlação r equivale a √R², preservando o sinal algébrico da inclinação b.
Condições de Contorno e Casos Especiais
A análise de regressão possui restrições matemáticas estritas que geram comportamentos específicos na ferramenta:
- Apenas dois pontos: Dois pontos definem uma reta perfeita. A calculadora exibe:
Dois pontos definem a linha exatamente, portanto não sobra nada para estimar a incerteza.. - Ajuste perfeito: Se todos os pontos estiverem alinhados sobre a reta, a soma dos quadrados dos resíduos (SSE) é zero. O sistema informa:
Os pontos estão exatamente sobre a linha, portanto não há dispersão residual e nenhum intervalo ou valor-p pode ser estimado.. - Valores de Y constantes: Se todos os valores de y forem idênticos, a reta resultante é perfeitamente horizontal (b = 0). A ferramenta exibe:
Todos os valores de y são iguais, portanto a linha é plana e r, R² e o teste de significância não estão definidos.. - Valores de X constantes: Se todos os valores de x forem iguais, a reta seria vertical, o que causaria uma divisão por zero (Sxx = 0). O cálculo é interrompido com o erro:
Todos os valores de x são iguais, portanto a linha seria vertical e a inclinação dividiria por zero..
Perguntas Frequentes
Faz diferença qual coluna eu coloco em x?
Sim. Os mínimos quadrados minimizam as distâncias verticais, portanto tratam y como a variável explicada e x como a variável explicativa. Inverta-os e você obterá uma inclinação diferente e um intercepto diferente — apenas r e R² permanecem os mesmos. Coloque a variável que você deseja prever em y; se as colunas foram inseridas na ordem errada, o botão de inverter as reescreve no local.
O que o R² realmente me diz?
O R² é a proporção da variação vertical em y que a linha explica: 0,96 significa que 96% dela se alinha com x e 4% não. Ele não diz se uma linha reta era o formato correto — uma curva clara ainda pode obter uma pontuação alta —, portanto, analise-o junto ao gráfico de resíduos. A correlação r é a raiz quadrada do R² acompanhando o sinal da inclinação, razão pela qual r é negativo para uma linha descendente.
Por que as previsões vêm com dois intervalos?
Eles respondem a perguntas diferentes. O intervalo da média pergunta onde fica o y médio para todos naquele x, de modo que apenas a incerteza da própria linha importa. O intervalo individual pergunta onde uma nova observação irá cair, o que adiciona a dispersão dos pontos ao redor da linha — esse termo extra é o motivo pelo qual ele é sempre o mais amplo dos dois. Ambos se alargam à medida que x se afasta do centro dos seus dados.
Um valor-p pequeno significa que x causa y?
Não. O valor-p responde apenas a uma pergunta estreita: se a inclinação real fosse 0, com que frequência uma amostra deste tamanho produziria uma inclinação pelo menos tão distante de 0? Um valor pequeno torna a explicação de “nenhuma relação” implausível, nada mais. A causalidade exige o desenho do estudo por trás dela — um terceiro fator que mova ambas as colunas, ou uma amostra que não tenha sido coletada de forma independente, produz valores-p pequenos com a mesma facilidade.