Fundamentos matemáticos de la regresión lineal por mínimos cuadrados
La regresión lineal simple es un método estadístico que busca modelar la relación entre una variable predictora independiente (x) y una variable de respuesta dependiente (y) mediante una línea recta. El método empleado para encontrar esta línea es el de mínimos cuadrados ordinarios (OLS, por sus siglas en inglés), que minimiza la suma de las diferencias verticales al cuadrado entre los puntos de datos observados y la recta ajustada.
Para garantizar la máxima precisión numérica, los cálculos de las sumas respecto a las medias se realizan en dos pasadas utilizando un algoritmo de suma compensada. Esto evita la pérdida de precisión que suele ocurrir cuando se opera con magnitudes muy distantes entre si. Las fórmulas fundamentales aplicadas son:
- Suma de cuadrados de x: Sxx = Σ(xᵢ − x̄)²
- Suma de cuadrados de y: Syy = Σ(yᵢ − ȳ)²
- Suma de productos cruzados: Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
A partir de estos valores, se calcula la pendiente (b) y la intersección (a) de la recta de regresión:
b = Sxy ÷ Sxx a = ȳ − b·x̄
Donde x̄ y ȳ representan las medias aritméticas de las variables de entrada.
Interpretación de los coeficientes y bondad de ajuste
Los coeficientes obtenidos describen la geometría de la relación entre las variables y permiten realizar interpretaciones prácticas sobre el comportamiento de los datos:
- Pendiente b: Representa el cambio estimado en la variable de respuesta por cada unidad que se incrementa la variable predictora. El sistema lo describe con la frase: "De media, y cambia en
‹slope›por cada incremento de 1 unidad en x.". - Intersección a: Es el valor donde la recta corta el eje vertical. Se describe bajo la regla: "Cuando x es 0, la recta se sitúa en y =
‹intercept›.".
Para evaluar la calidad del ajuste, se analizan diferentes métricas de dispersión y correlación:
- Correlación r: Mide la fuerza y dirección de la relación lineal. Equivale a Sxy ÷ √(Sxx · Syy) y conserva el signo de la pendiente.
- R² (Coeficiente de determinación): Representa la proporción de la variación total de y que es explicada por el modelo lineal. Se calcula como SSR ÷ SST, donde SST es la suma total de cuadrados (Syy) y SSE es la suma de cuadrados de los residuos.
- R² ajustado: Penaliza la métrica en función de los grados de libertad, calculándose como 1 - (1 - R²)(n - 1) ÷ (n - 2).
- Dispersión residual s: Estima la desviación típica de los residuos mediante la fórmula s = √(SSE ÷ (n - 2)).
Inferencia estadística y pruebas de hipótesis
El análisis de regresión no solo describe los datos de la muestra, sino que permite realizar inferencias sobre la población general mediante pruebas de hipótesis sobre los coeficientes.
La herramienta genera la tabla Coeficientes con las columnas Término, Estimación, Error típ., t, p e Intervalo ‹level›%. Las filas corresponden a la Pendiente b y la Intersección a. Los errores típicos se calculan de la siguiente manera:
SE(b) = s / (√(Sxx)) SE(a) = s · √(1 / n + (x̄²) / Sxx)
El estadístico t se obtiene dividiendo la estimación entre su error típico. El valor p asociado se calcula de forma bilateral utilizando la función beta incompleta regularizada I_{ u/( u+t^2)}( u/2, 1/2) con n - 2 grados de libertad. Dado que el modelo cuenta con un único predictor, la prueba F del Análisis de varianza (ANOVA) y la prueba t de la pendiente ofrecen exactamente el mismo valor p, ya que el estadístico F equivale al cuadrado de t.
Intervalos de confianza y predicción
Al realizar estimaciones para un valor específico x₀, existen dos tipos de intervalos con objetivos analíticos distintos:
- Media
‹level›%: Estima el valor medio de la respuesta para un subgrupo de la población con un valor x₀ determinado. Su error típico es: SEₘedia = s · √(1 / n + ((x₀ - x̄)²) / Sxx) - Intervalo individual del
‹level›%: Estima el rango en el que caerá una única observación futura. Al incorporar la variabilidad individual de los datos respecto a la recta, su error típico es mayor y siempre produce un intervalo más ancho: SEᵢndividual = s · √(1 + 1 / n + ((x₀ - x̄)²) / Sxx)
Ambos intervalos se ensanchan progresivamente a medida que el valor x₀ se aleja de la media muestral x. Si se introduce un valor de predicción fuera del rango de los datos de entrada, la tabla de predicciones mostrará la etiqueta fuera de los datos junto con la advertencia: "Las filas marcadas utilizan una x que está más allá de los valores introducidos, por lo que la recta se está prolongando fuera de lo que muestran los datos.".
Límites matemáticos y gestión de errores
El motor de cálculo valida los datos de entrada en tiempo real y detiene el procesamiento si se detectan inconsistencias o límites matemáticos insalvables:
- Menos de dos puntos: Requiere un mínimo de 2 puntos para operar. Si no se cumple, muestra el error: "Introduce al menos 2 puntos; un solo punto no define una recta.".
- Exactamente dos puntos: Si se introducen únicamente dos puntos, la recta se ajusta de forma exacta sin dejar grados de libertad para estimar la incertidumbre. Se muestra el mensaje: "Dos puntos definen la recta de forma exacta, por lo que no queda margen para estimar la incertidumbre.".
- Ajuste perfecto: Si todos los puntos se alinean perfectamente sobre la recta, la dispersión residual es cero. El sistema indica: "Los puntos se sitúan exactamente sobre la recta, por lo que no hay dispersión residual y no se puede estimar ningún intervalo ni valor p.".
- Valores de Y constantes: Si todas las coordenadas y son idénticas, la recta resultante es completamente horizontal. Se muestra el aviso: "Todos los valores de y son iguales, por lo que la recta es plana y r, R² y la prueba de significación no están definidos.".
- Valores de X constantes (Recta vertical): Si todas las coordenadas x son idénticas, el denominador Sxx se reduce a cero, lo que imposibilita el cálculo de la pendiente. El sistema se detiene con el error: "Todos los valores de x son iguales, por lo que la recta sería vertical y la pendiente dividiría por cero.".
Otras validaciones de formato incluyen mensajes específicos como "«‹token›» no es un número (fila ‹position›).", "Hay ‹countX› valores de x y ‹countY› valores de y; las listas deben tener la misma longitud.", o "Un valor o resultado intermedio supera el rango numérico admitido." en caso de desbordamiento numérico.
Privacidad y funcionamiento del software
Esta herramienta procesa toda la información de manera local. Tus puntos de datos y todos los cálculos estadísticos se quedan en este navegador y nunca se suben a ningún servidor. Esto permite trabajar con datos sensibles con la tranquilidad de que la información no sale de tu dispositivo.
El sistema no requiere un botón de activación; los resultados y los gráficos de la sección Ajuste y residuos (que incluye el Gráfico de dispersión de los puntos con la recta de mínimos cuadrados y la banda alrededor de su media y los Residuos representados frente a x, distribuidos alrededor de la línea cero) se recalculan automáticamente a medida que modificas los valores de entrada.
Preguntas frecuentes
¿Por qué las predicciones vienen con dos intervalos?
Responden a preguntas diferentes. El intervalo de la media estima dónde se sitúa la y media para todos los casos en esa x, por lo que solo cuenta la incertidumbre de la propia recta. El intervalo individual estima dónde caerá una nueva observación concreta, lo que añade la dispersión de los puntos alrededor de la recta; este término adicional es el motivo por el que siempre es el más ancho de los dos. Ambos se ensanchan a medida que x se aleja del centro de tus datos.
¿Un valor p pequeño significa que x causa y?
No. El valor p solo responde a una pregunta muy concreta: si la pendiente real fuera 0, ¿con qué frecuencia una muestra de este tamaño produciría una pendiente al menos tan alejada de 0? Un valor pequeño simplemente hace que la explicación de que «no existe ninguna relación» resulte inverosímil, nada más. La causalidad requiere un diseño de estudio que la respalde: un tercer factor que mueva ambas columnas, o una muestra que no se haya recopilado de forma independiente, produce valores p pequeños con la misma facilidad.
¿Qué información me da realmente el R²?
El R² es la proporción de la variación vertical de y que explica la recta: 0,96 significa que el 96 % se alinea con x y el 4 % no. No indica si una línea recta era la forma adecuada (una curva pronunciada puede seguir teniendo una puntuación alta), por lo que conviene analizarlo junto al gráfico de residuos. La correlación r es la raíz cuadrada de R² con el signo de la pendiente, razón por la cual r es negativa para una recta descendente.
¿Importa qué columna ponga en x?
Sí. El método de mínimos cuadrados minimiza las diferencias verticales, por lo que trata a y como la variable explicada y a x como la variable explicativa. Si los intercambias, obtendrás una pendiente y una intersección diferentes; solo r y R² permanecerán iguales. Coloca en y la variable que quieras predecir; si has introducido las columnas al revés, el botón de intercambiar las reescribirá directamente.