18.1. Introducción a la regresión lineal
La correlación responde a «¿están relacionadas X e Y?«. La regresión responde a una pregunta distinta y más ambiciosa: «dado un valor de X, ¿qué valor de Y se puede esperar?«. Para responderla hace falta construir un modelo matemático explícito, no solo un coeficiente que resuma la asociación.
Regresión lineal simple: modelo estadístico que describe la relación entre una variable dependiente Y (la que se quiere predecir) y una variable independiente X (la que se usa para predecir), asumiendo que esa relación es aproximadamente lineal.
A diferencia de la correlación, que es simétrica (r entre X e Y es el mismo que entre Y y X), la regresión es asimétrica.
Esto requiere decidir cuál es la variable que se predice (dependiente) y cuál la que se usa para predecir (independiente). Esta decisión depende del diseño del estudio y de la pregunta de investigación, no es intercambiable.
Si se quiere predecir el gasto calórico (Y) a partir del peso corporal (X), el peso es la variable independiente. Si en cambio se quisiera predecir el peso a partir del gasto calórico, los papeles se invertirían y la recta resultante, en general, no sería la misma recta despejada algebraicamente.
18.2. El modelo de regresión lineal simple
El modelo asume que la relación entre X e Y sigue la ecuación de una recta, con un término de error que recoge la variabilidad no explicada por el modelo:
| Elemento | Significado |
|---|---|
| β₀ (intercepto) | Valor predicho de Y cuando X = 0 |
| β₁ (pendiente) | Cambio promedio en Y por cada unidad que aumenta X |
| ε (error) | Variabilidad de Y no explicada por su relación lineal con X |
El intercepto β₀ no siempre tiene sentido clínico interpretable. Si X es la edad de pacientes adultos (rango 18-90 años), β₀ representaría el valor predicho de Y para edad = 0, una extrapolación fuera del rango de datos y sin significado clínico real. β₀ es un parámetro matemático necesario para definir la recta, no siempre una cantidad interpretable por sí misma.
18.3. Estimación por mínimos cuadrados
Los parámetros β₀ y β₁ del modelo poblacional son desconocidos y se estiman a partir de la muestra, obteniendo b₀ y b₁ (o, en otra notación habitual, β̂₀ y β̂₁). El método estándar de estimación es el de mínimos cuadrados ordinarios.
Método de mínimos cuadrados: procedimiento de estimación que encuentra la recta que minimiza la suma de los cuadrados de los residuos, es decir, de las distancias verticales entre cada valor observado de Y y el valor predicho por la recta para ese mismo X.
Un estudio modela el colesterol LDL (Y) en función de la edad (X) en 50 pacientes. El ajuste por mínimos cuadrados da b₁ = 1,2 y b₀ = 60.
La interpretación: por cada año adicional de edad, el LDL aumenta en promedio 1,2 mg/dL. Para un paciente de 50 años, la predicción puntual sería: LDL = 60 + 1,2×50 = 120 mg/dL.
18.4. Contraste de hipótesis sobre la pendiente
La pregunta clave de inferencia en regresión es: ¿la pendiente estimada b₁ es lo suficientemente distinta de cero como para concluir que existe una relación lineal real entre X e Y en la población? Se contrasta H0: β₁ = 0 frente a H1: β₁ ≠ 0.
Si β₁ = 0, la recta sería horizontal y el valor de X no aportaría ninguna información sobre Y. Rechazar H0: β₁ = 0 es, en la práctica, equivalente a concluir que existe una asociación lineal significativa, exactamente la misma conclusión que rechazar H0: ρ = 0 en el contraste de correlación de T17. De hecho, en regresión lineal simple, ambos contrastes son matemáticamente equivalentes y dan el mismo valor p.
El estadístico de contraste sigue una distribución t con n−2 grados de libertad, análoga en estructura a los contrastes ya vistos en el tema 11 y el tema 13: la estimación dividida entre su error típico.
Un coeficiente b₁ estadísticamente significativo (p < 0,05) no garantiza que la magnitud del efecto sea clínicamente relevante, exactamente la misma distinción entre significación estadística y relevancia clínica vista en T10. Con muestras muy grandes, pendientes muy pequeñas pueden alcanzar significación estadística sin tener importancia práctica.
18.5. Bondad del ajuste: coeficiente de determinación
El coeficiente de determinación (r²) cuantifica qué proporción de la variabilidad total de Y es explicada por el modelo de regresión.
El r² de la regresión lineal simple es exactamente el cuadrado del coeficiente de Pearson visto en el Tema 17 · Correlación de Pearson y Spearman.
Ambos describen la misma idea, la correlación describiéndola como fuerza de asociación, aunque la regresión la describe como una proporción de varianza explicada por el modelo predictivo.
| Valor de r² | Interpretación |
|---|---|
| r² = 0 | El modelo no explica nada de la variabilidad de Y |
| r² = 0,50 | El 50% de la variabilidad de Y es explicada por su relación lineal con X |
| r² = 1 | El modelo explica el 100% de la variabilidad: ajuste perfecto, todos los puntos sobre la recta |
18.6. Predicción puntual y por intervalos
Una vez ajustado el modelo, se puede usar para predecir el valor de Y para un valor concreto de X. Existen dos tipos de predicción, con interpretaciones distintas.
| Tipo | Qué estima | Amplitud |
|---|---|---|
| Intervalo de confianza para la media | El valor medio de Y para todos los individuos con ese X | Más estrecho |
| Intervalo de predicción | El valor de Y para un individuo concreto con ese X | Más ancho |
El intervalo de predicción para un individuo concreto es siempre más ancho que el intervalo de confianza para la media, porque incorpora dos fuentes de incertidumbre: 1) la incertidumbre sobre dónde está la recta poblacional real (igual que en el intervalo de confianza) y 2) la variabilidad individual de cada observación alrededor de esa recta (ε). Confundir ambos intervalos lleva a comunicar una precisión de predicción individual mayor de la que realmente existe.
Un modelo predice el LDL medio para pacientes de 50 años con un intervalo de confianza de 115-125 mg/dL. Pero el intervalo de predicción para un paciente concreto de 50 años sería bastante más amplio, por ejemplo 80-160 mg/dL, porque cada individuo tiene su propia variabilidad biológica no capturada por la edad sola. El primer intervalo informa sobre el grupo; el segundo, sobre un único paciente.
Extrapolar el modelo fuera del rango de valores de X observados en la muestra es metodológicamente arriesgado. Si el estudio incluyó pacientes de 20 a 70 años, predecir el LDL para un paciente de 5 años usando la misma recta asume que la relación lineal se mantiene fuera del rango estudiado, algo que no está garantizado y que puede producir predicciones absurdas o clínicamente erróneas.
18.7. Análisis de residuos
Aunque el desarrollo formal del diagnóstico de residuos excede el alcance de este tema, conviene anticipar que la validez de todo lo anterior (contrastes, intervalos, predicciones) depende de que se cumplan ciertos supuestos sobre el término de error ε:
- Que tenga media cero.
- Que su varianza sea constante (homocedasticidad).
- Que la distribución sea aproximadamente Normal.
Estos supuestos se verifican habitualmente mediante gráficos de residuos frente a valores predichos.
El modelo de regresión lineal simple se extiende de forma natural a más de una variable independiente en T19 · Regresión lineal múltiple, donde se incorpora el análisis de residuos con mayor profundidad y se introduce el problema de la selección de variables.