19.1. Introducción a la regresión múltiple
El modelo de regresión simple solo incluye una variable independiente X. En la práctica clínica, el valor de una variable de resultado casi nunca depende de un único factor. Por ejemplo, la presión arterial depende del peso, la edad, el consumo de sal y el sedentarismo simultáneamente.
La regresión lineal múltiple permite modelar esa realidad más compleja incluyendo varias variables independientes en un mismo modelo.
Regresión lineal múltiple: extensión del modelo lineal simple que incluye k variables independientes (X₁, X₂, ..., Xₖ) para explicar la variabilidad de una variable dependiente Y, estimando el efecto de cada predictor de forma simultánea y ajustada por los demás.
La ventaja fundamental respecto a hacer regresiones simples separadas para cada predictor es que el modelo múltiple estima el efecto de cada variable manteniendo constantes las demás, lo que permite controlar el efecto de variables de confusión, exactamente lo que no puede hacer la correlación ni la regresión simple.
19.2. El modelo de regresión lineal múltiple
Cada coeficiente βⱼ se denomina coeficiente de regresión parcial y mide el cambio promedio en Y por cada unidad que aumenta Xⱼ, manteniendo constantes todas las demás variables del modelo.
Un modelo predice la presión arterial sistólica (Y) a partir de la edad (X₁), el IMC (X₂) y el consumo de sal (X₃). Si β₁ = 0,8, significa que por cada año adicional de edad la presión sube en promedio 0,8 mmHg, manteniendo constantes el IMC y el consumo de sal. No es el efecto bruto de la edad: es el efecto de la edad una vez eliminada la contribución del IMC y la sal.
Las variables independientes pueden ser cuantitativas continuas o variables indicadoras (dummy) para categorías cualitativas. Una variable cualitativa con k categorías se codifica con k−1 variables dummy, tomando una categoría como referencia.
19.3. Bondad del ajuste: R² y R² ajustado
En regresión múltiple, la bondad del ajuste se mide con el coeficiente de determinación múltiple R², que tiene la misma interpretación que en regresión simple: proporción de la variabilidad de Y explicada por el modelo.
R² nunca disminuye al añadir variables al modelo, aunque estas sean irrelevantes. Añadir una variable al azar casi siempre sube R² ligeramente, aunque no aporte información real. Por eso, comparar modelos con distinto número de variables usando R² simple favorece siempre al modelo más complejo, independientemente de si la complejidad está justificada.
La solución es el R² ajustado, que penaliza la incorporación de variables adicionales según el tamaño muestral:
El R² ajustado puede disminuir al añadir variables que no aportan información suficiente para compensar la penalización por complejidad, lo que lo convierte en una guía más honesta de la bondad del ajuste en modelos múltiples.
19.4. Contraste global del modelo: tabla ANOVA
El contraste global del modelo evalúa si el conjunto de variables independientes, tomado en bloque, explica una proporción significativa de la variabilidad de Y. Su hipótesis nula es que todos los coeficientes de regresión son simultáneamente cero: H0: β₁ = β₂ = … = βₖ = 0.
La tabla ANOVA de la regresión múltiple tiene la misma estructura que la vista en el tema 14: descompone la variabilidad total de Y en variabilidad explicada por el modelo (SCR, suma de cuadrados de regresión) y variabilidad residual no explicada (SCE, suma de cuadrados del error).
El estadístico F es el cociente entre ambas medias cuadráticas y sigue una distribución F con k y n−k−1 grados de libertad.
Un p valor significativo en el contraste global indica que el modelo en su conjunto es útil, pero no dice cuáles de las variables individuales son significativas. Para eso se usan los contrastes individuales sobre cada βⱼ, que siguen distribuciones t con n−k−1 grados de libertad.
19.5. Análisis de residuos
Los residuos (eᵢ = yᵢ − ŷᵢ, diferencia entre el valor observado y el predicho por el modelo) son la herramienta principal para verificar que se cumplen los supuestos del modelo.
| Supuesto | Cómo verificarlo | Señal de problema |
|---|---|---|
| Linealidad | Gráfico residuos vs. valores predichos | Patrón curvilíneo en los residuos |
| Homocedasticidad (varianza constante) | Gráfico residuos vs. valores predichos | Los residuos se dispersan más (o menos) al aumentar los valores predichos |
| Normalidad de los residuos | Histograma de residuos o gráfico Q-Q | Cola larga, asimetría marcada o puntos alejados de la diagonal en Q-Q |
| Independencia | Diseño del estudio; test de Durbin-Watson en datos temporales | Correlación entre residuos consecutivos (datos en serie temporal) |
Los gráficos de residuos son de diagnóstico: no dan un valor p para rechazar o no rechazar un supuesto, sino que exigen interpretación visual. La práctica con ejemplos reales es imprescindible para desarrollar el criterio necesario. En la práctica clínica, estos gráficos los genera el software estadístico automáticamente; lo importante es saber interpretarlos.
19.6. Multicolinealidad
La multicolinealidad ocurre cuando dos o más variables independientes del modelo están fuertemente correlacionadas entre sí.
Multicolinealidad: situación en la que dos o más variables independientes de un modelo de regresión están altamente correlacionadas entre sí, lo que dificulta estimar con precisión el efecto individual de cada una sobre Y.
La multicolinealidad no impide que el modelo prediga bien en el rango de los datos observados, pero sí hace que los coeficientes individuales sean inestables. Pequeños cambios en los datos producen grandes cambios en los coeficientes estimados, y los errores típicos de los coeficientes se inflan, reduciendo la potencia de los contrastes individuales. Se detecta habitualmente mediante el factor de inflación de la varianza (VIF). Valores de VIF mayores que 10 indican multicolinealidad problemática.
19.7. Selección de variables
Incluir demasiadas variables en un modelo con una muestra pequeña produce sobreajuste: el modelo se adapta perfectamente a los datos con los que se construyó pero predice mal en datos nuevos. La regla empírica habitual es disponer de al menos 10-20 observaciones por variable incluida en el modelo.
Los métodos más usados de selección de variables son:
| Método | Descripción | Limitación principal |
|---|---|---|
| Stepwise hacia adelante | Se parte de ninguna variable y se añaden una a una las que mejoran el modelo | Puede no encontrar el mejor subconjunto de variables |
| Stepwise hacia atrás | Se parte del modelo completo y se eliminan las variables menos significativas | Computacionalmente más costoso con muchas variables |
| Stepwise mixto | Combina los dos anteriores: puede añadir y eliminar variables en cada paso | El modelo final depende del orden de entrada/salida de las variables |
| Criterios de información (AIC, BIC) | Selecciona el modelo que minimiza un criterio que penaliza la complejidad | Requiere comparar todos los modelos posibles (inviable con muchas variables) |
Los métodos stepwise automatizados tienen una limitación importante. El modelo final depende del orden en que se añaden o eliminan variables y no garantiza encontrar el mejor subconjunto posible. Además, realizar muchos contrastes de hipótesis durante la selección infla el error de tipo I. En investigación clínica, la selección de variables debería estar guiada principalmente por la plausibilidad clínica y biológica, no solo por la significación estadística.
Cuando la variable dependiente Y es binaria (enfermedad sí/no, evento sí/no) en lugar de continua, el modelo lineal deja de ser apropiado y se necesita la regresión logística, que se desarrolla en el Tema 20 · Regresión logística.