Apartados del tema


Índice del tema

TEMA 19

Regresión lineal múltiple: modelo, ajuste, residuos y selección de variables

Dificultad: Alta
Lectura: 18~22 min
Estudio: 1,8~2 horas
Autor y revisión médica: Dr. Vicente Molina

·

Actualizado: 3 de julio de 2026

Resumen

La regresión lineal múltiple extiende el modelo simple visto en el tema 18 a situaciones donde la variable dependiente Y depende de varias variables independientes simultáneamente.

Permite ajustar por variables de confusión, estimar el efecto de cada predictor manteniendo los demás constantes, y construir modelos predictivos más precisos.

El análisis de residuos verifica que se cumplen los supuestos del modelo; la selección de variables evita sobreajustar el modelo a los datos de la muestra.

Ideas clave

  1. El coeficiente de cada variable independiente en regresión múltiple se interpreta como el efecto de esa variable sobre Y manteniendo constantes todas las demás: es un efecto ajustado, no bruto.
  2. R² siempre aumenta o se mantiene igual al añadir variables al modelo, aunque estas no aporten información real. El R² ajustado penaliza la complejidad del modelo y es la medida de bondad de ajuste adecuada cuando se comparan modelos con distinto número de predictores.
  3. Los residuos del modelo deben ser aleatorios, con media cero, varianza constante y distribución aproximadamente Normal. Si no lo son, el modelo tiene problemas estructurales que invalidan las inferencias.
  4. La multicolinealidad ocurre cuando dos o más variables independientes están muy correlacionadas entre sí: los coeficientes individuales se vuelven inestables y difíciles de interpretar, aunque el modelo global puede seguir siendo predictivo.
  5. Un modelo con demasiadas variables respecto al tamaño muestral se ajusta bien a los datos de la muestra pero predice mal en datos nuevos: esto es el sobreajuste, y la selección de variables intenta evitarlo.

Errores frecuentes

  1. Error: interpretar los coeficientes de la regresión múltiple como si fueran efectos independientes. Corrección: cada uno es un efecto ajustado por las demás variables del modelo.
  2. Error: usar R² simple (no ajustado) para comparar modelos con distinto número de variables. Corrección: R² ajustado o criterios como AIC/BIC son más adecuados.
  3. Error: no verificar los supuestos del modelo (homocedasticidad, normalidad de residuos, independencia) antes de interpretar los coeficientes y los intervalos de confianza.
  4. Error: incluir variables en el modelo solo porque son estadísticamente significativas en análisis univariante, sin considerar la correlación entre ellas (multicolinealidad) ni el tamaño muestral disponible.

19.1. Introducción a la regresión múltiple

El modelo de regresión simple solo incluye una variable independiente X. En la práctica clínica, el valor de una variable de resultado casi nunca depende de un único factor. Por ejemplo, la presión arterial depende del peso, la edad, el consumo de sal y el sedentarismo simultáneamente.

La regresión lineal múltiple permite modelar esa realidad más compleja incluyendo varias variables independientes en un mismo modelo.

Definición

Regresión lineal múltiple: extensión del modelo lineal simple que incluye k variables independientes (X₁, X₂, ..., Xₖ) para explicar la variabilidad de una variable dependiente Y, estimando el efecto de cada predictor de forma simultánea y ajustada por los demás.

La ventaja fundamental respecto a hacer regresiones simples separadas para cada predictor es que el modelo múltiple estima el efecto de cada variable manteniendo constantes las demás, lo que permite controlar el efecto de variables de confusión, exactamente lo que no puede hacer la correlación ni la regresión simple.

19.2. El modelo de regresión lineal múltiple

Cada coeficiente βⱼ se denomina coeficiente de regresión parcial y mide el cambio promedio en Y por cada unidad que aumenta Xⱼ, manteniendo constantes todas las demás variables del modelo.

MODELO DE REGRESIÓN LINEAL MÚLTIPLE Y = β₀ + β₁X₁ + β₂X₂ + ... + βₖXₖ + ε β₀ = intercepto · β₁...βₖ = coeficientes de regresión parcial · ε = error
Relevancia clínica

Un modelo predice la presión arterial sistólica (Y) a partir de la edad (X₁), el IMC (X₂) y el consumo de sal (X₃). Si β₁ = 0,8, significa que por cada año adicional de edad la presión sube en promedio 0,8 mmHg, manteniendo constantes el IMC y el consumo de sal. No es el efecto bruto de la edad: es el efecto de la edad una vez eliminada la contribución del IMC y la sal.

Las variables independientes pueden ser cuantitativas continuas o variables indicadoras (dummy) para categorías cualitativas. Una variable cualitativa con k categorías se codifica con k−1 variables dummy, tomando una categoría como referencia.

19.3. Bondad del ajuste: R² y R² ajustado

En regresión múltiple, la bondad del ajuste se mide con el coeficiente de determinación múltiple R², que tiene la misma interpretación que en regresión simple: proporción de la variabilidad de Y explicada por el modelo.

Error frecuente

R² nunca disminuye al añadir variables al modelo, aunque estas sean irrelevantes. Añadir una variable al azar casi siempre sube R² ligeramente, aunque no aporte información real. Por eso, comparar modelos con distinto número de variables usando R² simple favorece siempre al modelo más complejo, independientemente de si la complejidad está justificada.

La solución es el R² ajustado, que penaliza la incorporación de variables adicionales según el tamaño muestral:

R² AJUSTADO R²aj = 1 − (1 − R²) · (n − 1) n − k − 1 n = tamaño muestral · k = número de variables independientes

El R² ajustado puede disminuir al añadir variables que no aportan información suficiente para compensar la penalización por complejidad, lo que lo convierte en una guía más honesta de la bondad del ajuste en modelos múltiples.

19.4. Contraste global del modelo: tabla ANOVA

El contraste global del modelo evalúa si el conjunto de variables independientes, tomado en bloque, explica una proporción significativa de la variabilidad de Y. Su hipótesis nula es que todos los coeficientes de regresión son simultáneamente cero: H0: β₁ = β₂ = … = βₖ = 0.

Idea clave

La tabla ANOVA de la regresión múltiple tiene la misma estructura que la vista en el tema 14: descompone la variabilidad total de Y en variabilidad explicada por el modelo (SCR, suma de cuadrados de regresión) y variabilidad residual no explicada (SCE, suma de cuadrados del error).

El estadístico F es el cociente entre ambas medias cuadráticas y sigue una distribución F con k y n−k−1 grados de libertad.

Un p valor significativo en el contraste global indica que el modelo en su conjunto es útil, pero no dice cuáles de las variables individuales son significativas. Para eso se usan los contrastes individuales sobre cada βⱼ, que siguen distribuciones t con n−k−1 grados de libertad.

19.5. Análisis de residuos

Los residuos (eᵢ = yᵢ − ŷᵢ, diferencia entre el valor observado y el predicho por el modelo) son la herramienta principal para verificar que se cumplen los supuestos del modelo.

Tabla 19.1. Supuestos de la regresión lineal múltiple
Supuesto Cómo verificarlo Señal de problema
Linealidad Gráfico residuos vs. valores predichos Patrón curvilíneo en los residuos
Homocedasticidad (varianza constante) Gráfico residuos vs. valores predichos Los residuos se dispersan más (o menos) al aumentar los valores predichos
Normalidad de los residuos Histograma de residuos o gráfico Q-Q Cola larga, asimetría marcada o puntos alejados de la diagonal en Q-Q
Independencia Diseño del estudio; test de Durbin-Watson en datos temporales Correlación entre residuos consecutivos (datos en serie temporal)
Nota

Los gráficos de residuos son de diagnóstico: no dan un valor p para rechazar o no rechazar un supuesto, sino que exigen interpretación visual. La práctica con ejemplos reales es imprescindible para desarrollar el criterio necesario. En la práctica clínica, estos gráficos los genera el software estadístico automáticamente; lo importante es saber interpretarlos.

19.6. Multicolinealidad

La multicolinealidad ocurre cuando dos o más variables independientes del modelo están fuertemente correlacionadas entre sí.

Definición

Multicolinealidad: situación en la que dos o más variables independientes de un modelo de regresión están altamente correlacionadas entre sí, lo que dificulta estimar con precisión el efecto individual de cada una sobre Y.

Error frecuente

La multicolinealidad no impide que el modelo prediga bien en el rango de los datos observados, pero sí hace que los coeficientes individuales sean inestables. Pequeños cambios en los datos producen grandes cambios en los coeficientes estimados, y los errores típicos de los coeficientes se inflan, reduciendo la potencia de los contrastes individuales. Se detecta habitualmente mediante el factor de inflación de la varianza (VIF). Valores de VIF mayores que 10 indican multicolinealidad problemática.

19.7. Selección de variables

Incluir demasiadas variables en un modelo con una muestra pequeña produce sobreajuste: el modelo se adapta perfectamente a los datos con los que se construyó pero predice mal en datos nuevos. La regla empírica habitual es disponer de al menos 10-20 observaciones por variable incluida en el modelo.

Los métodos más usados de selección de variables son:

Tabla 19.2. Métodos de selección de variables
Método Descripción Limitación principal
Stepwise hacia adelante Se parte de ninguna variable y se añaden una a una las que mejoran el modelo Puede no encontrar el mejor subconjunto de variables
Stepwise hacia atrás Se parte del modelo completo y se eliminan las variables menos significativas Computacionalmente más costoso con muchas variables
Stepwise mixto Combina los dos anteriores: puede añadir y eliminar variables en cada paso El modelo final depende del orden de entrada/salida de las variables
Criterios de información (AIC, BIC) Selecciona el modelo que minimiza un criterio que penaliza la complejidad Requiere comparar todos los modelos posibles (inviable con muchas variables)
Error frecuente

Los métodos stepwise automatizados tienen una limitación importante. El modelo final depende del orden en que se añaden o eliminan variables y no garantiza encontrar el mejor subconjunto posible. Además, realizar muchos contrastes de hipótesis durante la selección infla el error de tipo I. En investigación clínica, la selección de variables debería estar guiada principalmente por la plausibilidad clínica y biológica, no solo por la significación estadística.

Relación con otro tema

Cuando la variable dependiente Y es binaria (enfermedad sí/no, evento sí/no) en lugar de continua, el modelo lineal deja de ser apropiado y se necesita la regresión logística, que se desarrolla en el Tema 20 · Regresión logística.

Dr. Vicente Molina Nácher
Autor y revisión médica

Dr. Vicente Molina

Licenciado en Medicina
Especialista en Angiología y Cirugía Vascular

Editor y revisor de contenidos en Apuntes de Medicina.

Ver perfil del autor

Herramientas

Banco de preguntas — Próximamente