20.1. La regresión logística
Los modelos de regresión lineal asumen que la variable dependiente Y puede tomar cualquier valor en un rango continuo. Cuando Y es binaria (0 = no evento, 1 = evento), aplicar el modelo lineal directamente produce dos problemas graves.
- El modelo lineal puede predecir valores de Y fuera del rango [0,1], lo que carece de sentido cuando Y representa una probabilidad.
- Los supuestos del modelo lineal (normalidad y homocedasticidad de los residuos) no se cumplen con variables binarias, invalidando los contrastes de hipótesis y los intervalos de confianza.
Regresión logística: modelo de regresión para variables dependientes binarias que modela el logaritmo del odds del evento (logit) como función lineal de las variables independientes, garantizando que las probabilidades predichas siempre estén en el rango [0,1].
20.2. La función logística y el logit
La clave del modelo es la función logística (también llamada función sigmoide), que transforma cualquier valor real en una probabilidad entre 0 y 1:
La función tiene forma de S (sigmoide). Parte cerca de 0 para valores muy negativos del predictor lineal, sube rápidamente alrededor de 0, y se aproxima asintóticamente a 1 para valores muy positivos.
La transformación inversa, el logit, convierte la probabilidad en el predictor lineal:
20.3. Estimación: máxima verosimilitud
A diferencia de la regresión lineal, donde los coeficientes se estiman por mínimos cuadrados (minimizando la suma de residuos al cuadrado), en regresión logística se usa el método de máxima verosimilitud.
Máxima verosimilitud: método de estimación que encuentra los valores de los coeficientes que hacen máxima la probabilidad (verosimilitud) de haber observado los datos que se tienen. En regresión logística, busca los β que maximizan la probabilidad conjunta de que los casos observados como eventos sean clasificados como eventos y los no eventos como no eventos.
La estimación por máxima verosimilitud no tiene solución cerrada (no hay fórmulas directas como en mínimos cuadrados).
Se obtiene mediante algoritmos iterativos. En la práctica esto es transparente para el usuario porque lo gestiona el software estadístico, pero explica por qué la regresión logística requiere más datos que la lineal para converger de forma estable.
20.4. Interpretación de los coeficientes: odds ratios ajustados
El coeficiente β de cada variable independiente en el modelo logístico mide el cambio en el logit por unidad de aumento en esa variable. Esta interpretación directa no es intuitiva, pero se transforma fácilmente calculando el exponencial:
La interpretación es la misma que el OR del tema 16, pero ahora ajustado por todas las variables incluidas en el modelo:
| Valor de OR ajustado | Interpretación |
|---|---|
| OR = 1 | La variable no se asocia con el evento, ajustando por las demás |
| OR > 1 | Factor de riesgo: mayor odds del evento en el grupo expuesto, ajustado |
| OR < 1 | Factor protector: menor odds del evento en el grupo expuesto, ajustado |
Un modelo logístico predice la presencia de diabetes tipo 2 (Y=1) en función de la edad (X₁), el IMC (X₂) y el sedentarismo (X₃). Si β₂ = 0,15 para el IMC, el OR ajustado es e⁰·¹⁵ ≈ 1,16: por cada unidad de aumento en el IMC, el odds de tener diabetes aumenta un 16%, manteniendo constantes la edad y el nivel de actividad física.
Este es el efecto del IMC ajustado por las demás variables, no el efecto bruto del IMC solo.
El OR ajustado de la regresión logística y el OR crudo de la tabla 2×2 del tema 16 no son iguales en general. El crudo mide la asociación sin controlar nada; el ajustado controla el efecto de todas las variables del modelo. Cuando hay variables de confusión importantes, la diferencia entre ambos puede ser sustancial, y el ajustado es el que interesa clínicamente.
20.5. Bondad del ajuste
El R² de la regresión lineal no es directamente aplicable a la regresión logística. Existen varios indicadores alternativos:
| Indicador | Qué mide | Interpretación |
|---|---|---|
| Test de Hosmer-Lemeshow | Si las probabilidades predichas se ajustan bien a las observadas | p > 0,05 indica buen ajuste (H0: el modelo se ajusta bien) |
| AIC (criterio de Akaike) | Compromiso entre bondad de ajuste y complejidad del modelo | Menor AIC indica mejor modelo; útil para comparar modelos |
| C-statistic (AUC-ROC) | Capacidad discriminativa del modelo | Misma interpretación que el AUC de T7: > 0,8 indica buena discriminación |
| R² de Nagelkerke | Pseudo-R²: aproximación al concepto de varianza explicada | Oscila entre 0 y 1, pero no tiene la misma interpretación que el R² lineal |
La C-statistic (AUC de la curva ROC del modelo) es el indicador de bondad de ajuste más usado en la práctica clínica para modelos de predicción, porque responde directamente a la pregunta más relevante: ¿es capaz este modelo de discriminar entre los pacientes que tendrán el evento y los que no? Es exactamente el mismo concepto visto en T7 aplicado ahora al modelo logístico completo.
20.6. Selección de variables y tamaño muestral
- La regla de 10-20 observaciones por variable hace referencia específicamente al número de eventos (casos Y=1), no al tamaño muestral total.
En un estudio con 500 pacientes pero solo 30 eventos (por ejemplo, 30 infartos), el número efectivo de observaciones para ajustar el modelo no es 500 sino 30. Con ese número de eventos, incluir más de 1-3 variables independientes produce sobreajuste. Esta restricción es especialmente relevante en estudios de enfermedades raras o eventos poco frecuentes, donde el número de casos puede ser muy pequeño aunque el tamaño muestral total sea grande.
La regresión logística es el modelo de referencia para variables dependientes binarias en estudios transversales y de casos y controles. Cuando la variable de resultado es el tiempo hasta un evento (supervivencia, recidiva, muerte), el modelo adecuado es la regresión de Cox, que extiende la lógica de la regresión logística al contexto del análisis de supervivencia desarrollado en el Tema 21 · Análisis de supervivencia: Kaplan-Meier y test log-rank.