Apartados del tema


Índice del tema

TEMA 20

Regresión logística: modelo, interpretación y odds ratios ajustados

Dificultad: Alta
Lectura: 18~22 min
Estudio: 1,8~2 horas
Autor y revisión médica: Dr. Vicente Molina

·

Actualizado: 3 de julio de 2026

Resumen

Cuando la variable dependiente es binaria (enfermedad sí/no, evento sí/no), el modelo lineal no es apropiado: puede predecir probabilidades fuera del rango [0,1] y sus supuestos no se cumplen.

La regresión logística resuelve este problema modelando directamente la probabilidad del evento mediante la función logística, que garantiza predicciones entre 0 y 1.

Los coeficientes del modelo se interpretan como logaritmos de odds ratios ajustados, lo que conecta directamente con las medidas de asociación del tema 16 en un contexto multivariante.

Ideas clave

  1. La regresión logística no predice directamente la probabilidad del evento: modela el logit (logaritmo del odds), que puede tomar cualquier valor real, y después lo transforma a probabilidad mediante la función logística.
  2. El exponencial de cada coeficiente (eᵝ) es el odds ratio ajustado para esa variable: la magnitud del efecto de ese predictor sobre el odds del evento, manteniendo constantes todos los demás.
  3. A diferencia de la regresión lineal, los coeficientes de la regresión logística se estiman por máxima verosimilitud, no por mínimos cuadrados.
  4. La bondad del ajuste no se evalúa con R²: se usan el estadístico de Hosmer-Lemeshow, el AIC, o la curva ROC (C-statistic), que mide la capacidad discriminativa del modelo.
  5. La regresión logística produce odds ratios ajustados por todas las variables del modelo, lo que permite controlar el efecto de variables de confusión simultáneamente.

Errores frecuentes

  1. Error: interpretar el coeficiente β de la regresión logística directamente como el cambio en la probabilidad del evento. Corrección: β es el cambio en el logit, no en la probabilidad. Para obtener el OR hay que calcular eᵝ.
  2. Error: confundir el OR ajustado de la regresión logística con el OR crudo de la tabla 2×2 de T16. Corrección: el OR ajustado controla el efecto de las demás variables del modelo; el crudo no.
  3. Error: aplicar regresión logística con muestras pequeñas para el número de predictores incluidos, ignorando que la regla empírica de 10-20 eventos por variable es si cabe más estricta que en regresión lineal.
  4. Error: omitir los intervalos de confianza del OR ajustado y reportar solo el valor puntual, perdiendo información sobre la precisión de la estimación.

20.1. La regresión logística

Los modelos de regresión lineal asumen que la variable dependiente Y puede tomar cualquier valor en un rango continuo. Cuando Y es binaria (0 = no evento, 1 = evento), aplicar el modelo lineal directamente produce dos problemas graves.

  1. El modelo lineal puede predecir valores de Y fuera del rango [0,1], lo que carece de sentido cuando Y representa una probabilidad.
  2. Los supuestos del modelo lineal (normalidad y homocedasticidad de los residuos) no se cumplen con variables binarias, invalidando los contrastes de hipótesis y los intervalos de confianza.

Definición

Regresión logística: modelo de regresión para variables dependientes binarias que modela el logaritmo del odds del evento (logit) como función lineal de las variables independientes, garantizando que las probabilidades predichas siempre estén en el rango [0,1].

20.2. La función logística y el logit

La clave del modelo es la función logística (también llamada función sigmoide), que transforma cualquier valor real en una probabilidad entre 0 y 1:

FUNCIÓN LOGÍSTICA P(Y=1) = 1 1 + e⁻⁽β₀ ⁺ β₁X₁ ⁺ ··· ⁺ βₖXₖ⁾ Siempre produce valores entre 0 y 1, sea cual sea el valor del predictor lineal

La función tiene forma de S (sigmoide). Parte cerca de 0 para valores muy negativos del predictor lineal, sube rápidamente alrededor de 0, y se aproxima asintóticamente a 1 para valores muy positivos.

0 0,5 1 0 P = 0,5 cuando predictor = 0 Predictor lineal (β₀ + β₁X₁ + ... + βₖXₖ) P(Y=1)

La transformación inversa, el logit, convierte la probabilidad en el predictor lineal:

LOGIT (función de enlace) logit(p) = ln(p / (1−p)) = β₀ + β₁X₁ + ... + βₖXₖ ln(p/(1−p)) = logaritmo natural del odds del evento

20.3. Estimación: máxima verosimilitud

A diferencia de la regresión lineal, donde los coeficientes se estiman por mínimos cuadrados (minimizando la suma de residuos al cuadrado), en regresión logística se usa el método de máxima verosimilitud.

Definición

Máxima verosimilitud: método de estimación que encuentra los valores de los coeficientes que hacen máxima la probabilidad (verosimilitud) de haber observado los datos que se tienen. En regresión logística, busca los β que maximizan la probabilidad conjunta de que los casos observados como eventos sean clasificados como eventos y los no eventos como no eventos.

Nota

La estimación por máxima verosimilitud no tiene solución cerrada (no hay fórmulas directas como en mínimos cuadrados).

Se obtiene mediante algoritmos iterativos. En la práctica esto es transparente para el usuario porque lo gestiona el software estadístico, pero explica por qué la regresión logística requiere más datos que la lineal para converger de forma estable.

20.4. Interpretación de los coeficientes: odds ratios ajustados

El coeficiente β de cada variable independiente en el modelo logístico mide el cambio en el logit por unidad de aumento en esa variable. Esta interpretación directa no es intuitiva, pero se transforma fácilmente calculando el exponencial:

ODDS RATIO AJUSTADO OR ajustado = eᵝ Manteniendo constantes todas las demás variables del modelo

La interpretación es la misma que el OR del tema 16, pero ahora ajustado por todas las variables incluidas en el modelo:

Tabla 20.1. Interpretación del OR ajustado
Valor de OR ajustado Interpretación
OR = 1 La variable no se asocia con el evento, ajustando por las demás
OR > 1 Factor de riesgo: mayor odds del evento en el grupo expuesto, ajustado
OR < 1 Factor protector: menor odds del evento en el grupo expuesto, ajustado
Relevancia clínica

Un modelo logístico predice la presencia de diabetes tipo 2 (Y=1) en función de la edad (X₁), el IMC (X₂) y el sedentarismo (X₃). Si β₂ = 0,15 para el IMC, el OR ajustado es e⁰·¹⁵ ≈ 1,16: por cada unidad de aumento en el IMC, el odds de tener diabetes aumenta un 16%, manteniendo constantes la edad y el nivel de actividad física.

Este es el efecto del IMC ajustado por las demás variables, no el efecto bruto del IMC solo.

Error frecuente

El OR ajustado de la regresión logística y el OR crudo de la tabla 2×2 del tema 16 no son iguales en general. El crudo mide la asociación sin controlar nada; el ajustado controla el efecto de todas las variables del modelo. Cuando hay variables de confusión importantes, la diferencia entre ambos puede ser sustancial, y el ajustado es el que interesa clínicamente.

20.5. Bondad del ajuste

El R² de la regresión lineal no es directamente aplicable a la regresión logística. Existen varios indicadores alternativos:

Tabla 20.2. Indicadores de bondad de ajuste del modelo logístico
Indicador Qué mide Interpretación
Test de Hosmer-Lemeshow Si las probabilidades predichas se ajustan bien a las observadas p > 0,05 indica buen ajuste (H0: el modelo se ajusta bien)
AIC (criterio de Akaike) Compromiso entre bondad de ajuste y complejidad del modelo Menor AIC indica mejor modelo; útil para comparar modelos
C-statistic (AUC-ROC) Capacidad discriminativa del modelo Misma interpretación que el AUC de T7: > 0,8 indica buena discriminación
R² de Nagelkerke Pseudo-R²: aproximación al concepto de varianza explicada Oscila entre 0 y 1, pero no tiene la misma interpretación que el R² lineal
Idea clave

La C-statistic (AUC de la curva ROC del modelo) es el indicador de bondad de ajuste más usado en la práctica clínica para modelos de predicción, porque responde directamente a la pregunta más relevante: ¿es capaz este modelo de discriminar entre los pacientes que tendrán el evento y los que no? Es exactamente el mismo concepto visto en T7 aplicado ahora al modelo logístico completo.

20.6. Selección de variables y tamaño muestral

Las mismas consideraciones del tema 19 sobre selección de variables y sobreajuste se aplican a la regresión logística, con una restricción adicional:
  • La regla de 10-20 observaciones por variable hace referencia específicamente al número de eventos (casos Y=1), no al tamaño muestral total.
Error frecuente

En un estudio con 500 pacientes pero solo 30 eventos (por ejemplo, 30 infartos), el número efectivo de observaciones para ajustar el modelo no es 500 sino 30. Con ese número de eventos, incluir más de 1-3 variables independientes produce sobreajuste. Esta restricción es especialmente relevante en estudios de enfermedades raras o eventos poco frecuentes, donde el número de casos puede ser muy pequeño aunque el tamaño muestral total sea grande.

Relación con otro tema

La regresión logística es el modelo de referencia para variables dependientes binarias en estudios transversales y de casos y controles. Cuando la variable de resultado es el tiempo hasta un evento (supervivencia, recidiva, muerte), el modelo adecuado es la regresión de Cox, que extiende la lógica de la regresión logística al contexto del análisis de supervivencia desarrollado en el Tema 21 · Análisis de supervivencia: Kaplan-Meier y test log-rank.

Dr. Vicente Molina Nácher
Autor y revisión médica

Dr. Vicente Molina

Licenciado en Medicina
Especialista en Angiología y Cirugía Vascular

Editor y revisor de contenidos en Apuntes de Medicina.

Ver perfil del autor

Herramientas

Banco de preguntas — Próximamente