Apartados del tema


Índice del tema

TEMA 18

Regresión lineal simple: modelo, estimación y predicción

Dificultad: Alta
Lectura: 18~22 min
Estudio: 1,5~1,8 horas
Autor y revisión médica: Dr. Vicente Molina

·

Actualizado: 3 de julio de 2026

Resumen

Mientras que la correlación describe si dos variables están asociadas, la regresión lineal construye un modelo matemático que permite predecir el valor de una variable a partir de la otra.

El modelo se ajusta mediante el método de mínimos cuadrados, que encuentra la recta que minimiza la distancia entre los valores observados y los predichos.

Los coeficientes del modelo, su significación estadística, la bondad del ajuste y la predicción con intervalos de confianza son las piezas que completan el análisis.

Ideas clave

  1. La regresión lineal asume una dirección de dependencia: una variable (independiente, X) se usa para predecir otra (dependiente, Y). Esto es conceptualmente distinto de la correlación, que es simétrica entre ambas variables.
  2. La recta de mínimos cuadrados es la que minimiza la suma de los cuadrados de los residuos (las distancias verticales entre cada punto observado y la recta).
  3. La pendiente (β₁) indica cuánto cambia Y, en promedio, por cada unidad que aumenta X. El intercepto (β₀) es el valor predicho de Y cuando X = 0, que no siempre tiene sentido clínico interpretable.
  4. El coeficiente de determinación r² del modelo de regresión simple es exactamente el cuadrado del coeficiente de Pearson de T17: ambos miden la misma idea desde ángulos distintos.
  5. Predecir fuera del rango de valores de X observados en la muestra (extrapolación) es metodológicamente arriesgado: el modelo no garantiza que la relación lineal se mantenga fuera de los datos con los que se ajustó.

Errores frecuentes

  1. Error: invertir el papel de las variables dependiente e independiente sin justificación, lo que cambia la recta de regresión obtenida (la recta de Y sobre X no es la misma que la de X sobre Y, salvo en el caso trivial de correlación perfecta).
  2. Error: interpretar el intercepto (β₀) como un valor clínicamente significativo cuando X = 0 no tiene sentido en el contexto del estudio (por ejemplo, edad = 0 en un modelo sobre adultos).
  3. Error: extrapolar predicciones fuera del rango de valores de X observados en la muestra, asumiendo que la relación lineal se mantiene indefinidamente.
  4. Error: confundir el intervalo de confianza para la media predicha con el intervalo de predicción para una observación individual: el segundo es siempre más ancho que el primero.

18.1. Introducción a la regresión lineal

La correlación responde a «¿están relacionadas X e Y?«. La regresión responde a una pregunta distinta y más ambiciosa: «dado un valor de X, ¿qué valor de Y se puede esperar?«. Para responderla hace falta construir un modelo matemático explícito, no solo un coeficiente que resuma la asociación.

Definición

Regresión lineal simple: modelo estadístico que describe la relación entre una variable dependiente Y (la que se quiere predecir) y una variable independiente X (la que se usa para predecir), asumiendo que esa relación es aproximadamente lineal.

A diferencia de la correlación, que es simétrica (r entre X e Y es el mismo que entre Y y X), la regresión es asimétrica. 

Esto requiere decidir cuál es la variable que se predice (dependiente) y cuál la que se usa para predecir (independiente). Esta decisión depende del diseño del estudio y de la pregunta de investigación, no es intercambiable.

Relevancia clínica

Si se quiere predecir el gasto calórico (Y) a partir del peso corporal (X), el peso es la variable independiente. Si en cambio se quisiera predecir el peso a partir del gasto calórico, los papeles se invertirían y la recta resultante, en general, no sería la misma recta despejada algebraicamente.

18.2. El modelo de regresión lineal simple

El modelo asume que la relación entre X e Y sigue la ecuación de una recta, con un término de error que recoge la variabilidad no explicada por el modelo:

MODELO DE REGRESIÓN LINEAL SIMPLE Y = β₀ + β₁X + ε β₀ = intercepto · β₁ = pendiente · ε = error aleatorio
Tabla 18.1. Elementos del modelo de regresión lineal simple
Elemento Significado
β₀ (intercepto) Valor predicho de Y cuando X = 0
β₁ (pendiente) Cambio promedio en Y por cada unidad que aumenta X
ε (error) Variabilidad de Y no explicada por su relación lineal con X
Error frecuente

El intercepto β₀ no siempre tiene sentido clínico interpretable. Si X es la edad de pacientes adultos (rango 18-90 años), β₀ representaría el valor predicho de Y para edad = 0, una extrapolación fuera del rango de datos y sin significado clínico real. β₀ es un parámetro matemático necesario para definir la recta, no siempre una cantidad interpretable por sí misma.

18.3. Estimación por mínimos cuadrados

Los parámetros β₀ y β₁ del modelo poblacional son desconocidos y se estiman a partir de la muestra, obteniendo b₀ y b₁ (o, en otra notación habitual, β̂₀ y β̂₁). El método estándar de estimación es el de mínimos cuadrados ordinarios.

Definición

Método de mínimos cuadrados: procedimiento de estimación que encuentra la recta que minimiza la suma de los cuadrados de los residuos, es decir, de las distancias verticales entre cada valor observado de Y y el valor predicho por la recta para ese mismo X.

Recta de mínimos cuadrados Residuos (distancias verticales)
Las fórmulas de estimación de los coeficientes se derivan directamente de la covarianza y la varianza vistas en el tema 2 y el tema 17:
ESTIMADORES DE MÍNIMOS CUADRADOS b₁ = S(xy) S(x)² b₀ = ȳ − b₁·x̄ S(xy) = covarianza de X e Y (T17) · S(x)² = varianza de X (T2) La recta siempre pasa por el punto (x̄, ȳ) Por eso b₀ se calcula despejando una vez conocida b₁
Relevancia clínica

Un estudio modela el colesterol LDL (Y) en función de la edad (X) en 50 pacientes. El ajuste por mínimos cuadrados da b₁ = 1,2 y b₀ = 60.

La interpretación: por cada año adicional de edad, el LDL aumenta en promedio 1,2 mg/dL. Para un paciente de 50 años, la predicción puntual sería: LDL = 60 + 1,2×50 = 120 mg/dL.

18.4. Contraste de hipótesis sobre la pendiente

La pregunta clave de inferencia en regresión es: ¿la pendiente estimada b₁ es lo suficientemente distinta de cero como para concluir que existe una relación lineal real entre X e Y en la población? Se contrasta H0: β₁ = 0 frente a H1: β₁ ≠ 0.

Idea clave

Si β₁ = 0, la recta sería horizontal y el valor de X no aportaría ninguna información sobre Y. Rechazar H0: β₁ = 0 es, en la práctica, equivalente a concluir que existe una asociación lineal significativa, exactamente la misma conclusión que rechazar H0: ρ = 0 en el contraste de correlación de T17. De hecho, en regresión lineal simple, ambos contrastes son matemáticamente equivalentes y dan el mismo valor p.

El estadístico de contraste sigue una distribución t con n−2 grados de libertad, análoga en estructura a los contrastes ya vistos en el tema 11 y el tema 13: la estimación dividida entre su error típico.

Error frecuente

Un coeficiente b₁ estadísticamente significativo (p < 0,05) no garantiza que la magnitud del efecto sea clínicamente relevante, exactamente la misma distinción entre significación estadística y relevancia clínica vista en T10. Con muestras muy grandes, pendientes muy pequeñas pueden alcanzar significación estadística sin tener importancia práctica.

18.5. Bondad del ajuste: coeficiente de determinación

El coeficiente de determinación (r²) cuantifica qué proporción de la variabilidad total de Y es explicada por el modelo de regresión.

Relación con otro tema

El r² de la regresión lineal simple es exactamente el cuadrado del coeficiente de Pearson visto en el Tema 17 · Correlación de Pearson y Spearman.

Ambos describen la misma idea, la correlación describiéndola como fuerza de asociación, aunque la regresión la describe como una proporción de varianza explicada por el modelo predictivo.

Tabla 18.2. Interpretación del coeficiente de determinación r²
Valor de r² Interpretación
r² = 0 El modelo no explica nada de la variabilidad de Y
r² = 0,50 El 50% de la variabilidad de Y es explicada por su relación lineal con X
r² = 1 El modelo explica el 100% de la variabilidad: ajuste perfecto, todos los puntos sobre la recta

18.6. Predicción puntual y por intervalos

Una vez ajustado el modelo, se puede usar para predecir el valor de Y para un valor concreto de X. Existen dos tipos de predicción, con interpretaciones distintas.

Tabla 18.3. Intervalo de confianza para la media vs intervalo de predicción
Tipo Qué estima Amplitud
Intervalo de confianza para la media El valor medio de Y para todos los individuos con ese X Más estrecho
Intervalo de predicción El valor de Y para un individuo concreto con ese X Más ancho
Error frecuente

El intervalo de predicción para un individuo concreto es siempre más ancho que el intervalo de confianza para la media, porque incorpora dos fuentes de incertidumbre: 1) la incertidumbre sobre dónde está la recta poblacional real (igual que en el intervalo de confianza) y 2) la variabilidad individual de cada observación alrededor de esa recta (ε). Confundir ambos intervalos lleva a comunicar una precisión de predicción individual mayor de la que realmente existe.

Relevancia clínica

Un modelo predice el LDL medio para pacientes de 50 años con un intervalo de confianza de 115-125 mg/dL. Pero el intervalo de predicción para un paciente concreto de 50 años sería bastante más amplio, por ejemplo 80-160 mg/dL, porque cada individuo tiene su propia variabilidad biológica no capturada por la edad sola. El primer intervalo informa sobre el grupo; el segundo, sobre un único paciente.

Error frecuente

Extrapolar el modelo fuera del rango de valores de X observados en la muestra es metodológicamente arriesgado. Si el estudio incluyó pacientes de 20 a 70 años, predecir el LDL para un paciente de 5 años usando la misma recta asume que la relación lineal se mantiene fuera del rango estudiado, algo que no está garantizado y que puede producir predicciones absurdas o clínicamente erróneas.

18.7. Análisis de residuos

Aunque el desarrollo formal del diagnóstico de residuos excede el alcance de este tema, conviene anticipar que la validez de todo lo anterior (contrastes, intervalos, predicciones) depende de que se cumplan ciertos supuestos sobre el término de error ε:

  1. Que tenga media cero.
  2. Que su varianza sea constante (homocedasticidad).
  3. Que la distribución sea aproximadamente Normal.

Estos supuestos se verifican habitualmente mediante gráficos de residuos frente a valores predichos.

Relación con otro tema

El modelo de regresión lineal simple se extiende de forma natural a más de una variable independiente en T19 · Regresión lineal múltiple, donde se incorpora el análisis de residuos con mayor profundidad y se introduce el problema de la selección de variables.

Dr. Vicente Molina Nácher
Autor y revisión médica

Dr. Vicente Molina

Licenciado en Medicina
Especialista en Angiología y Cirugía Vascular

Editor y revisor de contenidos en Apuntes de Medicina.

Ver perfil del autor

Herramientas

Banco de preguntas — Próximamente