Apartados del tema


Índice del tema

TEMA 13

Comparación de dos medias: muestras independientes y apareadas

Dificultad: Alta
Lectura: 20~22 min
Estudio: 1,5~2 horas
Autor y revisión médica: Dr. Vicente Molina

·

Actualizado: 3 de julio de 2026

Resumen

Comparar la media de dos grupos es una de las preguntas más frecuentes en investigación clínica: ¿es distinta la presión arterial entre tratados y controles? ¿Mejora un parámetro analítico tras una intervención? La respuesta exige elegir primero el diseño correcto: si los dos grupos son independientes (dos muestras distintas) o apareados (las mismas personas medidas en dos momentos, o pares de individuos emparejados). Esa elección determina el estadístico de contraste, el error típico y las condiciones de aplicabilidad, y tiene alternativas no paramétricas cuando no se cumplen los supuestos paramétricos.

Ideas clave

  1. La elección entre diseño independiente y apareado no es arbitraria: viene determinada por cómo se recogieron los datos. Aplicar el test equivocado invalida el análisis.
  2. El diseño apareado reduce la variabilidad debida a diferencias entre individuos, lo que habitualmente aumenta la potencia del contraste respecto al diseño independiente con el mismo número de observaciones.
  3. Antes de aplicar el test t para muestras independientes, hay que comprobar si las varianzas de los dos grupos son iguales (homocedásticas) o distintas (heterocedásticas): la fórmula del estadístico de contraste y los grados de libertad difieren según el caso.
  4. El test de Levene evalúa la igualdad de varianzas; si lo rechaza, se usa la corrección de Welch, que no asume varianzas iguales.
  5. En el diseño apareado, el análisis se reduce a un contraste sobre una sola muestra de diferencias: si las diferencias dentro de cada par son aproximadamente Normales, se aplica el test t visto en T11; si no, la alternativa es el test de Wilcoxon para muestras apareadas.

Errores frecuentes

  1. Error: aplicar el test t para muestras independientes a datos que en realidad son apareados, ignorando la estructura de pares. Corrección: esto desperdicia la información del emparejamiento y reduce artificialmente la potencia del contraste.
  2. Error: omitir la comprobación de homogeneidad de varianzas antes de aplicar el test t para muestras independientes, usando siempre la fórmula de varianzas iguales aunque no se cumpla esa condición.
  3. Error: confundir el test de Wilcoxon para muestras apareadas con el test de Mann-Whitney para muestras independientes. Corrección: son alternativas no paramétricas distintas, para diseños distintos.
  4. Error: aplicar el test t apareado calculando la media de las diferencias correctamente pero usando el error típico de las medias originales en lugar del error típico de las diferencias.

13.1. Dos diseños para comparar dos grupos

Cuando se quiere comparar la media de una variable entre dos grupos, el primer paso es identificar cómo se recogieron los datos. Esa estructura determina todo lo demás.

Definición

Muestras independientes: los dos grupos están formados por individuos distintos, sin ninguna relación entre los sujetos de un grupo y los del otro. La asignación a cada grupo es independiente.
Muestras apareadas: los dos grupos comparten una estructura de pares: 1) el mismo individuo medido en dos momentos distintos (antes/después) o 2) dos individuos emparejados por características relevantes (gemelos, casos y controles emparejados por edad y sexo).

Muestras independientes Grupo A Grupo B Sin relación entre individuos Test: t independientes / Mann-Whitney Muestras apareadas Antes Después Cada individuo es su propio control Test: t apareado / Wilcoxon apareado
Relevancia clínica

Un ensayo clínico que asigna aleatoriamente a 50 pacientes al grupo tratamiento y a 50 distintos al grupo control usa muestras independientes.
Un estudio que mide la glucemia de los mismos 50 pacientes antes y después de una intervención dietética usa muestras apareadas.
Usar el test de muestras independientes en el segundo caso ignoraría que cada par de medidas pertenece al mismo individuo, perdiendo una información valiosa que reduce la variabilidad del contraste.

13.2. Comparación de dos medias: muestras independientes

Para comparar las medias de dos grupos independientes, el estadístico de contraste mide cuántos errores típicos separa la diferencia entre medias observada del valor cero (que sería lo esperado bajo H0: μ₁ = μ₂).

Antes de calcularlo, hay que responder una pregunta previa: ¿son las varianzas de los dos grupos iguales (homocedásticas) o distintas (heterocedásticas)? La respuesta cambia la fórmula del estadístico y los grados de libertad.

13.2.1. Test de Levene: homogeneidad de varianzas

Definición

Test de Levene: contraste de hipótesis que evalúa si las varianzas de dos o más grupos son iguales. H0: σ₁² = σ₂². Si p es menor a 0,05, se rechaza la igualdad de varianzas y se debe usar la corrección de Welch en el test t posterior.

El test de Levene debe aplicarse antes del test t para muestras independientes, no como paso opcional sino como condición de aplicabilidad. En la práctica, la mayoría de paquetes estadísticos lo calculan automáticamente junto con el test t y presentan ambos resultados (con y sin corrección de Welch) para que el usuario seleccione el apropiado.

Error frecuente

Ignorar el test de Levene y usar siempre la fórmula de varianzas iguales es un error frecuente. Cuando las varianzas son muy distintas entre grupos, aplicar la fórmula que asume homocedasticidad produce valores p incorrectos, habitualmente subestimados, lo que puede llevar a rechazar H0 con más frecuencia de la que está justificada.

13.2.2. Estadístico t para muestras independientes

Con varianzas iguales, el estadístico t combina la variabilidad de ambos grupos en una varianza combinada (pooled variance):

t PARA MUESTRAS INDEPENDIENTES (varianzas iguales) t = x̄₁ − x̄₂ Sp · √(1/n₁ + 1/n₂) Sp = varianza combinada · g.l. = n₁ + n₂ − 2 Sp² = [(n₁−1)s₁² + (n₂−1)s₂²] / (n₁+n₂−2)

Cuando el test de Levene rechaza la igualdad de varianzas, se usa la corrección de Welch, que no asume varianzas iguales y ajusta los grados de libertad mediante la aproximación de Satterthwaite:

t DE WELCH (varianzas distintas) t = x̄₁ − x̄₂ √(s₁²/n₁ + s₂²/n₂) g.l. ajustados por aproximación de Satterthwaite (calculados por el software)
Nota

En la práctica clínica, los grados de libertad de Welch se calculan siempre con software estadístico. Lo importante es saber cuándo usar Welch (cuando Levene rechaza H0) y entender que los grados de libertad serán menores que en la fórmula con varianzas iguales, lo que produce valores t más conservadores.

13.3. Comparación de dos medias: muestras apareadas

Cuando los datos tienen estructura de pares, el análisis se simplifica considerablemente: en lugar de comparar dos distribuciones, se calcula la diferencia dentro de cada par y se contrasta si la media de esas diferencias es distinta de cero.

Idea clave

El test t apareado no es un test distinto del t de una muestra visto en el tema 11, es exactamente el mismo procedimiento, aplicado a la muestra de diferencias d_i = x₁ᵢ − x₂ᵢ. La hipótesis nula es H0: μ_d = 0 (la diferencia media dentro de los pares es cero). Toda la lógica del tema 11 se aplica aquí directamente.

t PARA MUESTRAS APAREADAS t = s_d / √n d̄ = media de las diferencias · s_d = DE de las diferencias · g.l. = n−1
Relevancia clínica

Un estudio mide la presión arterial sistólica de 30 pacientes antes y después de 8 semanas de tratamiento antihipertensivo. Para cada paciente se calcula la diferencia (antes − después).

Si la media de las 30 diferencias es d̄ = 12 mmHg con desviación típica s_d = 8 mmHg, el estadístico es t = 12 / (8/√30) ≈ 8,22 con 29 grados de libertad.

La pregunta del contraste es: ¿es razonable que esta diferencia media sea cero (ningún efecto del tratamiento)?

13.4. Condiciones de aplicabilidad y alternativas no paramétricas

Tabla 13.1. Comparación de dos medias: muestras independientes vs apareadas
Diseño Test paramétrico Condiciones Alternativa no paramétrica
Independientes t de Student (o Welch) Normalidad en cada grupo (o n grande); homogeneidad de varianzas verificada con Levene U de Mann-Whitney
Apareadas t apareado Normalidad de las diferencias (o n grande) Test de Wilcoxon para muestras apareadas
Definición

Test U de Mann-Whitney: alternativa no paramétrica al test t para muestras independientes. En lugar de comparar medias, compara las distribuciones de los dos grupos usando los rangos de los datos ordenados conjuntamente. No asume normalidad. Contrasta si la distribución de valores en un grupo tiende a ser sistemáticamente mayor o menor que en el otro.
Test de Wilcoxon para muestras apareadas: alternativa no paramétrica al test t apareado. Usa el signo y el rango de las diferencias dentro de cada par, sin asumir normalidad de las diferencias.

Error frecuente

El test de Wilcoxon para muestras apareadas y el test U de Mann-Whitney son alternativas no paramétricas para diseños distintos y no son intercambiables. Aplicar Mann-Whitney a datos apareados ignora la estructura de pares, exactamente igual que el error de aplicar el test t independiente a datos apareados en la versión paramétrica.

Relación con otro tema

Cuando el número de grupos a comparar es mayor que dos, el test t ya no es aplicable y se necesita el análisis de varianza (ANOVA), desarrollado en Tema 14 · Comparación de más de dos medias: ANOVA y Kruskal-Wallis.

Dr. Vicente Molina Nácher
Autor y revisión médica

Dr. Vicente Molina

Licenciado en Medicina
Especialista en Angiología y Cirugía Vascular

Editor y revisor de contenidos en Apuntes de Medicina.

Ver perfil del autor

Herramientas

Banco de preguntas — Próximamente