Apartados del tema


Índice del tema

TEMA 14

Comparación de más de dos medias: ANOVA y Kruskal-Wallis

Dificultad: Alta
Lectura: 20~22 min
Estudio: 1,5~2 horas
Autor y revisión médica: Dr. Vicente Molina

·

Actualizado: 3 de julio de 2026

Resumen

Cuando se quieren comparar las medias de tres o más grupos, aplicar el test t de forma repetida entre todos los pares posibles infla artificialmente el error de tipo I. El análisis de la varianza (ANOVA) resuelve este problema evaluando si existe alguna diferencia entre grupos en un único contraste global. Si lo hay, las pruebas de comparaciones múltiples identifican entre qué pares concretos se produce la diferencia. Cuando no se cumplen las condiciones de aplicabilidad del ANOVA, el test de Kruskal-Wallis es la alternativa no paramétrica equivalente.

Ideas clave

  1. Aplicar múltiples tests t entre todos los pares posibles de grupos infla el error de tipo I global por encima del α fijado: con tres grupos y α=0,05, la probabilidad de al menos un falso positivo en las tres comparaciones posibles ya supera el 14%.
  2. El ANOVA no compara medias directamente: compara varianzas. La clave es que, si las medias de los grupos son distintas, la variabilidad entre grupos será mayor que la variabilidad dentro de los grupos.
  3. Un resultado significativo del ANOVA (p < α) solo dice que al menos dos grupos difieren entre sí: no dice cuáles ni cuánto. Para eso hacen falta las pruebas post hoc.
  4. Las pruebas post hoc controlan el error de tipo I global a lo largo de todas las comparaciones múltiples; no es lo mismo que hacer tests t individuales con el mismo α.
  5. El test de Kruskal-Wallis es la extensión del test U de Mann-Whitney a más de dos grupos: compara distribuciones usando rangos, sin asumir normalidad.

Errores frecuentes

  1. Error: aplicar tests t repetidos entre todos los pares de grupos en lugar de ANOVA, ignorando la inflación del error de tipo I.
  2. Error: interpretar un ANOVA significativo como evidencia de que todos los grupos difieren entre sí, en lugar de que al menos un par difiere.
  3. Error: aplicar pruebas post hoc sin haber obtenido un ANOVA significativo previo, lo que no tiene justificación metodológica en el esquema clásico de análisis.
  4. Error: confundir variabilidad entre grupos con variabilidad dentro de grupos: el estadístico F es el cociente entre ambas, no su diferencia.

14.1. Introducción a las comparaciones múltiples

Cuando se quiere comparar la media de una variable entre tres o más grupos, la tentación natural es aplicar el test t de Student entre todos los pares posibles. Con tres grupos (A, B, C) eso implica tres comparaciones: A vs. B, A vs. C y B vs. C. Con cuatro grupos, serían seis comparaciones. El problema es que cada comparación tiene su propio riesgo de error de tipo I (α), y al acumular comparaciones ese riesgo se multiplica.

La solución es el análisis de la varianza (ANOVA, Analysis of Variance), que evalúa en un único contraste si existe alguna diferencia entre los grupos.

Error frecuente

Con α = 0,05 por comparación y tres comparaciones independientes, la probabilidad de cometer al menos un error de tipo I es aproximadamente 1 − (1−0,05)³ ≈ 0,143: un 14,3% en lugar del 5% deseado.

Con seis comparaciones, ese riesgo sube al 26%. Cuantos más grupos, peor el problema. Por eso no se aplican múltiples tests t: se necesita un procedimiento que controle el error de tipo I global.

14.2. Prueba de ANOVA: comparar varianzas para detectar diferencias de medias

La idea central del ANOVA es contraintuitiva a primera vista: para detectar diferencias entre medias, se comparan varianzas.

Si los k grupos tienen la misma media poblacional (H0 cierta), la variabilidad de las medias muestrales entre grupos debería ser similar a la variabilidad de los datos individuales dentro de cada grupo. Si las medias son distintas (H0 falsa), la variabilidad entre grupos será mayor de lo esperado en relación con la variabilidad interna de cada grupo.

Definición

Variabilidad entre grupos (SCE): suma de cuadrados que mide cuánto se alejan las medias de cada grupo de la media global. Refleja el efecto del factor que define los grupos.
Variabilidad dentro de grupos (SCD o error): suma de cuadrados que mide la variabilidad de los datos individuales alrededor de la media de su propio grupo. Refleja la variabilidad aleatoria residual no explicada por el factor.

Variabilidad total (SCT) Toda la dispersión de los datos = Entre grupos (SCE) Efecto del factor (diferencias entre medias) + Dentro de grupos (SCD) Variabilidad residual (error aleatorio) SCT = SCE + SCD

14.3. El estadístico F y la tabla ANOVA

El estadístico F es el cociente entre la varianza entre grupos y la varianza dentro de grupos, cada una dividida entre sus grados de libertad correspondientes para obtener cuadrados medios (CM):

ESTADÍSTICO F (ANOVA) F = CME = SCE / (k−1) CMD = SCD / (N−k) k = número de grupos · N = total de observaciones

Bajo H0 (todas las medias iguales), F debería ser próximo a 1: ambas varianzas estiman la misma variabilidad

Cuanto más grande sea F, más evidencia hay de que la variabilidad entre grupos supera lo esperable por azar, y más improbable es H0.

La tabla ANOVA resume todo el cálculo en un formato estándar:

Tabla 14.1. Tabla ANOVA (suma de cuadrados, gl, F)
Fuente Suma de cuadrados Grados de libertad Cuadrado medio F
Entre grupos SCE k − 1 CME = SCE/(k−1) CME / CMD
Dentro de grupos (error) SCD N − k CMD = SCD/(N−k)
Total SCT N − 1
Relevancia clínica

Un estudio compara el nivel de HbA1c en tres grupos de pacientes diabéticos: dieta sola, dieta + metformina, dieta + metformina + insulina. El ANOVA con F=8,4 y p=0,001 indica que al menos dos grupos difieren en HbA1c. El ANOVA no dice cuáles: para eso hacen falta las pruebas post hoc del apartado siguiente.

14.4. Pruebas post hoc: comparaciones múltiples controladas

Un ANOVA significativo justifica buscar entre qué pares de grupos se producen las diferencias, mediante pruebas post hoc (o de comparaciones múltiples). Estas pruebas controlan el error de tipo I global a lo largo de todas las comparaciones simultáneas, a diferencia de los tests t individuales.

Tabla 14.2. Pruebas post hoc para ANOVA
Prueba Control del error Cuándo usarla
Tukey (HSD) Error familiar (FWER) Todos los pares posibles, varianzas iguales, grupos del mismo tamaño
Bonferroni Error familiar (FWER) Pocas comparaciones planeadas; muy conservadora con muchos grupos
Scheffé Error familiar (FWER) Comparaciones no planeadas; la más conservadora de las tres
Games-Howell Error familiar (FWER) Varianzas desiguales entre grupos (análogo a Welch en T13)
Idea clave

Las pruebas post hoc solo se aplican si el ANOVA previo es significativo. Aplicarlas directamente sin ANOVA previo, o aplicarlas cuando el ANOVA no es significativo, no tiene justificación en el esquema clásico de análisis porque no habría diferencias entre los grupos comparados. El ANOVA actúa como filtro que protege globalmente el error de tipo I antes de entrar en las comparaciones individuales.

14.5. Condiciones de aplicabilidad del ANOVA

El ANOVA de un factor (el que se ha descrito aquí) exige tres condiciones:

Tabla 14.3. Condiciones de aplicación del ANOVA
Condición Cómo verificarla
Independencia de las observaciones Garantizada por el diseño del estudio
Normalidad en cada grupo Histograma, diagrama de caja, o test de Shapiro-Wilk por grupo
Homogeneidad de varianzas entre grupos Test de Levene (igual que en T13 para dos grupos)
Nota

El ANOVA es razonablemente robusto frente a desviaciones moderadas de la normalidad cuando los grupos tienen tamaños muestrales similares y suficientemente grandes. La condición más crítica en la práctica es la homogeneidad de varianzas: varianzas muy distintas entre grupos afectan seriamente al control del error de tipo I del test F.

14.6. Alternativa no paramétrica: test de Kruskal-Wallis

Cuando los datos no cumplen las condiciones del ANOVA (especialmente con muestras pequeñas y distribuciones claramente no Normales), la alternativa es el test de Kruskal-Wallis.

Definición

Test de Kruskal-Wallis: alternativa no paramétrica al ANOVA de un factor. Combina todas las observaciones de todos los grupos, las ordena y asigna rangos, y evalúa si la distribución de rangos es similar en todos los grupos. No asume normalidad. Es la extensión del test U de Mann-Whitney a más de dos grupos.

Error frecuente

Igual que el ANOVA, el test de Kruskal-Wallis es un contraste global. Si es significativo, indica que al menos dos grupos difieren, pero no cuáles. Para las comparaciones múltiples post hoc no paramétricas se usan correcciones como la de Dunn con ajuste de Bonferroni, disponibles en cualquier paquete estadístico moderno.

Tabla 14.4. ANOVA vs Kruskal-Wallis
ANOVA Kruskal-Wallis
Qué compara Medias Distribuciones (mediante rangos)
Asume normalidad No
Potencia Mayor cuando se cumplen condiciones Menor, pero válido sin normalidad
Post hoc Tukey, Bonferroni, Scheffé... Dunn con corrección de Bonferroni
Relación con otro tema

El esquema "contraste global + post hoc" del ANOVA se aplica también en modelos más complejos como el ANOVA de dos factores o el ANCOVA, que quedan fuera del alcance de este temario introductorio.

El siguiente paso en el Bloque 4 es la comparación de proporciones entre grupos, desarrollada en el Tema 15 · Tablas de contingencia y Ji-cuadrado.

Dr. Vicente Molina Nácher
Autor y revisión médica

Dr. Vicente Molina

Licenciado en Medicina
Especialista en Angiología y Cirugía Vascular

Editor y revisor de contenidos en Apuntes de Medicina.

Ver perfil del autor

Herramientas

Banco de preguntas — Próximamente