10.1. Qué es un contraste de hipótesis
Un contraste de hipótesis (también llamado test de hipótesis o prueba de significación) es un procedimiento formal que permite decidir, a partir de los datos de una muestra, si una afirmación concreta sobre un parámetro poblacional es razonable o debe rechazarse.
Contraste de hipótesis: procedimiento estadístico que utiliza los datos de una muestra para decidir entre dos afirmaciones contrapuestas sobre un parámetro poblacional, cuantificando el riesgo de equivocarse en esa decisión.
La lógica subyacente es la misma que en cualquier razonamiento por contradicción. Se asume provisionalmente que no hay efecto ni diferencia y se comprueba si los datos observados son compatibles con esa suposición. Si los datos serían muy improbables bajo esa suposición, se rechaza.
10.2. Hipótesis nula (H0) y alternativa (H1)
Todo contraste enfrenta dos hipótesis mutuamente excluyentes.
Hipótesis nula (H0): afirmación de partida que se somete a contraste, habitualmente formulada como ausencia de efecto, ausencia de diferencia o ausencia de asociación.
Hipótesis alternativa (H1): afirmación contraria a H0, que se acepta si los datos proporcionan evidencia suficiente para rechazar H0.
Es importante entender el papel asimétrico de ambas hipótesis:
- H0 es la hipótesis que se pone a prueba.
- H1 es habitualmente la hipótesis que el investigador sospecha o quiere respaldar.
El procedimiento está diseñado para ser conservador. Se necesita evidencia clara para rechazar H0, no para aceptarla.
Un contraste de hipótesis nunca demuestra que H0 es cierta. Como mucho, concluye que "no hay evidencia suficiente para rechazarla" con los datos disponibles. Esto es como un juicio penal: no condenar a alguien no es lo mismo que declararlo inocente; simplemente no hay pruebas suficientes para condenar. Esta asimetría es la base conceptual de todo el contraste de hipótesis.
10.2.1. Contrastes unilaterales y bilaterales
La forma en que se formula H1 determina si el contraste es unilateral o bilateral.
| Tipo | H0 | H1 | Cuándo usarlo |
|---|---|---|---|
| Bilateral (dos colas) | μ = μ₀ | μ ≠ μ₀ | Interesa cualquier diferencia, en cualquier dirección |
| Unilateral derecho | μ ≤ μ₀ | μ > μ₀ | Solo interesa si el parámetro es mayor que un valor de referencia |
| Unilateral izquierdo | μ ≥ μ₀ | μ < μ₀ | Solo interesa si el parámetro es menor que un valor de referencia |
La elección entre unilateral y bilateral debe hacerse antes de ver los datos, basándose en la pregunta de investigación, nunca después de observar en qué dirección apuntan los resultados. Elegir el tipo de contraste a posteriori, según convenga al resultado obtenido, invalida la interpretación del valor p y se considera una mala práctica metodológica grave.
10.3. Errores de tipo I y tipo II
Como cualquier procedimiento de decisión bajo incertidumbre, un contraste de hipótesis puede equivocarse de dos formas distintas.
Error de tipo I (α): rechazar H0 cuando en realidad es cierta (falso positivo del contraste). Su probabilidad se denomina nivel de significación, α, y se fija de antemano (habitualmente 0,05).
Error de tipo II (β): no rechazar H0 cuando en realidad es falsa (falso negativo del contraste). Su complementario, 1−β, se denomina potencia del contraste.
Potencia del contraste: probabilidad de detectar correctamente un efecto que realmente existe.
En el contexto de un ensayo clínico que evalúa si un nuevo fármaco es mejor que el estándar (H0: no hay diferencia), un error de tipo I llevaría a concluir que el fármaco funciona cuando en realidad no aporta nada, con el riesgo de adoptar un tratamiento ineficaz. Un error de tipo II llevaría a descartar un fármaco que en realidad sí es efectivo, perdiendo una oportunidad terapéutica real. Ambos errores tienen consecuencias clínicas distintas y su coste relativo debe valorarse al diseñar el estudio.
α y β son riesgos opuestos. A igualdad de tamaño muestral, reducir α (exigir más seguridad para rechazar H0) aumenta automáticamente β (más riesgo de no detectar un efecto real). La única forma de reducir ambos errores simultáneamente es aumentar el tamaño muestral, lo cual conecta directamente con el cálculo de tamaño muestral visto en el tema 9.
Esta relación entre α, β y el tamaño muestral es exactamente la lógica detrás del cálculo del tamaño muestral necesario para un contraste de hipótesis, que se desarrolla con detalle en el tema 11 y el tema 12.
10.4. Estadístico de contraste y región crítica
Para decidir si rechazar o no H0, se calcula a partir de la muestra un estadístico de contraste. Este se define como un valor numérico que resume cuánto se alejan los datos observados de lo esperado bajo H0. Ese valor se compara con una región crítica, definida por el nivel de significación α elegido.
Región crítica: conjunto de valores del estadístico de contraste para los cuales se rechaza H0. Su tamaño está determinado por α: cuanto menor es α, más extrema tiene que ser la región crítica, y más difícil es rechazar H0.
Si el estadístico de contraste calculado sobre la muestra cae dentro de la región crítica, se rechaza H0; si cae fuera, no se rechaza. La frontera entre ambas zonas se llama valor crítico, y depende del nivel de significación elegido y de si el contraste es unilateral o bilateral.
10.5. El valor p
El valor p es, probablemente, el concepto peor interpretado de toda la bioestadística aplicada a la medicina, a pesar de ser uno de los más citados en la literatura científica.
Valor p: probabilidad de obtener un resultado tan extremo o más extremo que el observado en la muestra, asumiendo que la hipótesis nula es cierta.
Un valor p pequeño indica que el resultado observado sería poco probable si H0 fuera cierta, lo que se interpreta como evidencia en contra de H0. La regla de decisión habitual es: si p < α (típicamente 0,05), se rechaza H0; si p ≥ α, no se rechaza.
El valor p NO es la probabilidad de que H0 sea cierta, ni la probabilidad de que el resultado se deba al azar. Es una probabilidad condicionada: P(datos tan extremos o más | H0 cierta), calculada bajo el supuesto de que H0 es verdadera. Confundir esto con P(H0 cierta | datos) es uno de los errores conceptuales más extendidos y más graves en la lectura de literatura médica; son probabilidades condicionadas inversas, exactamente la misma trampa lógica que se vio con sensibilidad y VPP en el tema 4.
La confusión entre P(datos|H0) y P(H0|datos) es estructuralmente idéntica a la confusión entre sensibilidad y valor predictivo positivo vista en Tema 4 · Probabilidad condicionada, teorema de Bayes y pruebas diagnósticas. En ambos casos, invertir el orden del condicionamiento sin aplicar el teorema de Bayes lleva a una interpretación incorrecta.
| Valor p | Interpretación habitual |
|---|---|
| p < 0,001 | Evidencia muy fuerte contra H0 |
| p < 0,01 | Evidencia fuerte contra H0 |
| p < 0,05 | Evidencia suficiente contra H0 (umbral convencional) |
| p ≥ 0,05 | Evidencia insuficiente para rechazar H0 |
10.6. Significación estadística vs. relevancia clínica
Un último punto, frecuentemente ignorado, cierra el esquema general del contraste de hipótesis. Un resultado sea estadísticamente significativo no implica que sea clínicamente relevante.
Con un tamaño muestral muy grande, incluso diferencias clínicamente triviales pueden alcanzar significación estadística (p menor a 0,05), porque el error típico se reduce mucho y el contraste detecta diferencias diminutas con facilidad. Por eso, junto al valor p, siempre debe valorarse la magnitud del efecto observado (la diferencia real entre grupos) y su relevancia en términos clínicos.
Un ensayo clínico con 50.000 pacientes encuentra que un nuevo fármaco reduce la presión arterial sistólica en 0,8 mmHg frente a placebo, con p menor a 0,001. El resultado es estadísticamente significativo, pero una reducción de 0,8 mmHg carece de relevancia clínica. No cambiaría el manejo del paciente. La significación estadística informa sobre si el efecto es probablemente real (no debido al azar); la relevancia clínica informa sobre si ese efecto importa en la práctica.
Pregunta frecuente: "¿Un valor p de 0,03 significa que hay un 3% de probabilidad de que H0 sea cierta?"
No. Significa que, si H0 fuera cierta, la probabilidad de observar un resultado tan extremo o más que el obtenido sería del 3%. El valor p nunca es una probabilidad sobre la hipótesis; es una probabilidad sobre los datos, condicionada a la hipótesis.
Este esquema general (H0, H1, α, β, valor p) es el armazón común de todos los contrastes específicos que se desarrollan en los temas siguientes: contraste sobre la media de una población en tema 11, y contraste sobre una proporción en tema 12. La mecánica de cada test concreto cambia, pero la lógica de decisión es siempre la misma vista aquí.