6.1. Qué es la distribución normal
De todas las distribuciones continuas, la Normal (también llamada gaussiana, o «campana de Gauss«) es, con diferencia, la más relevante en ciencias de la salud. Numerosas variables biológicas medidas en poblaciones grandes y homogéneas se aproximan razonablemente bien a esta forma: la talla adulta, determinados parámetros analíticos o los errores de medida de un instrumento.
La distribución Normal es, además, la base matemática de gran parte de la inferencia estadística que se desarrolla en los bloques siguientes de la asignatura: el comportamiento de la media muestral en muestras grandes (teorema central del límite) y muchos de los contrastes de hipótesis dependen directamente de las propiedades de esta distribución.
No toda variable biológica es Normal.
Variables como los días de estancia hospitalaria, las concentraciones de marcadores tumorales o el tiempo hasta un evento suelen ser marcadamente asimétricas (ver tema 2, apartado 2.7). Asumir Normal sin comprobarlo es un error frecuente que invalida análisis posteriores.
6.2. Características de la distribución Normal
Distribución Normal N (μ, σ): distribución de probabilidad continua, simétrica, en forma de campana, completamente determinada por su media μ y su desviación típica σ.
La distribución Normal tiene una forma de campana simétrica, con las siguientes propiedades:
| Propiedad | Descripción |
|---|---|
| Simetría | La curva es simétrica respecto a la media; media, mediana y moda coinciden |
| Forma de campana | Máxima densidad en la media, decreciendo simétricamente hacia ambos lados |
| Asíntotas | La curva nunca toca el eje horizontal; se extiende teóricamente de −∞ a +∞ |
| Área total | El área bajo toda la curva es exactamente 1 |
| Parámetros | Queda definida únicamente por μ (media) y σ (desviación típica) |
La regla empírica (también llamada regla 68-95-99,7) resume la dispersión de cualquier distribución Normal: aproximadamente el 68% de los valores se sitúa dentro de ±1 desviación típica de la media, el 95% dentro de ±2 desviaciones típicas, y el 99,7% dentro de ±3 desviaciones típicas.
Si la presión arterial sistólica de una población sigue N (120, 10) mmHg, la regla empírica permite estimar rápidamente que el 95% de los individuos tiene una presión entre 100 y 140 mmHg, sin necesidad de hacer ningún cálculo adicional.
6.3. Tipificación. La distribución Normal estándar
Existen infinitas distribuciones Normales, una para cada combinación posible de μ y σ. Calcular probabilidades directamente para cada una requeriría una tabla distinta por cada combinación de parámetros, lo cual es inviable. La solución es la tipificación que consiste en transformar cualquier variable Normal en la Normal estándar, que tiene siempre media 0 y desviación típica 1, denotada N(0,1).
Puntuación Z (valor tipificado): número de desviaciones típicas que un valor x se encuentra por encima (Z positiva) o por debajo (Z negativa) de la media de su distribución.
Una vez tipificado el valor, su probabilidad asociada se busca en la tabla de la Normal estándar, que da el área acumulada bajo la curva N(0,1) hasta cualquier valor de Z. Esa misma tabla sirve para cualquier variable Normal del mundo, sin importar su media o desviación típica originales, porque la tipificación las reduce a la misma escala común.
La puntuación Z no es un valor de la variable original, es una posición relativa. Un Z = 2 significa "dos desviaciones típicas por encima de la media", independientemente de si la variable es presión arterial, talla o glucemia. La tipificación convierte problemas de unidades distintas en un único marco comparable.
6.4. Cálculo de probabilidades con la Normal
Para una variable continua, la probabilidad de un valor exacto es siempre cero: P(X = x) = 0. Esto puede parecer contraintuitivo, pero es consecuencia directa de que hay infinitos valores posibles en cualquier intervalo continuo. Por eso, en variables continuas solo tienen sentido las probabilidades de intervalos: P(X ≤ x), P(X ≥ x), P(a ≤ X ≤ b).
El procedimiento general para calcular cualquier probabilidad bajo una Normal N(μ,σ) sigue tres pasos:
| Paso | Acción |
|---|---|
| 1 | Tipificar el valor x: calcular Z = (x − μ) / σ |
| 2 | Buscar el área correspondiente a Z en la tabla de la Normal estándar |
| 3 | Interpretar el área según el tipo de probabilidad pedida (acumulada, complementaria, o de un intervalo) |
La tabla de la Normal estándar siempre da el área acumulada por debajo de un valor Z: la proporción de la distribución que queda a la izquierda de ese punto. A partir de ese dato único se resuelven los tres tipos de probabilidad posibles:
- Área acumulada P(Z ≤ z): se lee directamente de la tabla. Si Z = 2, la tabla da 0,977: el 97,7% de la distribución queda por debajo de ese punto.
- Área complementaria P(Z ≥ z): se resta de 1. Si la tabla da 0,977 para Z = 2, el área por encima es 1 − 0,977 = 0,023: solo el 2,3% de la distribución supera ese punto.
- Probabilidad de un intervalo P(a ≤ Z ≤ b): se tipifican los dos extremos, se busca el área acumulada de cada uno en la tabla, y se resta la menor de la mayor. Si Z₁ = −1 da 0,159 y Z₂ = 2 da 0,977, el área entre ambos es 0,977 − 0,159 = 0,818: el 81,8% de la distribución cae en ese intervalo.
Si los niveles de colesterol LDL en una población siguen N(110, 20) mg/dL, y se quiere saber qué proporción de la población supera 150 mg/dL, se tipifica: Z = (150−110)/20 = 2. La tabla de la Normal estándar indica que el área acumulada hasta Z=2 es aproximadamente 0,977, por lo que el área restante (la que supera ese valor) es 1 − 0,977 = 0,023, es decir, un 2,3% de la población.
Es fácil confundir qué área da la tabla.
La mayoría de tablas de la Normal estándar dan el área acumulada por debajo de Z, es decir, P(Z ≤ z). Para calcular P(Z ≥ z) hay que restar de 1. Para calcular probabilidades entre dos valores, P(a ≤ X ≤ b), hay que tipificar ambos extremos y restar las dos áreas acumuladas correspondientes.
Pregunta frecuente: cálculo de percentiles usando la Normal en sentido inverso.
Si se pide el valor de la variable que deja por debajo un determinado porcentaje (por ejemplo, el percentil 90), el procedimiento se invierte. Primero, se busca en la tabla el valor de Z asociado a esa área y después se "destipifica" con x = μ + Z · σ para obtener el valor original de la variable.
La distribución Normal y la tipificación son la base matemática necesaria para construir la curva ROC con rigor y para entender el comportamiento de la media muestral en el teorema central del límite.
Ambos desarrollos se tratan en el Tema 7 · Distribución Normal y sus aplicaciones y en el bloque de muestreo y estimación.