8.1. Aleatoriedad del estadístico
Hasta ahora se ha trabajado con la idea de que una muestra produce un valor: la media muestral, la proporción muestral, la desviación típica muestral. Pero conviene dar un paso atrás y preguntarse: ¿qué pasaría si se repitiera el muestreo, extrayendo otra muestra distinta de la misma población?
La respuesta es que el estadístico calculado cambiaría.
Una muestra de 50 pacientes dará una media de glucemia ligeramente distinta a otra muestra de 50 pacientes diferentes, aunque ambas procedan de la misma población. Esto significa que el estadístico, igual que la variable original, es en sí mismo una variable aleatoria, con su propia distribución de probabilidad.
Distribución muestral de un estadístico: distribución de probabilidad que tendría un estadístico (media, proporción, varianza...) si se calculara repetidamente sobre todas las muestras posibles del mismo tamaño extraídas de la misma población.
En la práctica, nunca se extraen realmente todas las muestras posibles, se trabaja con una sola muestra. Conocer las propiedades teóricas de la distribución muestral permite saber cuánto se puede confiar en esa única muestra, lo cual es la base de toda la inferencia estadística.
8.2. El error típico
La dispersión de la distribución muestral de un estadístico se llama error típico (standard error, SE). No debe confundirse con la desviación típica de la variable original.
| Desviación típica (σ) | Error típico (SE) | |
|---|---|---|
| Qué mide | Dispersión de los datos individuales en la muestra/población | Dispersión del estadístico (ej. la media) entre distintas muestras |
| Depende de n | No directamente | Sí: disminuye al aumentar n |
| Uso típico | Describir la variabilidad de los datos (T2) | Cuantificar la precisión de una estimación (T9 en adelante) |
Para la media muestral, el error típico se calcula a partir de la desviación típica poblacional σ y el tamaño de la muestra n:
La relación con la raíz cuadrada de n tiene una consecuencia práctica importante y es que el error típico no disminuye proporcionalmente al tamaño muestral.
Para reducir el error típico a la mitad, no basta con duplicar el tamaño muestral, hay que multiplicarlo por 4. Esto se debe a que la relación es con la raíz cuadrada de n. Pasar de n=25 a n=100 (multiplicar por 4) reduce el error típico a la mitad; pasar de n=25 a n=50 (multiplicar por 2) solo lo reduce a aproximadamente el 71%. Esta relación de rendimientos decrecientes es importante al planificar el tamaño muestral de un estudio.
En la práctica, σ (desviación típica poblacional) rara vez se conoce. Se sustituye por la desviación típica muestral (s), calculada según se vio en el tema 2. Esto introduce una fuente adicional de incertidumbre que se trata formalmente con la distribución t de Student en temas posteriores, especialmente relevante en muestras pequeñas.
8.3. Teorema central del límite
El resultado más importante de este tema, y uno de los más importantes de toda la estadística inferencial, es el teorema central del límite (TCL).
Teorema central del límite: la distribución muestral de la media de una variable se aproxima a una distribución Normal a medida que el tamaño muestral n aumenta, independientemente de cuál sea la distribución original de la variable en la población (siempre que esta tenga media y varianza finitas).
Esta es la propiedad que hace que la distribución Normal, vista en el tema 6 y el tema 7, sea tan central en toda la inferencia estadística. No hace falta que la variable original sea Normal. La media muestral, calculada sobre un n suficientemente grande, se comporta de forma aproximadamente Normal aunque la variable de partida sea muy asimétrica.
En la práctica, se considera que n ≥ 30 es suficientemente grande para que la aproximación del TCL sea razonable en la mayoría de los casos, aunque cuanto más asimétrica sea la distribución original, mayor n se necesita para que la aproximación funcione bien.
El TCL no dice que la variable original se vuelva Normal. La variable individual (la glucemia de un paciente, por ejemplo) puede seguir siendo asimétrica por mucho que aumente n. Lo que se vuelve Normal es la distribución muestral de la media calculada sobre muestras de tamaño n, no la variable en sí. Confundir estos dos niveles es un error conceptual frecuente.
Formalmente, el TCL establece que el estadístico tipificado de la media muestral converge a la distribución Normal estándar cuando n tiende a infinito:
8.3.1. Aplicación práctica
Si el tiempo de espera en urgencias tiene una media poblacional de 45 minutos y una desviación típica de 20 minutos (con distribución desconocida, probablemente asimétrica), y se toma una muestra de 64 pacientes, el TCL permite calcular la probabilidad de que la media muestral supere los 50 minutos.
El error típico es 20/√64 = 2,5 minutos.
Se tipifica: Z = (50−45)/2,5 = 2.
La probabilidad se obtiene de la tabla Normal estándar exactamente igual que en el tema 6, aunque el tiempo de espera individual no sea Normal.
Pregunta frecuente: aplicar incorrectamente la desviación típica de la variable (σ) en lugar del error típico (σ/√n) al tipificar una media muestral.
Antes de tipificar, siempre hay que preguntarse: ¿estoy calculando una probabilidad sobre un dato individual, o sobre la media de una muestra? Si es sobre la media, hay que usar el error típico, no σ directamente.
El TCL es el fundamento teórico que permite construir intervalos de confianza para la media poblacional y realizar contrastes de hipótesis sobre la media, ambos desarrollados en Tema 9 · Estimación puntual y por intervalos y en los temas siguientes del bloque.