2.1. Definición y utilidad de la estadística descriptiva
Cuando se recogen datos de una muestra, lo primero que hay que hacer es describirlos. Antes de plantear hipótesis, antes de calcular probabilidades, antes de hacer inferencias: describir. La estadística descriptiva proporciona las herramientas para organizar, resumir y visualizar los datos de forma que sean comprensibles y útiles.
La descripción tiene tres objetivos prácticos:
- Detectar errores en los datos: un valor imposible (una glucemia de 4.000 mg/dL, una edad de 180 años) aparece de inmediato en una tabla o un gráfico.
- Conocer la distribución de los datos: si es simétrica, asimétrica, si hay valores extremos…
- Comunicar los resultados de forma eficiente: un solo número bien elegido puede resumir cientos de observaciones.
La estadística descriptiva no extrae conclusiones sobre la población, se limita a "contar cómo es" la muestra. Las conclusiones sobre la población son tarea de la estadística inferencial. Confundir ambas es uno de los errores más frecuentes en la lectura de artículos médicos.
2.2. Distribuciones de frecuencias y tablas
El primer paso para organizar datos es construir una tabla de frecuencias. Una tabla de frecuencias recoge cuántas veces aparece cada valor o cada categoría en la muestra.
Para variables cualitativas o cuantitativas discretas con pocos valores, cada valor ocupa una fila. Para variables cuantitativas continuas, los datos se agrupan en intervalos de clase (también llamados clases o bins): rangos de valores que se tratan como una unidad. La elección del número de intervalos afecta a la lectura ya que pocos intervalos ocultan variabilidad y demasiados la fragmentan sin añadir información.
Una tabla de frecuencias completa incluye cuatro columnas fundamentales:
| Columna | Símbolo | Definición | Ejemplo (n = 50 pacientes) |
|---|---|---|---|
| Frecuencia absoluta | ni | Número de veces que aparece el valor o intervalo | 12 pacientes con glucemia 80-99 mg/dL |
| Frecuencia relativa | fi | Proporción sobre el total: ni / n | 12/50 = 0,24 (24%) |
| Frecuencia absoluta acumulada | Ni | Suma de frecuencias absolutas hasta ese valor | Hasta 99 mg/dL: 12 + 20 = 32 pacientes |
| Frecuencia relativa acumulada | Fi | Proporción acumulada hasta ese valor | 32/50 = 0,64 (64%) |
La frecuencia relativa acumulada es especialmente útil porque permite leer directamente los percentiles. Por ejemplo, el valor de la variable en el que la frecuencia relativa acumulada alcanza el 75% es el percentil 75 (también llamado tercer cuartil).
En variables continuas, el número de intervalos se suele estimar con la regla de Sturges: k ≈ 1 + 3,322 × log₁₀(n), donde n es el tamaño de la muestra.
Para n = 100, k ≈ 8 intervalos.
Es una aproximación orientativa, no una norma absoluta.
2.3. Representación gráfica de datos
Un gráfico bien elegido transmite en un vistazo lo que una tabla de cien filas no puede. La elección del gráfico depende del tipo de variable y de qué aspecto se quiere comunicar.
2.3.1. Gráficos para variables cualitativas
El diagrama de barras representa cada categoría como una barra cuya altura es proporcional a su frecuencia. Las barras no se tocan entre sí: reflejan que las categorías son entidades separadas sin continuidad entre ellas. Es el gráfico estándar para variables nominales y ordinales.
El diagrama de sectores (o gráfico de tarta) divide un círculo en sectores proporcionales a la frecuencia de cada categoría. Es útil para mostrar proporciones de un todo, pero pierde eficacia cuando hay más de cinco o seis categorías.
2.3.2. Gráficos para variables cuantitativas
El histograma representa la distribución de una variable continua. Los datos se agrupan en intervalos y cada intervalo se representa como una barra. A diferencia del diagrama de barras, las barras del histograma se tocan. Los intervalos son contiguos y no hay espacio entre ellos. La altura de cada barra representa la frecuencia del intervalo.
El polígono de frecuencias conecta los puntos medios de las barras del histograma con líneas rectas. Permite superponer varias distribuciones en un mismo gráfico, lo que facilita la comparación.
El diagrama de caja (boxplot) representa gráficamente los cinco estadísticos de resumen más importantes:
- Valor mínimo.
- Primer cuartil (Q1).
- Mediana (Q2).
- Tercer cuartil (Q3).
- Valor máximo.
Los valores atípicos (denominados outliers) se representan como puntos separados. Es especialmente útil para comparar la distribución de una variable entre grupos.
Histograma y diagrama de barras no son intercambiables. El histograma es para variables cuantitativas continuas agrupadas en intervalos (las barras se tocan porque los datos son continuos). El diagrama de barras es para variables cualitativas o cuantitativas discretas (las barras no se tocan porque las categorías están separadas).
Usarlos al revés es un error conceptual.
| Gráfico | Tipo de variable | Qué muestra | Cuándo usarlo |
|---|---|---|---|
| Diagrama de barras | Cualitativa / discreta | Frecuencia por categoría | Comparar categorías entre sí |
| Diagrama de sectores | Cualitativa nominal | Proporción de cada categoría sobre el total | Pocas categorías (≤ 5), énfasis en partes de un todo |
| Histograma | Cuantitativa continua | Distribución por intervalos | Ver forma de la distribución, detectar asimetría |
| Polígono de frecuencias | Cuantitativa continua | Forma de la distribución | Comparar dos o más distribuciones en el mismo gráfico |
| Diagrama de caja | Cuantitativa continua u ordinal | Mediana, cuartiles, rango, outliers | Comparar grupos, detectar valores atípicos |
2.4. Medidas de centralización
Las medidas de centralización describen el valor típico o central de la distribución. Las tres principales son la media, la mediana y la moda.
2.4.1. Media aritmética
La media aritmética es la suma de todos los valores dividida entre el número de observaciones. Es el estadístico de centralización más informativo cuando la distribución es simétrica y no hay valores extremos ya que utiliza toda la información de los datos.
Su debilidad reside en que, al usar todos los valores, es muy sensible a los extremos. Una sola observación inusualmente alta o baja puede desplazar la media de forma sustancial, haciendo que deje de representar al grupo.
La presión arterial sistólica media de una consulta de hipertensión puede ser 152 mmHg. Si un paciente en crisis hipertensiva tiene 240 mmHg, la media del grupo sube aunque el resto esté controlado. En ese caso, la mediana refleja mejor la situación del grupo.
2.4.2. Mediana
La mediana es el valor que divide la distribución ordenada en dos mitades iguales (el 50% de los datos está por debajo y el 50% por encima). Si el número de observaciones es impar, la mediana es el valor central. Si es par, es la media de los dos valores centrales.
La mediana es robusta frente a los valores extremos. Un outlier no la desplaza sustancialmente, al contrario que pasaba con la media. Por eso es el estadístico de elección cuando la distribución es asimétrica, cuando hay valores extremos o cuando se trabaja con variables ordinales.
2.4.3. Moda
La moda es el valor que aparece con mayor frecuencia. En variables cualitativas es el único estadístico de centralización válido. En variables cuantitativas continuas, la moda se estima como el intervalo de mayor frecuencia en el histograma.
Una distribución puede tener una moda (unimodal), dos modas (bimodal) o más. Una distribución bimodal suele indicar que la muestra mezcla dos subpoblaciones distintas, lo que tiene implicaciones clínicas importantes.
| Medida | Definición | Sensible a outliers | Cuándo usarla |
|---|---|---|---|
| Media | Suma de valores / n | Sí | Distribución simétrica sin outliers, variables cuantitativas |
| Mediana | Valor central de la distribución ordenada | No | Distribución asimétrica, outliers, variables ordinales |
| Moda | Valor más frecuente | No | Variables cualitativas; detectar bimodalidad |
2.5. Medidas de posición: percentiles y cuartiles
Los percentiles dividen la distribución ordenada en cien partes iguales. El percentil p es el valor por debajo del cual se encuentra el p% de las observaciones. Los percentiles son valores de la variable.
Los cuartiles son los percentiles 25, 50 y 75, designados Q1, Q2 y Q3. Q2 coincide con la mediana. El rango intercuartílico (RIC) es la diferencia Q3 – Q1 y contiene el 50% central de los datos. Es la medida de dispersión natural cuando se usa la mediana como centralización.
Las tablas de crecimiento infantil se expresan en percentiles. Un niño en el percentil 10 de peso tiene un peso igual o superior al 10% de los niños de su edad, e inferior al 90% restante.
Los percentiles relevantes en la práctica clínica dependen del contexto. En pediatría se usan habitualmente los percentiles 3, 10, 25, 50, 75, 90 y 97. En laboratorio clínico, los valores de referencia se definen frecuentemente como el intervalo entre los percentiles 2,5 y 97,5 de la población sana.
2.6. Medidas de dispersión
Conocer el centro de una distribución no es suficiente. Dos grupos pueden tener la misma media y distribuciones completamente distintas. Un grupo puede estar muy concentrado alrededor del centro, y el otro muy disperso. Las medidas de dispersión cuantifican esa variabilidad.
2.6.1. Rango
El rango es la diferencia entre el valor máximo y el mínimo. Es fácil de calcular pero muy sensible a los valores extremos (un solo outlier lo altera completamente). Se usa como descripción rápida inicial, pero rara vez como estadístico principal.
2.6.2. Varianza y desviación típica
La varianza mide la dispersión promedio de los datos respecto a la media. Es la media de los cuadrados de las diferencias entre cada valor y la media. Al elevar al cuadrado, las diferencias positivas y negativas no se anulan y los valores extremos pesan más.
La desviación típica (o desviación estándar, DE o SD) es la raíz cuadrada de la varianza. Tiene la misma unidad que la variable original, lo que la hace interpretable directamente. En una distribución normal, aproximadamente el 68% de los datos cae dentro de ±1 DE de la media, y el 95% dentro de ±2 DE.
La media y la desviación típica son inseparables. Reportar solo la media sin la desviación típica es como decir que el centro de una ciudad está en tal coordenada sin decir cuánto se extiende. En artículos médicos, el formato estándar es media ± DE o media (DE).
2.6.3. Coeficiente de variación
El coeficiente de variación (CV) expresa la desviación típica como porcentaje de la media:
CV = (DE/media) × 100.
Al ser adimensional, permite comparar la dispersión de variables con distintas unidades o distintas medias.
Un laboratorio mide la glucemia (media 95 mg/dL, DE 8 mg/dL) y la albúmina (media 4,2 g/dL, DE 0,4 g/dL). Las desviaciones típicas no son comparables porque las unidades y las magnitudes son distintas. Los coeficientes de variación sí lo son: CV glucemia = 8,4%; CV albúmina = 9,5%. La albúmina presenta ligeramente más variabilidad relativa.
| Medida | Fórmula | Sensible a outliers | Uso principal |
|---|---|---|---|
| Rango | Máx − Mín | Muy | Descripción rápida inicial |
| RIC | Q3 − Q1 | No | Acompaña a la mediana; distribuciones asimétricas |
| Varianza | Σ(xi − x̄)² / (n−1) | Sí | Base de cálculo; no interpretable directamente |
| Desviación típica | √Varianza | Sí | Acompaña a la media; misma unidad que la variable |
| CV | (DE / media) × 100 | Moderada | Comparar dispersión entre variables distintas |
2.7. Medidas de forma. Asimetría y curtosis
Una vez conocidos el centro y la dispersión, las medidas de forma describen la geometría de la distribución. Son especialmente importantes porque condicionan qué pruebas estadísticas se pueden aplicar en el análisis inferencial.
2.7.1. Asimetría
La asimetría (skewness) mide si la distribución es simétrica o si tiene una cola más larga hacia un lado.
En una distribución simétrica, la media, la mediana y la moda coinciden o están muy próximas. El histograma tiene forma de campana equilibrada.
En una distribución con asimetría positiva (cola derecha), hay pocos valores muy altos que estiran la distribución hacia la derecha. La media queda por encima de la mediana. Es la forma habitual de variables como el ingreso, el tiempo hasta un evento o la concentración de marcadores biológicos en muchas enfermedades.
En una distribución con asimetría negativa (cola izquierda), hay pocos valores muy bajos que estiran la distribución hacia la izquierda. La media queda por debajo de la mediana.
En distribuciones asimétricas, la relación entre media y mediana indica el sentido de la asimetría: si la media es mayor a la mediana, la asimetría es positiva (cola derecha); si la media es menor a la mediana, es negativa (cola izquierda). Esta regla práctica permite detectar asimetría sin calcular el coeficiente formal.
2.7.2. Curtosis
La curtosis mide el apuntamiento de la distribución y el peso de las colas en comparación con una distribución normal. Una distribución leptocúrtica tiene un pico más agudo y colas más pesadas que la normal.
Una distribución platicúrtica tiene un pico más achatado y colas más ligeras. La distribución normal se denomina mesocúrtica y sirve como referencia.
En la práctica médica, la curtosis es menos utilizada que la asimetría, pero importa cuando se evalúa si los datos siguen una distribución normal, requisito de muchas pruebas inferenciales.
2.8. Cómo elegir el estadístico adecuado
La elección del estadístico de resumen depende del tipo de variable y de la forma de la distribución. Esta tabla condensa la regla de decisión:
| Tipo de variable | Distribución | Centralización | Dispersión | Gráfico |
|---|---|---|---|---|
| Cualitativa nominal | — | Moda | Frecuencias (%) | Barras / sectores |
| Cualitativa ordinal | — | Mediana | RIC / percentiles | Barras / caja |
| Cuantitativa | Simétrica | Media | Desviación típica | Histograma / caja |
| Cuantitativa | Asimétrica u outliers | Mediana | RIC | Histograma / caja |
Pregunta frecuente: "¿Qué medida de centralización y dispersión usarías para describir los días de ingreso hospitalario?"
Los días de ingreso son una variable cuantitativa discreta con distribución típicamente asimétrica positiva (la mayoría de ingresos son cortos, pero algunos son muy largos). La respuesta correcta es mediana e RIC, no media y desviación típica. El examinador busca que apliques el criterio de la distribución, no que respondas "media" por defecto.
Las medidas de forma (asimetría y curtosis) determinan si los datos pueden analizarse con pruebas paramétricas, que asumen distribución normal, o si hay que recurrir a alternativas no paramétricas. Este punto se desarrolla en Tema 5 · Contraste de hipótesis y en Tema 7 · Métodos no paramétricos.