Apartados del tema


Índice del tema

TEMA 2

Estadística descriptiva: tablas de frecuencias, gráficos y medidas de resumen

Dificultad: Intermedia
Lectura: 17~20 min
Estudio: 1,2~1,5 horas
Autor y revisión médica: Dr. Vicente Molina

·

Actualizado: 3 de julio de 2026

Resumen

La estadística descriptiva permite organizar y resumir los datos de una muestra antes de extraer ninguna conclusión.

Las herramientas fundamentales son tres:

  1. Las tablas de frecuencias (que ordenan los datos).
  2. Los gráficos (que los hacen visibles).
  3. Los estadísticos de resumen (que los condensan en uno o pocos números).

Las medidas de centralización localizan el «centro» de la distribución; las de dispersión cuantifican cuánto se alejan los datos de ese centro; las de forma describen la simetría y el apuntamiento.

Elegir el estadístico correcto depende siempre del tipo de variable y de la forma de la distribución.

Ideas clave

  1. Describir los datos antes de analizarlos no es opcional: es el primer paso de cualquier análisis estadístico y permite detectar errores, valores atípicos y la forma de la distribución.
  2. La media es sensible a los valores extremos; la mediana no. En distribuciones asimétricas o con outliers, la mediana representa mejor el «centro típico» de los datos.
  3. La desviación típica solo tiene sentido acompañando a la media: siempre se reportan juntas.
  4. El coeficiente de variación permite comparar dispersiones entre variables con distinta unidad o distinta media, algo imposible con la desviación típica sola.
  5. El tipo de gráfico no es una cuestión estética: el histograma es para variables continuas, el diagrama de barras para variables discretas o cualitativas. Usarlos al revés es un error conceptual.
  6. Un percentil no es una puntuación: el percentil 75 significa que el 75% de los valores de la distribución están por debajo de ese punto.
  7. La asimetría y la curtosis no son adornos: condicionan qué pruebas estadísticas se pueden aplicar en los temas siguientes.

Errores frecuentes

  1. Error: calcular la media de una variable ordinal. Corrección: la escala ordinal no tiene distancias iguales entre categorías, por lo que la media aritmética carece de sentido. El estadístico correcto es la mediana.
  2. Error: confundir diagrama de barras con histograma. Corrección: en el diagrama de barras las barras no se tocan (hay espacio entre ellas, porque las categorías son discretas); en el histograma sí se tocan (los intervalos son continuos y adyacentes).
  3. Error: reportar la desviación típica sin la media, o la media sin la desviación típica. Corrección: ninguna de las dos tiene sentido interpretativa sin la otra.
  4. Error: interpretar el percentil 90 como «una puntuación de 90». Corrección: el percentil 90 es el valor por debajo del cual se sitúa el 90% de los datos, no una puntuación ni un porcentaje de acierto.
  5. Error: usar la misma medida de centralización independientemente de la distribución. Corrección: en distribuciones simétricas, media y mediana coinciden; en distribuciones asimétricas, la media se desplaza hacia la cola y la mediana es más representativa.

2.1. Definición y utilidad de la estadística descriptiva

Cuando se recogen datos de una muestra, lo primero que hay que hacer es describirlos. Antes de plantear hipótesis, antes de calcular probabilidades, antes de hacer inferencias: describir. La estadística descriptiva proporciona las herramientas para organizar, resumir y visualizar los datos de forma que sean comprensibles y útiles.

La descripción tiene tres objetivos prácticos:

  1. Detectar errores en los datos: un valor imposible (una glucemia de 4.000 mg/dL, una edad de 180 años) aparece de inmediato en una tabla o un gráfico.
  2. Conocer la distribución de los datos: si es simétrica, asimétrica, si hay valores extremos…
  3. Comunicar los resultados de forma eficiente: un solo número bien elegido puede resumir cientos de observaciones.

Idea clave

La estadística descriptiva no extrae conclusiones sobre la población, se limita a "contar cómo es" la muestra. Las conclusiones sobre la población son tarea de la estadística inferencial. Confundir ambas es uno de los errores más frecuentes en la lectura de artículos médicos.

2.2. Distribuciones de frecuencias y tablas

El primer paso para organizar datos es construir una tabla de frecuencias. Una tabla de frecuencias recoge cuántas veces aparece cada valor o cada categoría en la muestra.

Para variables cualitativas o cuantitativas discretas con pocos valores, cada valor ocupa una fila. Para variables cuantitativas continuas, los datos se agrupan en intervalos de clase (también llamados clases o bins): rangos de valores que se tratan como una unidad. La elección del número de intervalos afecta a la lectura ya que pocos intervalos ocultan variabilidad y demasiados la fragmentan sin añadir información.

Una tabla de frecuencias completa incluye cuatro columnas fundamentales:

Tabla 2.1. Columnas de una tabla de frecuencias
Columna Símbolo Definición Ejemplo (n = 50 pacientes)
Frecuencia absoluta ni Número de veces que aparece el valor o intervalo 12 pacientes con glucemia 80-99 mg/dL
Frecuencia relativa fi Proporción sobre el total: ni / n 12/50 = 0,24 (24%)
Frecuencia absoluta acumulada Ni Suma de frecuencias absolutas hasta ese valor Hasta 99 mg/dL: 12 + 20 = 32 pacientes
Frecuencia relativa acumulada Fi Proporción acumulada hasta ese valor 32/50 = 0,64 (64%)

La frecuencia relativa acumulada es especialmente útil porque permite leer directamente los percentiles. Por ejemplo, el valor de la variable en el que la frecuencia relativa acumulada alcanza el 75% es el percentil 75 (también llamado tercer cuartil).

Nota

En variables continuas, el número de intervalos se suele estimar con la regla de Sturges: k ≈ 1 + 3,322 × log₁₀(n), donde n es el tamaño de la muestra.
Para n = 100, k ≈ 8 intervalos.
Es una aproximación orientativa, no una norma absoluta.

2.3. Representación gráfica de datos

Un gráfico bien elegido transmite en un vistazo lo que una tabla de cien filas no puede. La elección del gráfico depende del tipo de variable y de qué aspecto se quiere comunicar.

2.3.1. Gráficos para variables cualitativas

El diagrama de barras representa cada categoría como una barra cuya altura es proporcional a su frecuencia. Las barras no se tocan entre sí: reflejan que las categorías son entidades separadas sin continuidad entre ellas. Es el gráfico estándar para variables nominales y ordinales.

El diagrama de sectores (o gráfico de tarta) divide un círculo en sectores proporcionales a la frecuencia de cada categoría. Es útil para mostrar proporciones de un todo, pero pierde eficacia cuando hay más de cinco o seis categorías.

2.3.2. Gráficos para variables cuantitativas

El histograma representa la distribución de una variable continua. Los datos se agrupan en intervalos y cada intervalo se representa como una barra. A diferencia del diagrama de barras, las barras del histograma se tocan. Los intervalos son contiguos y no hay espacio entre ellos. La altura de cada barra representa la frecuencia del intervalo.

El polígono de frecuencias conecta los puntos medios de las barras del histograma con líneas rectas. Permite superponer varias distribuciones en un mismo gráfico, lo que facilita la comparación.

El diagrama de caja (boxplot) representa gráficamente los cinco estadísticos de resumen más importantes:

  • Valor mínimo.
  • Primer cuartil (Q1).
  • Mediana (Q2).
  • Tercer cuartil (Q3).
  • Valor máximo.
Mínimo Q1 Mediana (Q2) Q3 Máximo Outlier RIC = Q3 − Q1

Los valores atípicos (denominados outliers) se representan como puntos separados. Es especialmente útil para comparar la distribución de una variable entre grupos.

Error frecuente

Histograma y diagrama de barras no son intercambiables. El histograma es para variables cuantitativas continuas agrupadas en intervalos (las barras se tocan porque los datos son continuos). El diagrama de barras es para variables cualitativas o cuantitativas discretas (las barras no se tocan porque las categorías están separadas).
Usarlos al revés es un error conceptual.

Tabla 2.2. Tipos de gráfico según el tipo de variable
Gráfico Tipo de variable Qué muestra Cuándo usarlo
Diagrama de barras Cualitativa / discreta Frecuencia por categoría Comparar categorías entre sí
Diagrama de sectores Cualitativa nominal Proporción de cada categoría sobre el total Pocas categorías (≤ 5), énfasis en partes de un todo
Histograma Cuantitativa continua Distribución por intervalos Ver forma de la distribución, detectar asimetría
Polígono de frecuencias Cuantitativa continua Forma de la distribución Comparar dos o más distribuciones en el mismo gráfico
Diagrama de caja Cuantitativa continua u ordinal Mediana, cuartiles, rango, outliers Comparar grupos, detectar valores atípicos

2.4. Medidas de centralización

Las medidas de centralización describen el valor típico o central de la distribución. Las tres principales son la media, la mediana y la moda.

2.4.1. Media aritmética

La media aritmética es la suma de todos los valores dividida entre el número de observaciones. Es el estadístico de centralización más informativo cuando la distribución es simétrica y no hay valores extremos ya que utiliza toda la información de los datos.

Su debilidad reside en que, al usar todos los valores, es muy sensible a los extremos. Una sola observación inusualmente alta o baja puede desplazar la media de forma sustancial, haciendo que deje de representar al grupo.

Relevancia clínica

La presión arterial sistólica media de una consulta de hipertensión puede ser 152 mmHg. Si un paciente en crisis hipertensiva tiene 240 mmHg, la media del grupo sube aunque el resto esté controlado. En ese caso, la mediana refleja mejor la situación del grupo.

2.4.2. Mediana

La mediana es el valor que divide la distribución ordenada en dos mitades iguales (el 50% de los datos está por debajo y el 50% por encima). Si el número de observaciones es impar, la mediana es el valor central. Si es par, es la media de los dos valores centrales.

La mediana es robusta frente a los valores extremos. Un outlier no la desplaza sustancialmente, al contrario que pasaba con la media. Por eso es el estadístico de elección cuando la distribución es asimétrica, cuando hay valores extremos o cuando se trabaja con variables ordinales.

2.4.3. Moda

La moda es el valor que aparece con mayor frecuencia. En variables cualitativas es el único estadístico de centralización válido. En variables cuantitativas continuas, la moda se estima como el intervalo de mayor frecuencia en el histograma.

Una distribución puede tener una moda (unimodal), dos modas (bimodal) o más. Una distribución bimodal suele indicar que la muestra mezcla dos subpoblaciones distintas, lo que tiene implicaciones clínicas importantes.

Tabla 2.3. Medidas de centralización: media, mediana y moda
Medida Definición Sensible a outliers Cuándo usarla
Media Suma de valores / n Distribución simétrica sin outliers, variables cuantitativas
Mediana Valor central de la distribución ordenada No Distribución asimétrica, outliers, variables ordinales
Moda Valor más frecuente No Variables cualitativas; detectar bimodalidad

2.5. Medidas de posición: percentiles y cuartiles

Los percentiles dividen la distribución ordenada en cien partes iguales. El percentil p es el valor por debajo del cual se encuentra el p% de las observaciones. Los percentiles son valores de la variable.

Los cuartiles son los percentiles 25, 50 y 75, designados Q1, Q2 y Q3. Q2 coincide con la mediana. El rango intercuartílico (RIC) es la diferencia Q3 – Q1 y contiene el 50% central de los datos. Es la medida de dispersión natural cuando se usa la mediana como centralización.

Relevancia clínica

Las tablas de crecimiento infantil se expresan en percentiles. Un niño en el percentil 10 de peso tiene un peso igual o superior al 10% de los niños de su edad, e inferior al 90% restante.

Los percentiles relevantes en la práctica clínica dependen del contexto. En pediatría se usan habitualmente los percentiles 3, 10, 25, 50, 75, 90 y 97. En laboratorio clínico, los valores de referencia se definen frecuentemente como el intervalo entre los percentiles 2,5 y 97,5 de la población sana.

2.6. Medidas de dispersión

Conocer el centro de una distribución no es suficiente. Dos grupos pueden tener la misma media y distribuciones completamente distintas. Un grupo puede estar muy concentrado alrededor del centro, y el otro muy disperso. Las medidas de dispersión cuantifican esa variabilidad.

2.6.1. Rango

El rango es la diferencia entre el valor máximo y el mínimo. Es fácil de calcular pero muy sensible a los valores extremos (un solo outlier lo altera completamente). Se usa como descripción rápida inicial, pero rara vez como estadístico principal.

2.6.2. Varianza y desviación típica

La varianza mide la dispersión promedio de los datos respecto a la media. Es la media de los cuadrados de las diferencias entre cada valor y la media. Al elevar al cuadrado, las diferencias positivas y negativas no se anulan y los valores extremos pesan más.

La desviación típica (o desviación estándar, DE o SD) es la raíz cuadrada de la varianza. Tiene la misma unidad que la variable original, lo que la hace interpretable directamente. En una distribución normal, aproximadamente el 68% de los datos cae dentro de ±1 DE de la media, y el 95% dentro de ±2 DE.

Idea clave

La media y la desviación típica son inseparables. Reportar solo la media sin la desviación típica es como decir que el centro de una ciudad está en tal coordenada sin decir cuánto se extiende. En artículos médicos, el formato estándar es media ± DE o media (DE).

2.6.3. Coeficiente de variación

El coeficiente de variación (CV) expresa la desviación típica como porcentaje de la media:

CV = (DE/media) × 100.

Al ser adimensional, permite comparar la dispersión de variables con distintas unidades o distintas medias.

Relevancia clínica

Un laboratorio mide la glucemia (media 95 mg/dL, DE 8 mg/dL) y la albúmina (media 4,2 g/dL, DE 0,4 g/dL). Las desviaciones típicas no son comparables porque las unidades y las magnitudes son distintas. Los coeficientes de variación sí lo son: CV glucemia = 8,4%; CV albúmina = 9,5%. La albúmina presenta ligeramente más variabilidad relativa.

Tabla 2.4. Medidas de dispersión
Medida Fórmula Sensible a outliers Uso principal
Rango Máx − Mín Muy Descripción rápida inicial
RIC Q3 − Q1 No Acompaña a la mediana; distribuciones asimétricas
Varianza Σ(xi − x̄)² / (n−1) Base de cálculo; no interpretable directamente
Desviación típica √Varianza Acompaña a la media; misma unidad que la variable
CV (DE / media) × 100 Moderada Comparar dispersión entre variables distintas

2.7. Medidas de forma. Asimetría y curtosis

Una vez conocidos el centro y la dispersión, las medidas de forma describen la geometría de la distribución. Son especialmente importantes porque condicionan qué pruebas estadísticas se pueden aplicar en el análisis inferencial.

2.7.1. Asimetría

La asimetría (skewness) mide si la distribución es simétrica o si tiene una cola más larga hacia un lado.

En una distribución simétrica, la media, la mediana y la moda coinciden o están muy próximas. El histograma tiene forma de campana equilibrada.

En una distribución con asimetría positiva (cola derecha), hay pocos valores muy altos que estiran la distribución hacia la derecha. La media queda por encima de la mediana. Es la forma habitual de variables como el ingreso, el tiempo hasta un evento o la concentración de marcadores biológicos en muchas enfermedades.

En una distribución con asimetría negativa (cola izquierda), hay pocos valores muy bajos que estiran la distribución hacia la izquierda. La media queda por debajo de la mediana.

Distribución simétrica Media = mediana = moda Asimetría positiva (cola derecha) Moda Mediana Media Cola larga Asimetría negativa (cola izquierda) Moda Mediana Media
Idea clave

En distribuciones asimétricas, la relación entre media y mediana indica el sentido de la asimetría: si la media es mayor a la mediana, la asimetría es positiva (cola derecha); si la media es menor a la mediana, es negativa (cola izquierda). Esta regla práctica permite detectar asimetría sin calcular el coeficiente formal.

2.7.2. Curtosis

La curtosis mide el apuntamiento de la distribución y el peso de las colas en comparación con una distribución normal. Una distribución leptocúrtica tiene un pico más agudo y colas más pesadas que la normal.

Una distribución platicúrtica tiene un pico más achatado y colas más ligeras. La distribución normal se denomina mesocúrtica y sirve como referencia.

En la práctica médica, la curtosis es menos utilizada que la asimetría, pero importa cuando se evalúa si los datos siguen una distribución normal, requisito de muchas pruebas inferenciales.

2.8. Cómo elegir el estadístico adecuado

La elección del estadístico de resumen depende del tipo de variable y de la forma de la distribución. Esta tabla condensa la regla de decisión:

Tabla 2.5. Elección del estadístico según tipo de variable y distribución
Tipo de variable Distribución Centralización Dispersión Gráfico
Cualitativa nominal Moda Frecuencias (%) Barras / sectores
Cualitativa ordinal Mediana RIC / percentiles Barras / caja
Cuantitativa Simétrica Media Desviación típica Histograma / caja
Cuantitativa Asimétrica u outliers Mediana RIC Histograma / caja
Para examen

Pregunta frecuente: "¿Qué medida de centralización y dispersión usarías para describir los días de ingreso hospitalario?"
Los días de ingreso son una variable cuantitativa discreta con distribución típicamente asimétrica positiva (la mayoría de ingresos son cortos, pero algunos son muy largos). La respuesta correcta es mediana e RIC, no media y desviación típica. El examinador busca que apliques el criterio de la distribución, no que respondas "media" por defecto.

Relación con otro tema

Las medidas de forma (asimetría y curtosis) determinan si los datos pueden analizarse con pruebas paramétricas, que asumen distribución normal, o si hay que recurrir a alternativas no paramétricas. Este punto se desarrolla en Tema 5 · Contraste de hipótesis y en Tema 7 · Métodos no paramétricos.

Dr. Vicente Molina Nácher
Autor y revisión médica

Dr. Vicente Molina

Licenciado en Medicina
Especialista en Angiología y Cirugía Vascular

Editor y revisor de contenidos en Apuntes de Medicina.

Ver perfil del autor

Herramientas

Banco de preguntas — Próximamente