5.1. Definición de variable aleatoria
Hasta ahora se ha trabajado con sucesos: «el paciente está enfermo», «la prueba da positivo».
Una variable aleatoria asigna un número a cada resultado posible de un experimento aleatorio, lo que permite aplicar herramientas matemáticas (funciones, esperanza, varianza) que no tendrían sentido sobre categorías sueltas.
Variable aleatoria: función que asigna un valor numérico a cada resultado posible de un experimento aleatorio. Se denota habitualmente con una letra mayúscula (X, Y) y sus valores concretos con minúscula (x, y).
Por ejemplo, en el experimento «lanzar 3 monedas», el resultado concreto es una secuencia como cara-cara-cruz, pero la variable aleatoria X = «número de caras» traduce ese resultado al número 2. Esa traducción a números es lo que permite calcular promedios, varianzas y aplicar modelos teóricos.
Como ya se vio en el tema 1, las variables aleatorias pueden ser discretas (toman valores en un conjunto contable, normalmente números enteros) o continuas (toman cualquier valor en un intervalo). Este tema se centra en las discretas; las continuas, y en particular la distribución Normal, se desarrollan en el tema 7.
5.2. Función de masa de probabilidad
Para una variable aleatoria discreta, la función de masa de probabilidad (también llamada función de probabilidad) asigna a cada valor posible de la variable su probabilidad de ocurrencia.
Función de masa de probabilidad P(X=x): función que asigna, a cada valor x que puede tomar una variable aleatoria discreta X, la probabilidad de que X tome exactamente ese valor.
Para que una función sea una función de masa de probabilidad válida debe cumplir dos condiciones:
- Cada probabilidad debe ser mayor o igual que cero.
- La suma de las probabilidades de todos los valores posibles debe ser exactamente 1.
Si al construir una tabla de probabilidades las sumas no dan exactamente 1, hay un error en el planteamiento: se ha omitido algún valor posible o se ha calculado mal alguna probabilidad individual.
Esta comprobación es la primera verificación que debe hacerse siempre.
A partir de la función de masa se construye la función de distribución acumulada, F(x), que da la probabilidad de que la variable tome un valor menor o igual que x: F(x) = P(X ≤ x). Es la versión teórica de la frecuencia relativa acumulada que se vio en el tema 2.
5.3. Esperanza y varianza de una variable aleatoria
5.3.1. Esperanza matemática
La esperanza matemática (o valor esperado) de una variable aleatoria es el promedio teórico de sus valores, ponderado por la probabilidad de cada uno. Es el equivalente teórico de la media muestral que se vio en el tema 2, pero calculado sobre el modelo de probabilidad en lugar de sobre datos observados.
La esperanza no tiene por qué ser un valor que la variable pueda tomar realmente. Si X es el número de hijos por familia y E(X) = 1,8, ninguna familia tiene 1,8 hijos. La esperanza es un promedio teórico a largo plazo, no una predicción de un caso individual.
5.3.2. Varianza
La varianza de una variable aleatoria mide la dispersión teórica de sus valores respecto a la esperanza, igual que la varianza muestral medía la dispersión respecto a la media en el tema 2.
La desviación típica de la variable aleatoria es, como en el tema 2, la raíz cuadrada de la varianza.
5.4. Distribución Binomial
La distribución Binomial modela el número de «éxitos» obtenidos al repetir un experimento de dos resultados posibles un número fijo de veces.
Distribución Binomial: modelo de probabilidad para una variable aleatoria discreta que cuenta el número de éxitos en n ensayos independientes, cada uno con la misma probabilidad de éxito p.
Para que un experimento siga un modelo Binomial deben cumplirse cuatro condiciones simultáneas:
| Condición | Significado |
|---|---|
| Número fijo de ensayos (n) | Se sabe de antemano cuántas veces se repite el experimento |
| Dos resultados posibles | Cada ensayo termina en "éxito" o "fracaso" (dicotómico) |
| Probabilidad de éxito constante (p) | p no cambia de un ensayo a otro |
| Independencia entre ensayos | El resultado de un ensayo no afecta a la probabilidad del siguiente |
La esperanza y la varianza de una Binomial tienen fórmulas simplificadas directas: E(X) = n·p y Var(X) = n·p·(1−p). No es necesario aplicar la fórmula general de esperanza vista en 5.3 cuando se trabaja con un modelo Binomial, estas fórmulas específicas son siempre más rápidas.
El número de pacientes que responden a un tratamiento, de entre 20 tratados, cuando cada paciente tiene una probabilidad de respuesta del 70% independiente de los demás, sigue una distribución Binomial con n=20 y p=0,7.
Muestrear sin reposición de una población pequeña rompe la condición de independencia.
Extraer un individuo cambia ligeramente la composición de la población restante, por lo que la probabilidad del siguiente ensayo ya no es exactamente la misma. En poblaciones grandes este efecto es despreciable y se sigue aplicando Binomial como aproximación razonable; en poblaciones pequeñas, el modelo correcto sería hipergeométrico, fuera del alcance de este tema.
5.5. Distribución de Poisson
La distribución de Poisson modela el número de veces que ocurre un suceso raro en un intervalo fijo de tiempo, espacio o cualquier otra unidad continua, cuando esos sucesos ocurren de forma independiente y a una tasa media constante.
Distribución de Poisson: modelo de probabilidad para el número de ocurrencias de un suceso en un intervalo fijo, caracterizado por una tasa media de ocurrencia λ (lambda).
A diferencia de la Binomial, en Poisson no hay un «número de ensayos» definido. No contamos sobre un número fijo de intentos, sino sobre un intervalo continuo en el que el suceso puede ocurrir un número cualquiera de veces.
Una propiedad particular de Poisson es que la esperanza y la varianza coinciden: E(X) = Var(X) = λ. Esto es, además, una forma práctica de comprobar si un conjunto de datos reales es razonablemente compatible con un modelo de Poisson. Si la media muestral y la varianza muestral son muy distintas entre sí, el ajuste a Poisson es dudoso.
| Binomial | Poisson | |
|---|---|---|
| Qué cuenta | Éxitos en n ensayos fijos | Sucesos en un intervalo continuo |
| Parámetro(s) | n (ensayos) y p (probabilidad) | λ (tasa media de ocurrencia) |
| Ejemplo clínico | Respondedores entre 20 pacientes tratados | Número de infecciones nosocomiales por mes en una UCI |
El número de urgencias hospitalarias que llegan por hora en un servicio, cuando la afluencia es relativamente constante a lo largo del turno, se modela habitualmente como Poisson. Permite, por ejemplo, calcular la probabilidad de que lleguen más de 10 pacientes en una hora dada, información útil para dimensionar personal.
| Pregunta | Si la respuesta es sí |
|---|---|
| ¿Hay un número fijo y conocido de ensayos? | Candidato a Binomial |
| ¿Cada ensayo tiene exactamente dos resultados posibles? | Candidato a Binomial |
| ¿Se cuenta sobre un intervalo continuo sin número de ensayos definido? | Candidato a Poisson |
| ¿El suceso es raro y la tasa media es conocida o estimable? | Candidato a Poisson |
Pregunta frecuente: distinguir si un enunciado describe Binomial o Poisson.
Pista: si el enunciado da un número de ensayos ("de 50 pacientes...", "lanzando 10 veces...") es Binomial; si da una tasa por unidad de tiempo o espacio sin número de ensayos ("en promedio ocurren 3 casos por semana...") es Poisson.