Prob-05 — Common distributions

Cada distribución es una suposición sobre tus datos, y elegir la correcta define tu modelo: Bernoulli/Categorical modelan etiquetas de clasificación (y llevan a la cross-entropy), la Gaussian modela ruido continuo (y lleva al error cuadrático), la Poisson modela conteos. Reconocer "esto se distribuye como X" es lo que conecta un problema real con la matemática correcta.

Why this matters for ML

Cada distribución es una suposición sobre tus datos, y elegir la correcta define tu modelo: Bernoulli/Categorical modelan etiquetas de clasificación (y llevan a la cross-entropy), la Gaussian modela ruido continuo (y lleva al error cuadrático), la Poisson modela conteos. Reconocer "esto se distribuye como X" es lo que conecta un problema real con la matemática correcta.

Concepts covered

  • Bernoulli y Binomial
  • Categorical y Multinomial
  • Poisson
  • Uniform (discreta/continua)
  • Gaussian / Normal (la más importante)
  • Exponential
  • Qué modela cada una en ML

Intuition first

🎬 Stat 110 Lectures 5 y 13 (binomial, normal). StatQuest tiene videos cortos por distribución. MML 6.5.

Theory & key results

Bernoulli(pp): un ensayo con éxito (1) prob. pp o fracaso (0). E=p\mathbb{E}=p, Var=p(1p)\text{Var}=p(1-p). → Modela una etiqueta binaria; base de logistic regression.

Binomial(n,pn,p): número de éxitos en nn Bernoulli independientes. P(X=k)=(nk)pk(1p)nkP(X=k)=\binom{n}{k}p^k(1-p)^{n-k}. E=np\mathbb{E}=np, Var=np(1p)\text{Var}=np(1-p).

Categorical(π\boldsymbol\pi): un resultado entre KK clases con probs π1,,πK\pi_1,\dots,\pi_K (πk=1\sum\pi_k=1). → La salida de un softmax; base de clasificación multiclase. (Multinomial = versión con nn ensayos.)

Poisson(λ\lambda): número de eventos raros en un intervalo. P(X=k)=λkeλk!P(X=k)=\frac{\lambda^k e^{-\lambda}}{k!}. E=Var=λ\mathbb{E}=\text{Var}=\lambda. → Conteos (clicks, llegadas).

Uniform: todos los valores igual de probables. Continua en [a,b][a,b]: f(x)=1baf(x)=\frac{1}{b-a}, E=a+b2\mathbb{E}=\frac{a+b}{2}. → Inicialización, priors no informativos.

Gaussian / Normal(μ,σ2\mu,\sigma^2) — LA REINA: f(x)=12πσ2exp ⁣((xμ)22σ2),E=μ, Var=σ2.f(x)=\frac{1}{\sqrt{2\pi\sigma^2}}\exp!\left(-\frac{(x-\mu)^2}{2\sigma^2}\right),\quad \mathbb{E}=\mu,\ \text{Var}=\sigma^2. Por qué domina el ML: (1) el CLT (Prob-08) hace que sumas/promedios tiendan a normal; (2) modela ruido de forma natural; (3) asumir ruido gaussiano + MLE da exactamente el error cuadrático (Prob-07); (4) matemática súper tratable. La standard normal es N(0,1)\mathcal{N}(0,1).

Exponential(λ\lambda): tiempo entre eventos Poisson. f(x)=λeλxf(x)=\lambda e^{-\lambda x} (x0x\ge0), E=1/λ\mathbb{E}=1/\lambda. Propiedad "sin memoria".

Worked example

Binomial: 10 lanzamientos de moneda justa, P(exactamente 3 caras)=(103)(0.5)3(0.5)7=120(0.5)100.117P(\text{exactamente 3 caras})=\binom{10}{3}(0.5)^3(0.5)^7=120\cdot(0.5)^{10}\approx0.117. Media esperada de caras: np=5np=5.

Gaussian: para N(0,1)\mathcal{N}(0,1), ~68% de la masa cae en [1,1][-1,1], ~95% en [2,2][-2,2] (regla 68–95–99.7).

Notebook exercises (by hand)

  1. Binomial(5,0.35, 0.3): P(X=2)P(X=2).
  2. Media y varianza de Bernoulli(0.70.7).
  3. Poisson(λ=2\lambda=2): P(X=0)P(X=0) y P(X=1)P(X=1).
  4. Para N(μ,σ2)\mathcal{N}(\mu,\sigma^2), muestra que Z=(Xμ)/σZ=(X-\mu)/\sigma es N(0,1)\mathcal{N}(0,1) (standardization).
  5. Empareja cada tarea de ML con su distribución: (a) clasificación binaria, (b) multiclase, (c) regresión con ruido, (d) contar eventos.
  6. ¿Por qué asumir ruido gaussiano es "razonable por defecto"? (Menciona el CLT.)

Python lab

import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

# binomial P(X=3) con n=10, p=0.5
print("binom:", stats.binom.pmf(3, 10, 0.5))          # ~0.117
# poisson P(X=0), P(X=1) con lambda=2
print("poisson:", stats.poisson.pmf([0,1], 2))
# regla 68-95-99.7 de la normal estándar
for k in [1,2,3]:
    print(f"±{k}σ:", stats.norm.cdf(k) - stats.norm.cdf(-k))

# dibuja algunas densidades
x = np.linspace(-5, 5, 300)
for mu, sd in [(0,1),(0,2),(1,0.5)]:
    plt.plot(x, stats.norm.pdf(x, mu, sd), label=f"N({mu},{sd}²)")
plt.legend(); plt.savefig("prob05.png")

# muestrea y verifica media/varianza empíricas
s = np.random.normal(1, 2, 500_000)
print("media~1:", s.mean(), " var~4:", s.var())

Examen final 📝

Intenta cada nivel antes de abrir las soluciones.

🟡 Medio

  1. Binomial(8,0.258, 0.25): P(X=2)P(X=2) y E[X]\mathbb{E}[X].
  2. Para N(10,4)\mathcal{N}(10, 4): ¿qué porcentaje de la masa cae en [8,12][8,12]?

🟠 Medio-difícil

  1. Demuestra que la binomial es suma de nn Bernoulli independientes y usa eso para obtener E=np\mathbb{E}=np y Var=np(1p)\text{Var}=np(1-p).
  2. Deriva E[X]\mathbb{E}[X] y Var[X]\text{Var}[X] de una Bernoulli(pp) desde la definición.

🔴 Difícil

  1. Deriva la media E[X]=μ\mathbb{E}[X]=\mu de una N(μ,σ2)\mathcal{N}(\mu,\sigma^2) integrando (usa simetría / cambio de variable z=(xμ)/σz=(x-\mu)/\sigma).
  2. Explica y demuestra por qué maximizar la likelihood gaussiana de los residuos equivale a minimizar la MSE (esboza; conexión completa en Prob-07). ¿Qué distribución de ruido daría en cambio la MAE (error absoluto)?
✅ Soluciones
  1. (82)(0.25)2(0.75)6=280.06250.17800.311\binom{8}{2}(0.25)^2(0.75)^6=28\cdot0.0625\cdot0.1780\approx0.311; E=np=2\mathbb{E}=np=2.
  2. [8,12]=μ±σ[8,12]=\mu\pm\sigma (σ=2) ⇒ ~68% (regla 68–95–99.7).
  3. X=i=1nBiX=\sum_{i=1}^n B_i con BiBernoulli(p)B_i\sim\text{Bernoulli}(p) indep. E[X]=E[Bi]=np\mathbb{E}[X]=\sum\mathbb{E}[B_i]=np; por independencia Var(X)=Var(Bi)=np(1p)\text{Var}(X)=\sum\text{Var}(B_i)=np(1-p).
  4. E[X]=1p+0(1p)=p\mathbb{E}[X]=1\cdot p+0\cdot(1-p)=p. E[X2]=p\mathbb{E}[X^2]=p (ya que X2=XX^2=X), Var=pp2=p(1p)\text{Var}=p-p^2=p(1-p).
  5. E[X]=x12πσe(xμ)2/2σ2dx\mathbb{E}[X]=\int x\frac{1}{\sqrt{2\pi}\sigma}e^{-(x-\mu)^2/2\sigma^2}dx. Con z=(xμ)/σz=(x-\mu)/\sigma: =(μ+σz)ϕ(z)dz=μϕ+σzϕ(z)dz=μ1+σ0=μ=\int(\mu+\sigma z)\phi(z)dz=\mu\int\phi+\sigma\int z\phi(z)dz=\mu\cdot1+\sigma\cdot0=\mu (la 2ª integral es 0 por simetría impar).
  6. La log-likelihood gaussiana de yi=f(xi)+εiy_i=f(x_i)+\varepsilon_i, εN(0,σ2)\varepsilon\sim\mathcal N(0,\sigma^2), es const12σ2(yif(xi))2\text{const}-\frac{1}{2\sigma^2}\sum(y_i-f(x_i))^2 ⇒ maximizarla = minimizar ()2\sum(\cdot)^2 = MSE. Un ruido Laplace (colas más pesadas) da la MAE (yf|y-f|), más robusta a outliers.