Why this matters for ML
Nunca tienes "la población": tienes una muestra. Toda la práctica de ML —estimar métricas, comparar modelos, entender por qué el promedio de muchos datos es estable— descansa en teoría de muestreo. El Central Limit Theorem explica por qué la Gaussian aparece en todos lados y por qué los promedios (y SGD con mini-batches) se comportan tan bien. La inferencia te da el lenguaje para decir "esta mejora es real, no ruido".
Concepts covered
- Population vs. sample; estimadores
- Sampling distribution y standard error
- Law of Large Numbers (LLN)
- Central Limit Theorem (CLT)
- Confidence intervals
- Hypothesis testing (idea) y p-values
- Bias–variance de un estimador
Intuition first
🎬 Stat 110 Lecture 14 (LLN, CLT). StatQuest "The Central Limit Theorem". Khan "Statistics". Idea: promediar muchas observaciones reduce el ruido y produce una distribución normal, casi sin importar la original.
Theory & key results
Population vs. sample: la población es lo que quieres conocer (parámetro ); la muestra es lo que observas. Un estimador es una función de la muestra (p. ej. la media muestral ).
Sampling distribution: es aleatorio (depende de qué muestra tocó). Su desviación estándar es el standard error. Para la media: → más datos, menos error (a ritmo ).
Law of Large Numbers: cuando . El promedio muestral converge al verdadero. (Justifica estimar expectations por muestreo — Monte Carlo.)
Central Limit Theorem (la estrella): para i.i.d. con media y varianza (¡de casi cualquier distribución!), Por eso la Gaussian es "universal": cualquier cosa que sea suma/promedio de muchos efectos pequeños tiende a normal. Explica por qué el ruido se modela gaussiano y por qué los gradientes de mini-batch (promedios) son estimadores razonables del gradiente verdadero.
Confidence interval (CI): un rango que contiene el parámetro con cierta confianza. Para la media (n grande): , con para 95%. Interpretación correcta: "si repitiera el muestreo muchas veces, el 95% de los CIs contendrían ".
Hypothesis testing: planteas (hipótesis nula, "no hay efecto") y mides qué tan sorprendentes son tus datos si fuera cierta. El p-value es esa probabilidad; si es muy chico (p. ej. <0.05), rechazas . Útil para "¿el modelo B es de verdad mejor que A?". (Cuidado con abusar de p-values.)
Bias–variance de un estimador: ; un buen estimador tiene bias y varianza bajos. Esto prefigura el bias–variance tradeoff de modelos (subajuste vs. sobreajuste).
Worked example
Población con , . Tomo muestras de . El CLT dice , así que . Un CI 95% típico: . Si observo , el intervalo no contiene 50 por poco → evidencia (débil) de que .
Notebook exercises (by hand)
- de la media para , .
- ¿Cuántas muestras necesito para reducir el SE a la mitad? (Pista: .)
- Construye un CI 95% para , , .
- Enuncia el CLT con tus palabras y por qué "casi cualquier distribución".
- Explica la diferencia entre "el parámetro está en el CI con prob 95%" (incorrecto) y la interpretación correcta.
- Relaciona LLN con estimar por Monte Carlo (Calc-04).
Python lab
import numpy as np
import matplotlib.pyplot as plt
rng = np.random.default_rng(0)
# CLT: promedios de una distribución MUY no normal (exponencial) se vuelven normales
def sample_means(n, trials=100_000):
data = rng.exponential(scale=1.0, size=(trials, n)) # media 1, muy sesgada
return data.mean(axis=1)
for n in [1, 5, 30]:
m = sample_means(n)
print(f"n={n:2d}: media~{m.mean():.3f} SE~{m.std():.3f} (teórico {1/np.sqrt(n):.3f})")
plt.hist(sample_means(30), bins=60, density=True) # ~ campana
plt.title("CLT: medias de exponenciales (n=30)"); plt.savefig("prob08.png")
# LLN: la media muestral converge
x = rng.normal(50, 10, 100_000)
running = np.cumsum(x)/np.arange(1, len(x)+1)
print("media con 100:", running[99], " con 100k:", running[-1]) # -> 50
Examen final 📝
Intenta cada nivel antes de abrir las soluciones.
🟡 Medio
- de la media para , .
- ¿Cuánto debo aumentar para reducir el SE a un tercio?
🟠 Medio-difícil
- Construye un CI 95% para , , .
- Usando el CLT, aproxima para muestras de de una población con , .
🔴 Difícil
- Demuestra, usando propiedades de la varianza (Prob-04), que para muestras i.i.d., y explica por qué esto justifica que el gradiente de mini-batch de tamaño tiene varianza .
- Explica la interpretación frecuentista correcta de un intervalo de confianza del 95% y por qué la afirmación "hay 95% de probabilidad de que esté en este intervalo" es técnicamente incorrecta. ¿Cómo lo reformularía un bayesiano (credible interval)?
✅ Soluciones
- .
- ; para hay que multiplicar por .
- ; CI .
- ; ; .
- (usa independencia). El gradiente de mini-batch es un promedio de gradientes por-ejemplo i.i.d., así que su varianza escala como : batches grandes → gradiente más estable.
- Correcto: "si repitiera el muestreo y construyera el CI muchas veces, el 95% de esos intervalos contendrían el verdadero ". El parámetro es fijo (no aleatorio), así que no tiene "probabilidad de estar" en un intervalo concreto; lo aleatorio es el intervalo. Un bayesiano trata como aleatorio con un posterior y sí puede decir "" (credible interval).