Prob-04 — Expectation, variance, moments

La expectation es el promedio teórico: la loss que minimizas es una expectation ("expected risk"), y las predicciones óptimas suelen ser expectations. La variance mide incertidumbre/dispersión — clave en el trade-off bias–variance, en la inicialización de redes y en normalización. Estos dos números resumen una distribución entera.

Why this matters for ML

La expectation es el promedio teórico: la loss que minimizas es una expectation ("expected risk"), y las predicciones óptimas suelen ser expectations. La variance mide incertidumbre/dispersión — clave en el trade-off bias–variance, en la inicialización de redes y en normalización. Estos dos números resumen una distribución entera.

Concepts covered

  • Expectation E[X]\mathbb{E}[X] (discreta y continua)
  • Linearity of expectation
  • Law of the unconscious statistician (LOTUS)
  • Variance y standard deviation
  • Moments (y momentos centrales)
  • Propiedades bajo transformaciones lineales

Intuition first

🎬 Stat 110 Lecture 6. Idea: la expectation es el "centro de masa" de la distribución; la varianza, cuánto se dispersa alrededor.

Theory & key results

Expectation (media): E[X]=xxp(x)  (discreta),E[X]=xf(x)dx  (continua).\mathbb{E}[X]=\sum_x x,p(x)\ \ (\text{discreta}),\qquad \mathbb{E}[X]=\int x,f(x),dx\ \ (\text{continua}). Es un promedio ponderado por probabilidad.

Linearity of expectation (potentísima): E[aX+bY+c]=aE[X]+bE[Y]+c,\mathbb{E}[aX+bY+c]=a,\mathbb{E}[X]+b,\mathbb{E}[Y]+c, siempre, incluso si X,YX,Y no son independientes. Simplifica muchísimos cálculos.

LOTUS: para calcular E[g(X)]\mathbb{E}[g(X)] no necesitas la distribución de g(X)g(X): E[g(X)]=xg(x)p(x)\mathbb{E}[g(X)]=\sum_x g(x)p(x) (o la integral).

Variance: Var(X)=E[(Xμ)2]=E[X2](E[X])2,μ=E[X].\text{Var}(X)=\mathbb{E}[(X-\mu)^2]=\mathbb{E}[X^2]-(\mathbb{E}[X])^2,\quad \mu=\mathbb{E}[X]. Standard deviation σ=Var(X)\sigma=\sqrt{\text{Var}(X)} (mismas unidades que XX).

Propiedades:

  • Var(aX+b)=a2Var(X)\text{Var}(aX+b)=a^2\text{Var}(X) (el +b+b no afecta la dispersión).
  • Si X,YX,Y independientes: Var(X+Y)=Var(X)+Var(Y)\text{Var}(X+Y)=\text{Var}(X)+\text{Var}(Y).

Moments: el kk-ésimo moment es E[Xk]\mathbb{E}[X^k]; el kk-ésimo central moment es E[(Xμ)k]\mathbb{E}[(X-\mu)^k]. El 1º es la media, el 2º central es la varianza, el 3º (normalizado) es skewness, el 4º kurtosis. Resumen la forma de la distribución.

Worked example

Dado justo, X{1,,6}X\in{1,\dots,6}. E[X]=16(1++6)=3.5\mathbb{E}[X]=\frac{1}{6}(1+\dots+6)=3.5. E[X2]=16(1+4+9+16+25+36)=91615.17\mathbb{E}[X^2]=\frac{1}{6}(1+4+9+16+25+36)=\frac{91}{6}\approx15.17. Var(X)=15.173.52=15.1712.25=2.917\text{Var}(X)=15.17-3.5^2=15.17-12.25=2.917; σ1.71\sigma\approx1.71.

Linearity: si Y=2X+1Y=2X+1, E[Y]=2(3.5)+1=8\mathbb{E}[Y]=2(3.5)+1=8 y Var(Y)=4(2.917)=11.67\text{Var}(Y)=4(2.917)=11.67.

Notebook exercises (by hand)

  1. E[X]\mathbb{E}[X] y Var(X)\text{Var}(X) para XX = número de caras en 2 lanzamientos.
  2. Usando linearity, E[X+Y]\mathbb{E}[X+Y] para dos dados (sin enumerar los 36 casos).
  3. Demuestra Var(X)=E[X2](E[X])2\text{Var}(X)=\mathbb{E}[X^2]-(\mathbb{E}[X])^2 desde la definición.
  4. Para f(x)=2xf(x)=2x en [0,1][0,1]: calcula E[X]\mathbb{E}[X] y Var(X)\text{Var}(X) (integrales, LOTUS).
  5. Muestra Var(aX+b)=a2Var(X)\text{Var}(aX+b)=a^2\text{Var}(X).
  6. Explica el trade-off bias–variance en una frase, usando "varianza = sensibilidad al dataset".

Python lab

import numpy as np, sympy as sp

# dado justo
x = np.arange(1,7); p = np.ones(6)/6
E  = (x*p).sum()
E2 = (x**2*p).sum()
print("E[X]:", E, " Var:", E2 - E**2)          # 3.5, 2.9167

# continua con sympy
t = sp.symbols("t")
f = 2*t
EX  = sp.integrate(t*f, (t,0,1))
EX2 = sp.integrate(t**2*f, (t,0,1))
print("E[X]:", EX, " Var:", sp.simplify(EX2 - EX**2))

# verifica por muestreo + linearity/var de suma independiente
rng = np.random.default_rng(0)
a = rng.integers(1,7,1_000_000); b = rng.integers(1,7,1_000_000)
print("Var(a):", a.var(), " Var(a+b):", (a+b).var(), " suma:", a.var()+b.var())

Examen final 📝

Intenta cada nivel antes de abrir las soluciones.

🟡 Medio

  1. E[X]\mathbb{E}[X] y Var(X)\text{Var}(X) para XX = valor de un dado justo.
  2. Si E[X]=3\mathbb{E}[X]=3, Var(X)=2\text{Var}(X)=2, calcula E[2X+1]\mathbb{E}[2X+1] y Var(2X+1)\text{Var}(2X+1).

🟠 Medio-difícil

  1. Para f(x)=3x2f(x)=3x^2 en [0,1][0,1]: calcula E[X]\mathbb{E}[X] y Var(X)\text{Var}(X).
  2. Usando linearity, calcula E[X1++Xn]\mathbb{E}[X_1+\dots+X_n] donde cada XiBernoulli(p)X_i\sim\text{Bernoulli}(p) (te sale la media de una binomial sin sumar).

🔴 Difícil

  1. Demuestra la fórmula de bias–variance para el error cuadrático esperado de un estimador: E[(θ^θ)2]=Var(θ^)+bias(θ^)2\mathbb{E}[(\hat\theta-\theta)^2]=\text{Var}(\hat\theta)+\text{bias}(\hat\theta)^2.
  2. Demuestra que Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)\text{Var}(X+Y)=\text{Var}(X)+\text{Var}(Y)+2\text{Cov}(X,Y), y explica cuándo el término de covarianza desaparece (relación con Prob-06).
✅ Soluciones
  1. E[X]=3.5\mathbb{E}[X]=3.5; E[X2]=91/6\mathbb{E}[X^2]=91/6; Var=91/612.25=35/122.917\text{Var}=91/6-12.25=35/12\approx2.917.
  2. E[2X+1]=7\mathbb{E}[2X+1]=7; Var(2X+1)=42=8\text{Var}(2X+1)=4\cdot2=8.
  3. E[X]=01x3x2dx=3/4\mathbb{E}[X]=\int_0^1 x\cdot3x^2dx=3/4. E[X2]=01x23x2dx=3/5\mathbb{E}[X^2]=\int_0^1 x^2\cdot3x^2dx=3/5. Var=3/59/16=3/800.0375\text{Var}=3/5-9/16=3/80\approx0.0375.
  4. E[Xi]=E[Xi]=np\mathbb{E}[\sum X_i]=\sum\mathbb{E}[X_i]=np (linearity, sin necesitar independencia).
  5. Sea μ=E[θ^]\mu=\mathbb{E}[\hat\theta]. E[(θ^θ)2]=E[(θ^μ+μθ)2]=E[(θ^μ)2]+2(μθ)E[θ^μ]+(μθ)2\mathbb{E}[(\hat\theta-\theta)^2]=\mathbb{E}[(\hat\theta-\mu+\mu-\theta)^2]=\mathbb{E}[(\hat\theta-\mu)^2]+2(\mu-\theta)\mathbb{E}[\hat\theta-\mu]+(\mu-\theta)^2. El término cruzado es 0 (E[θ^μ]=0\mathbb{E}[\hat\theta-\mu]=0), quedando Var(θ^)+bias2\text{Var}(\hat\theta)+\text{bias}^2.
  6. Var(X+Y)=E[(X+Y)2](E[X+Y])2\text{Var}(X+Y)=\mathbb{E}[(X+Y)^2]-(\mathbb{E}[X+Y])^2; expandiendo aparece Var(X)+Var(Y)+2(E[XY]E[X]E[Y])=Var(X)+Var(Y)+2Cov(X,Y)\text{Var}(X)+\text{Var}(Y)+2(\mathbb{E}[XY]-\mathbb{E}[X]\mathbb{E}[Y])=\text{Var}(X)+\text{Var}(Y)+2\text{Cov}(X,Y). El término desaparece si X,YX,Y son independientes (o al menos no correlacionadas, Cov=0\text{Cov}=0).