La expectation es el promedio teórico: la loss que minimizas es una expectation ("expected risk"), y las predicciones óptimas suelen ser expectations. La variance mide incertidumbre/dispersión — clave en el trade-off bias–variance, en la inicialización de redes y en normalización. Estos dos números resumen una distribución entera.
Why this matters for ML
La expectation es el promedio teórico: la loss que minimizas es una expectation ("expected risk"), y las predicciones óptimas suelen ser expectations. La variance mide incertidumbre/dispersión — clave en el trade-off bias–variance, en la inicialización de redes y en normalización. Estos dos números resumen una distribución entera.
Concepts covered
Expectation E[X] (discreta y continua)
Linearity of expectation
Law of the unconscious statistician (LOTUS)
Variance y standard deviation
Moments (y momentos centrales)
Propiedades bajo transformaciones lineales
Intuition first
🎬 Stat 110 Lecture 6. Idea: la expectation es el "centro de masa" de la distribución; la varianza, cuánto se dispersa alrededor.
Theory & key results
Expectation (media):E[X]=x∑xp(x)(discreta),E[X]=∫xf(x)dx(continua).
Es un promedio ponderado por probabilidad.
Linearity of expectation (potentísima):E[aX+bY+c]=aE[X]+bE[Y]+c,siempre, incluso si X,Y no son independientes. Simplifica muchísimos cálculos.
LOTUS: para calcular E[g(X)] no necesitas la distribución de g(X): E[g(X)]=∑xg(x)p(x) (o la integral).
Variance:Var(X)=E[(X−μ)2]=E[X2]−(E[X])2,μ=E[X].Standard deviationσ=Var(X) (mismas unidades que X).
Propiedades:
Var(aX+b)=a2Var(X) (el +b no afecta la dispersión).
Si X,Yindependientes: Var(X+Y)=Var(X)+Var(Y).
Moments: el k-ésimo moment es E[Xk]; el k-ésimo central moment es E[(X−μ)k]. El 1º es la media, el 2º central es la varianza, el 3º (normalizado) es skewness, el 4º kurtosis. Resumen la forma de la distribución.
E[∑Xi]=∑E[Xi]=np (linearity, sin necesitar independencia).
Sea μ=E[θ^]. E[(θ^−θ)2]=E[(θ^−μ+μ−θ)2]=E[(θ^−μ)2]+2(μ−θ)E[θ^−μ]+(μ−θ)2. El término cruzado es 0 (E[θ^−μ]=0), quedando Var(θ^)+bias2.
Var(X+Y)=E[(X+Y)2]−(E[X+Y])2; expandiendo aparece Var(X)+Var(Y)+2(E[XY]−E[X]E[Y])=Var(X)+Var(Y)+2Cov(X,Y). El término desaparece si X,Y son independientes (o al menos no correlacionadas, Cov=0).