Los datos reales son multivariados: muchas features que covarían. La covariance matrix resume cómo se relacionan todas las features entre sí — y es exactamente la matriz que PCA descompone (LA-10). La multivariate Gaussian es el modelo continuo multivariado por defecto (Gaussian mixtures, procesos gaussianos, inicialización). Aquí se casan probabilidad y linear algebra.
Why this matters for ML
Los datos reales son multivariados: muchas features que covarían. La covariance matrix resume cómo se relacionan todas las features entre sí — y es exactamente la matriz que PCA descompone (LA-10). La multivariate Gaussian es el modelo continuo multivariado por defecto (Gaussian mixtures, procesos gaussianos, inicialización). Aquí se casan probabilidad y linear algebra.
Concepts covered
Joint, marginal y conditional distributions
Independence de variables aleatorias
Covariance y correlation
Covariance matrix (conexión con LA)
Multivariate Gaussian (idea)
Intuition first
🎬 Stat 110 Lecture 7 (joint distributions) y Lecture 21 (multivariate normal). MML 6.4–6.5. Idea: una joint describe dos+ variables a la vez; marginal = "olvidar" una; conditional = "fijar" una.
Theory & key results
Joint distribution:p(x,y) (o f(x,y)) da la probabilidad conjunta. Debe sumar/integrar a 1 sobre todo el plano.
Marginal: "suma/integra fuera" una variable:
p(x)=y∑p(x,y)of(x)=∫f(x,y)dy.
Conditional:p(y∣x)=p(x)p(x,y) (Prob-02 en versión multivariada).
Independence:X⊥Y⇔p(x,y)=p(x)p(y) para todo x,y. Si son independientes, E[XY]=E[X]E[Y].
Covariance: cómo varían juntas dos variables:
Cov(X,Y)=E[(X−μX)(Y−μY)]=E[XY]−E[X]E[Y].
Positiva = suben juntas; negativa = una sube y la otra baja; 0 = no lineal-relacionadas. Importante: independencia ⇒ covarianza 0, pero covarianza 0 NO implica independencia (solo ausencia de relación lineal).
Correlation (covarianza normalizada, sin unidades):
ρXY=σXσYCov(X,Y)∈[−1,1].
Covariance matrix (para un vector aleatorio x∈Rn):
Σ=E[(x−μ)(x−μ)⊤],Σij=Cov(xi,xj).
Es simétrica y positive semidefinite (LA-08) — por eso PCA (eigendecomposition de Σ) siempre funciona y da direcciones ortogonales con varianzas ≥ 0. La diagonal son las varianzas de cada feature.
Multivariate Gaussian:N(μ,Σ) con densidad
f(x)=(2π)n/2∣Σ∣1/21exp(−21(x−μ)⊤Σ−1(x−μ)).
Fíjate cómo aparece todo lo aprendido: quadratic form (LA-08), inverse y determinant (LA-05), exp (Calc). Las curvas de nivel son elipses cuyos ejes son los eigenvectors de Σ.
Worked example
Dos features con Var(X)=4, Var(Y)=9, Cov(X,Y)=3.
Σ=[4339],ρ=493=63=0.5.Σ es simétrica; sus eigenvalues (positivos) dan las varianzas a lo largo de las direcciones principales → esas direcciones son justo los principal components de PCA.
Notebook exercises (by hand)
Joint discreta en una tabla 2×2: calcula marginales y verifica si X⊥Y.
Calcula Cov(X,Y) y ρ de la tabla anterior.
Da un ejemplo donde Cov(X,Y)=0 pero X,Y NO son independientes (pista: Y=X2 con X simétrica).
Escribe la covariance matrix de features con var 1, 1 y covarianza 0.8; ¿es PSD?
Muestra que Σ es simétrica desde su definición.
Relaciona: eigenvectors de Σ ↔ principal components (una frase, conecta con LA-10).
Python lab
import numpy as np
# datos con covarianza conocida
rng = np.random.default_rng(0)
Sigma_true = np.array([[4., 3.],[3., 9.]])
L = np.linalg.cholesky(Sigma_true) # muestrea gaussiana multivariada
X = (L @ rng.normal(size=(2, 100_000))).T
print("cov empírica:\n", np.round(np.cov(X, rowvar=False), 2))
print("correlación:\n", np.round(np.corrcoef(X, rowvar=False), 2))
# covarianza 0 pero NO independientes: Y = X^2
x = rng.normal(size=200_000); y = x**2
print("Cov(X, X^2) ~ 0:", np.round(np.cov(x, y)[0,1], 3)) # ~0, pero dependen
# Sigma es simétrica PSD -> eigenvalues >= 0 (conecta con PCA)
print("eigenvalues de Sigma:", np.linalg.eigvalsh(Sigma_true))
Examen final 📝
Intenta cada nivel antes de abrir las soluciones.
🟡 Medio
Dada la tabla joint P(0,0)=0.1,P(0,1)=0.2,P(1,0)=0.3,P(1,1)=0.4: halla las marginales de X e Y.
¿Son X e Y del ej. 1 independientes? Justifica.
🟠 Medio-difícil
Calcula Cov(X,Y) y ρ de la tabla del ej. 1.
Escribe la covariance matrix de features con Var(X1)=2, Var(X2)=8, ρ=0.5; verifica que es PSD por sus eigenvalues.
🔴 Difícil
Da un ejemplo explícito donde Cov(X,Y)=0 pero X,Y NO son independientes (usa Y=X2 con X simétrica en {−1,0,1}) y demuestra ambas afirmaciones.
Demuestra que la covariance matrix Σ=E[(x−μ)(x−μ)⊤] es siempre positive semidefinite (para cualquier vector a, considera la varianza de a⊤x).
✅ Soluciones
P(X=0)=0.3,P(X=1)=0.7; P(Y=0)=0.4,P(Y=1)=0.6.
P(X=0)P(Y=0)=0.3⋅0.4=0.12=P(0,0)=0.1 ⇒ no independientes.
X∈{−1,0,1} con prob 1/3 cada uno, Y=X2∈{0,1}. E[X]=0, E[XY]=E[X3]=0 (simetría) ⇒ Cov=0. Pero P(Y=0∣X=0)=1=P(Y=0)=1/3 ⇒ dependientes (relación no lineal).
Para cualquier a: a⊤Σa=a⊤E[(x−μ)(x−μ)⊤]a=E[(a⊤(x−μ))2]=Var(a⊤x)≥0 ⇒ PSD.