Prob-06 — Joint distributions, covariance, independence

Los datos reales son multivariados: muchas features que covarían. La covariance matrix resume cómo se relacionan todas las features entre sí — y es exactamente la matriz que PCA descompone (LA-10). La multivariate Gaussian es el modelo continuo multivariado por defecto (Gaussian mixtures, procesos gaussianos, inicialización). Aquí se casan probabilidad y linear algebra.

Why this matters for ML

Los datos reales son multivariados: muchas features que covarían. La covariance matrix resume cómo se relacionan todas las features entre sí — y es exactamente la matriz que PCA descompone (LA-10). La multivariate Gaussian es el modelo continuo multivariado por defecto (Gaussian mixtures, procesos gaussianos, inicialización). Aquí se casan probabilidad y linear algebra.

Concepts covered

  • Joint, marginal y conditional distributions
  • Independence de variables aleatorias
  • Covariance y correlation
  • Covariance matrix (conexión con LA)
  • Multivariate Gaussian (idea)

Intuition first

🎬 Stat 110 Lecture 7 (joint distributions) y Lecture 21 (multivariate normal). MML 6.4–6.5. Idea: una joint describe dos+ variables a la vez; marginal = "olvidar" una; conditional = "fijar" una.

Theory & key results

Joint distribution: p(x,y)p(x,y) (o f(x,y)f(x,y)) da la probabilidad conjunta. Debe sumar/integrar a 1 sobre todo el plano.

Marginal: "suma/integra fuera" una variable: p(x)=yp(x,y)of(x)=f(x,y)dy.p(x)=\sum_y p(x,y)\quad\text{o}\quad f(x)=\int f(x,y),dy.

Conditional: p(yx)=p(x,y)p(x)p(y\mid x)=\dfrac{p(x,y)}{p(x)} (Prob-02 en versión multivariada).

Independence: XYp(x,y)=p(x)p(y)X\perp Y \Leftrightarrow p(x,y)=p(x),p(y) para todo x,yx,y. Si son independientes, E[XY]=E[X]E[Y]\mathbb{E}[XY]=\mathbb{E}[X]\mathbb{E}[Y].

Covariance: cómo varían juntas dos variables: Cov(X,Y)=E[(XμX)(YμY)]=E[XY]E[X]E[Y].\text{Cov}(X,Y)=\mathbb{E}[(X-\mu_X)(Y-\mu_Y)]=\mathbb{E}[XY]-\mathbb{E}[X]\mathbb{E}[Y]. Positiva = suben juntas; negativa = una sube y la otra baja; 0 = no lineal-relacionadas. Importante: independencia ⇒ covarianza 0, pero covarianza 0 NO implica independencia (solo ausencia de relación lineal).

Correlation (covarianza normalizada, sin unidades): ρXY=Cov(X,Y)σXσY[1,1].\rho_{XY}=\frac{\text{Cov}(X,Y)}{\sigma_X\sigma_Y}\in[-1,1].

Covariance matrix (para un vector aleatorio xRn\mathbf{x}\in\mathbb{R}^n): Σ=E[(xμ)(xμ)],Σij=Cov(xi,xj).\Sigma = \mathbb{E}[(\mathbf{x}-\boldsymbol\mu)(\mathbf{x}-\boldsymbol\mu)^\top],\qquad \Sigma_{ij}=\text{Cov}(x_i,x_j). Es simétrica y positive semidefinite (LA-08) — por eso PCA (eigendecomposition de Σ\Sigma) siempre funciona y da direcciones ortogonales con varianzas ≥ 0. La diagonal son las varianzas de cada feature.

Multivariate Gaussian: N(μ,Σ)\mathcal{N}(\boldsymbol\mu,\Sigma) con densidad f(x)=1(2π)n/2Σ1/2exp ⁣(12(xμ)Σ1(xμ)).f(\mathbf{x})=\frac{1}{(2\pi)^{n/2}|\Sigma|^{1/2}}\exp!\left(-\tfrac12(\mathbf{x}-\boldsymbol\mu)^\top\Sigma^{-1}(\mathbf{x}-\boldsymbol\mu)\right). Fíjate cómo aparece todo lo aprendido: quadratic form (LA-08), inverse y determinant (LA-05), exp (Calc). Las curvas de nivel son elipses cuyos ejes son los eigenvectors de Σ\Sigma.

Worked example

Dos features con Var(X)=4\text{Var}(X)=4, Var(Y)=9\text{Var}(Y)=9, Cov(X,Y)=3\text{Cov}(X,Y)=3. Σ=[4339],ρ=349=36=0.5.\Sigma=\begin{bmatrix}4&3\3&9\end{bmatrix},\quad \rho=\frac{3}{\sqrt4\sqrt9}=\frac{3}{6}=0.5. Σ\Sigma es simétrica; sus eigenvalues (positivos) dan las varianzas a lo largo de las direcciones principales → esas direcciones son justo los principal components de PCA.

Notebook exercises (by hand)

  1. Joint discreta en una tabla 2×22\times2: calcula marginales y verifica si XYX\perp Y.
  2. Calcula Cov(X,Y)\text{Cov}(X,Y) y ρ\rho de la tabla anterior.
  3. Da un ejemplo donde Cov(X,Y)=0\text{Cov}(X,Y)=0 pero X,YX,Y NO son independientes (pista: Y=X2Y=X^2 con XX simétrica).
  4. Escribe la covariance matrix de features con var 1, 1 y covarianza 0.8; ¿es PSD?
  5. Muestra que Σ\Sigma es simétrica desde su definición.
  6. Relaciona: eigenvectors de Σ\Sigma ↔ principal components (una frase, conecta con LA-10).

Python lab

import numpy as np

# datos con covarianza conocida
rng = np.random.default_rng(0)
Sigma_true = np.array([[4., 3.],[3., 9.]])
L = np.linalg.cholesky(Sigma_true)                 # muestrea gaussiana multivariada
X = (L @ rng.normal(size=(2, 100_000))).T
print("cov empírica:\n", np.round(np.cov(X, rowvar=False), 2))
print("correlación:\n", np.round(np.corrcoef(X, rowvar=False), 2))

# covarianza 0 pero NO independientes: Y = X^2
x = rng.normal(size=200_000); y = x**2
print("Cov(X, X^2) ~ 0:", np.round(np.cov(x, y)[0,1], 3))   # ~0, pero dependen

# Sigma es simétrica PSD -> eigenvalues >= 0 (conecta con PCA)
print("eigenvalues de Sigma:", np.linalg.eigvalsh(Sigma_true))

Examen final 📝

Intenta cada nivel antes de abrir las soluciones.

🟡 Medio

  1. Dada la tabla joint P(0,0)=0.1,P(0,1)=0.2,P(1,0)=0.3,P(1,1)=0.4P(0,0)=0.1,P(0,1)=0.2,P(1,0)=0.3,P(1,1)=0.4: halla las marginales de XX e YY.
  2. ¿Son XX e YY del ej. 1 independientes? Justifica.

🟠 Medio-difícil

  1. Calcula Cov(X,Y)\text{Cov}(X,Y) y ρ\rho de la tabla del ej. 1.
  2. Escribe la covariance matrix de features con Var(X1)=2\text{Var}(X_1)=2, Var(X2)=8\text{Var}(X_2)=8, ρ=0.5\rho=0.5; verifica que es PSD por sus eigenvalues.

🔴 Difícil

  1. Da un ejemplo explícito donde Cov(X,Y)=0\text{Cov}(X,Y)=0 pero X,YX,Y NO son independientes (usa Y=X2Y=X^2 con XX simétrica en {1,0,1}{-1,0,1}) y demuestra ambas afirmaciones.
  2. Demuestra que la covariance matrix Σ=E[(xμ)(xμ)]\Sigma=\mathbb{E}[(\mathbf x-\boldsymbol\mu)(\mathbf x-\boldsymbol\mu)^\top] es siempre positive semidefinite (para cualquier vector a\mathbf a, considera la varianza de ax\mathbf a^\top\mathbf x).
✅ Soluciones
  1. P(X=0)=0.3,P(X=1)=0.7P(X=0)=0.3,P(X=1)=0.7; P(Y=0)=0.4,P(Y=1)=0.6P(Y=0)=0.4,P(Y=1)=0.6.
  2. P(X=0)P(Y=0)=0.30.4=0.12P(0,0)=0.1P(X{=}0)P(Y{=}0)=0.3\cdot0.4=0.12\neq P(0,0)=0.1no independientes.
  3. E[X]=0.7,E[Y]=0.6\mathbb{E}[X]=0.7,\mathbb{E}[Y]=0.6; E[XY]=P(1,1)=0.4\mathbb{E}[XY]=P(1,1)=0.4; Cov=0.40.42=0.02\text{Cov}=0.4-0.42=-0.02. σX=0.21,σY=0.24\sigma_X=\sqrt{0.21},\sigma_Y=\sqrt{0.24}; ρ=0.02/0.210.240.089\rho=-0.02/\sqrt{0.21\cdot0.24}\approx-0.089.
  4. Cov=ρσ1σ2=0.528=0.54=2\text{Cov}=\rho\sigma_1\sigma_2=0.5\sqrt{2}\sqrt{8}=0.5\cdot4=2. Σ=[2228]\Sigma=\begin{bmatrix}2&2\2&8\end{bmatrix}; eigenvalues resuelven (2λ)(8λ)4=λ210λ+12=0λ8.6,1.4>0(2-\lambda)(8-\lambda)-4=\lambda^2-10\lambda+12=0\Rightarrow\lambda\approx8.6,1.4>0 ⇒ PSD ✓.
  5. X{1,0,1}X\in{-1,0,1} con prob 1/31/3 cada uno, Y=X2{0,1}Y=X^2\in{0,1}. E[X]=0\mathbb{E}[X]=0, E[XY]=E[X3]=0\mathbb{E}[XY]=\mathbb{E}[X^3]=0 (simetría) ⇒ Cov=0\text{Cov}=0. Pero P(Y=0X=0)=1P(Y=0)=1/3P(Y=0\mid X=0)=1\neq P(Y=0)=1/3 ⇒ dependientes (relación no lineal).
  6. Para cualquier a\mathbf a: aΣa=aE[(xμ)(xμ)]a=E[(a(xμ))2]=Var(ax)0\mathbf a^\top\Sigma\mathbf a=\mathbf a^\top\mathbb{E}[(\mathbf x-\boldsymbol\mu)(\mathbf x-\boldsymbol\mu)^\top]\mathbf a=\mathbb{E}[(\mathbf a^\top(\mathbf x-\boldsymbol\mu))^2]=\text{Var}(\mathbf a^\top\mathbf x)\ge0 ⇒ PSD.