Why this matters for ML
Este módulo responde la pregunta de fondo: ¿de dónde salen las loss functions? La respuesta es maximum likelihood: casi todos los modelos de ML se derivan como "elige los parámetros que hacen los datos más probables". El error cuadrático sale de MLE con ruido gaussiano; la cross-entropy sale de MLE con etiquetas Bernoulli/Categorical. MAP añade un prior y produce la regularización. Aquí probabilidad y cálculo se unen para fabricar modelos.
Concepts covered
- Likelihood y log-likelihood
- Maximum Likelihood Estimation (MLE)
- MLE → error cuadrático (ruido gaussiano) y → cross-entropy (Bernoulli)
- Maximum A Posteriori (MAP) y priors
- MAP → regularización (L2/L1)
Intuition first
🎬 StatQuest "Maximum Likelihood, clearly explained". MML 8.3; Goodfellow cap. 5.5. Idea: entre todos los parámetros posibles, elige el que mejor explica los datos observados.
Theory & key results
Likelihood: dados datos y un modelo con parámetro , la likelihood es . Si los datos son i.i.d.,
Log-likelihood: como productos son incómodos (y numéricamente inestables), tomamos log (Calc-00: productos→sumas): El es monótono, así que maximiza en el mismo .
MLE: . Se resuelve con cálculo: (Calc-05/10). Minimizar la negative log-likelihood (NLL) es lo mismo que maximizar → por eso las losses son NLLs.
Dos derivaciones estelares:
- Ruido gaussiano ⇒ error cuadrático. Si con , entonces Maximizar = minimizar la suma de errores cuadráticos. ¡La MSE loss es MLE gaussiano!
- Etiquetas Bernoulli ⇒ cross-entropy. Si con , la NLL es que es exactamente la binary cross-entropy loss de logistic regression.
MAP: en vez de solo la likelihood, incluye un prior (Bayes, Prob-02): El término del prior actúa como regularización:
- Prior gaussiano sobre ⇒ penalización L2 (ridge / weight decay).
- Prior Laplace ⇒ penalización L1 (lasso, sparsity).
Así, "regularizar para no sobreajustar" = "tener una creencia previa de que los pesos son pequeños". MLE es MAP con prior uniforme.
Worked example (MLE de una moneda)
Observas lanzamientos con caras (Bernoulli). Likelihood . Log-likelihood . Deriva e iguala a 0: El estimador MLE es simplemente la frecuencia observada — reconfortantemente sensato. Con MAP y prior Beta obtendrías (suavizado tipo Laplace).
Notebook exercises (by hand)
- Deriva para la moneda (arriba) mostrando todos los pasos.
- Deriva el MLE de para datos (resultado: la media muestral).
- Muestra que maximizar la log-likelihood gaussiana equivale a minimizar la MSE.
- Escribe la NLL de logistic regression y confirma que es la binary cross-entropy.
- Con un prior gaussiano , muestra que el término del prior en MAP es (regularización L2).
- Explica en una frase por qué "log" hace la MLE tratable.
Python lab
import numpy as np
from scipy.optimize import minimize_scalar
# MLE de una moneda: n=100, k=63
n, k = 100, 63
neg_ll = lambda p: -(k*np.log(p) + (n-k)*np.log(1-p))
res = minimize_scalar(neg_ll, bounds=(1e-6, 1-1e-6), method="bounded")
print("MLE numérico:", res.x, " analítico k/n:", k/n) # coinciden ~0.63
# MLE de la media gaussiana = media muestral
data = np.random.normal(5, 2, 10_000)
print("MLE mu:", data.mean()) # ~5
# MSE == NLL gaussiana (salvo constantes): compara argmin
x = np.linspace(0, 10, 200)[:, None]
y = 3*x.ravel() + np.random.normal(0, 1, 200)
mse = lambda w: np.mean((w*x.ravel() - y)**2)
ws = np.linspace(0, 6, 1000)
print("w que minimiza MSE:", ws[np.argmin([mse(w) for w in ws])]) # ~3
Examen final 📝
Intenta cada nivel antes de abrir las soluciones.
🟡 Medio
- Observas 7 caras en 10 lanzamientos. ¿Cuál es la MLE de ?
- Escribe la log-likelihood de observaciones i.i.d. con conocido.
🟠 Medio-difícil
- Deriva la MLE de para datos (resultado: media muestral) resolviendo .
- Deriva la MLE de para datos gaussianos con conocido.
🔴 Difícil
- Deriva completamente que la MLE de logistic regression = minimizar binary cross-entropy: escribe la likelihood Bernoulli con , toma , y muestra que el gradiente es .
- Demuestra que MAP con prior gaussiano equivale a MLE + regularización L2, e identifica la relación entre , y el coeficiente de ridge.
✅ Soluciones
- .
- .
- .
- (MLE, sesgada; el estimador insesgado divide por ).
- ; = binary cross-entropy. Con y usando , en forma matricial .
- MAP: . Prior gaussiano da . Con likelihood gaussiana ( delante de la suma de cuadrados), el objetivo es ⇒ ridge con . Prior más fuerte (τ pequeño) ⇒ λ grande ⇒ más regularización.