Why this matters for ML
Entrenar = minimizar una loss. En 1D aprendes el patrón que se generaliza a millones de parámetros: buscar dónde la derivada es cero (critical points), y usar la segunda derivada para saber si es mínimo o máximo. También aquí aparece la distinción convexo vs. no convexo que explica por qué unas losses son fáciles y otras (redes neuronales) difíciles.
Concepts covered
- Critical points ()
- First derivative test
- Second derivative test (curvatura)
- Convex vs. non-convex
- Global vs. local minima/maxima
- Conexión con minimizar loss functions
Intuition first
🎬 3Blue1Brown Essence of Calculus cap. 3 (implica optimización via ). Piensa: en un mínimo o máximo, la tangente es horizontal.
Theory & key results
Critical point: un donde (o la derivada no existe). Los mínimos/máximos suaves ocurren en critical points.
First derivative test: mira el signo de alrededor de :
- luego → mínimo local (baja, sube).
- luego → máximo local.
- no cambia → punto de inflexión (ni min ni max).
Second derivative test (más rápido si ):
- → mínimo local (cuenco).
- → máximo local (domo).
- → no concluye (usa el first test).
Convexity: es convexa si en todo su dominio (curva siempre "hacia arriba", como un cuenco). Propiedad mágica para ML: una función convexa tiene un único mínimo, que es global. Linear/logistic regression tienen loss convexa → optimización garantizada. Las redes neuronales son no convexas → muchos mínimos locales y saddle points, y por eso entrenar es un arte.
Global vs. local: un mínimo local es el más bajo en su vecindad; el global es el más bajo de todos. En problemas no convexos, gradient descent puede quedar en un local. (En la práctica de deep learning, muchos mínimos locales son "suficientemente buenos".)
Worked example
Minimizar . . → mínimo. Valor: . Como en todo lado, es convexa → ese mínimo es global.
Loss cuadrática: tiene → convexa en → un solo mínimo (base de por qué la regresión lineal "siempre funciona").
Notebook exercises (by hand)
- Encuentra y clasifica los critical points de .
- Minimiza ; da y .
- ¿Es convexa? ¿Y (en )? Justifica con .
- Muestra que tiene y aun así un mínimo en 0 (el second test falla; usa el first).
- Da una función con un mínimo local que NO sea global.
- Explica por qué que la loss sea convexa es una gran noticia para entrenar un modelo.
Python lab
import numpy as np, sympy as sp
import matplotlib.pyplot as plt
x = sp.symbols("x")
f = x**3 - 3*x
crit = sp.solve(sp.diff(f, x), x)
print("critical points:", crit) # [-1, 1]
for c in crit:
print(c, "->", "min" if sp.diff(f,x,2).subs(x,c) > 0 else "max")
# visualiza convexidad
xs = np.linspace(-2.5, 2.5, 200)
plt.plot(xs, xs**2 - 4*xs + 7, label="convexa")
plt.plot(xs, xs**3 - 3*xs, label="no convexa")
plt.legend(); plt.grid(True); plt.savefig("calc03.png")
Examen final 📝
Intenta cada nivel antes de abrir las soluciones.
🟡 Medio
- Encuentra y clasifica los critical points de .
- Minimiza y da el valor mínimo.
🟠 Medio-difícil
- ¿Es convexa ? Estudia y explica dónde es convexa y dónde no.
- Demuestra que la loss de la sigmoid al cuadrado puede tener regiones no convexas, pero que la binary cross-entropy es convexa en (calcula la 2ª derivada respecto a ).
🔴 Difícil
- Demuestra que la suma de dos funciones convexas es convexa, y que si es convexa y , es convexa. ¿Por qué esto importa para construir loss functions "seguras de optimizar"?
- La regularización L2 añade a una loss convexa . Demuestra que la loss regularizada sigue siendo convexa y explica por qué eso garantiza un mínimo único.
✅ Soluciones
- . : en , → máximo local; en , → mínimo local.
- ; → mínimo. .
- ; cuando , i.e. . Convexa en las colas, cóncava cerca de 0 ⇒ no convexa globalmente (tiene dos mínimos).
- Para la CE: sea . (resultado clásico). Segunda derivada ⇒ convexa en . La sigmoid-cuadrado no garantiza .
- Si convexas, ; y si . Importa porque puedes combinar términos convexos (data loss + regularización) y seguir teniendo un problema convexo con mínimo global.
- convexa ⇒ ; tiene 2ª derivada . Suma: ⇒ estrictamente convexa ⇒ mínimo único y global.