Why this matters for ML
Casi toda la teoría de optimización se apoya en aproximar la loss localmente por algo simple. Gradient descent usa la aproximación lineal (Taylor de 1er orden); Newton's method usa la cuadrática (2º orden, con la Hessian). Taylor también explica por qué las funciones de activación se comportan como lo hacen cerca de 0 y da las herramientas para analizar convergencia.
Concepts covered
- Aproximación lineal (recta tangente)
- Aproximación cuadrática
- Taylor series (1 variable) y polinomio de Taylor
- Taylor multivariable con gradient y Hessian
- Uso en gradient descent y Newton's method
Intuition first
🎬 3Blue1Brown Essence of Calculus cap. 11 ("Taylor series"). Idea: aproximar cualquier función suave, cerca de un punto, por un polinomio que copia su valor y sus derivadas.
Theory & key results
Aproximación lineal (1er orden): cerca de , Es la recta tangente. Base de "dar un pasito en la dirección de la derivada".
Aproximación cuadrática (2º orden): Añade curvatura → aproxima mejor.
Taylor series: si sigues añadiendo términos, Ejemplos famosos (en , "Maclaurin"): , ,
Taylor multivariable (¡el que usa ML!): cerca de , con gradient y Hessian :
- El término lineal → gradient descent (baja siguiendo ).
- El término cuadrático con → Newton's method (salta directo al mínimo de la parábola local): .
Aquí se ve por qué la Hessian (Calc-06) y su definiteness (LA-08) determinan la forma local de la loss.
Worked example
Aproxima cerca de 0.
- 1er orden: . En : vs. real .
- 2º orden: . En : vs. real (mucho mejor).
Optimización: minimizar con Newton desde : , , paso . ¡Un solo paso llega al mínimo exacto! (Newton es exacto para cuadráticas.)
Notebook exercises (by hand)
- Polinomio de Taylor de orden 2 de en .
- Aproxima a 1er orden cerca de 0; úsalo para estimar .
- Escribe los primeros 3 términos de la Taylor series de y evalúa en .
- Aproximación cuadrática multivariable de en (necesitas y ).
- Aplica un paso de Newton a desde ; ¿llegas al mínimo?
- Explica cómo el término lineal de Taylor justifica la regla de gradient descent.
Python lab
import numpy as np, sympy as sp
x = sp.symbols("x")
# polinomios de Taylor de e^x en 0
for n in [1, 2, 3, 5]:
p = sp.series(sp.exp(x), x, 0, n+1).removeO()
print(f"orden {n}:", p, " en 0.1 ->", float(p.subs(x, 0.1)))
print("e^0.1 real:", np.exp(0.1))
# Newton para minimizar x^2 - 4x + 3 (1 variable)
f1 = lambda t: 2*t - 4 # f'
f2 = lambda t: 2.0 # f''
t = 0.0
for _ in range(3):
t = t - f1(t)/f2(t)
print("mínimo por Newton:", t) # 2.0 en un paso
Examen final 📝
Intenta cada nivel antes de abrir las soluciones.
🟡 Medio
- Aproximación lineal de en ; úsala para estimar .
- Polinomio de Taylor de orden 2 de en .
🟠 Medio-difícil
- Escribe la Taylor de orden 2 de en 0 y estima el error al usarla para .
- Aproximación cuadrática multivariable de en (necesitas y ).
🔴 Difícil
- Deriva Newton's method minimizando la aproximación cuadrática de Taylor de una : muestra que el paso óptimo es y explica cuándo falla (Hessian no PD).
- Justifica la regla de gradient descent desde Taylor de 1er orden: partiendo de , encuentra el de norma fija que más reduce , y muestra que es .
✅ Soluciones
- , . (real 3.01662).
- (la 1ª derivada en 0 es 0).
- ; en 0.1: (real ; error , del orden del término cúbico ).
- ; ; en (0,0). Aprox: .
- Aprox cuadrática . . Falla si no es invertible o no PD (el "mínimo" de la cuadrática puede ser un saddle o no existir).
- Minimizar sujeto a : por Cauchy–Schwarz el mínimo es en ⇒ , la dirección de gradient descent.