La derivada es la idea que hace posible el aprendizaje: mide cuánto cambia la salida cuando mueves la entrada un poquito. El chain rule que ves aquí, en su versión multivariable, ES backpropagation. Y las derivadas de $e^x$, $\ln x$ y la sigmoid aparecen en cada loss y cada activación.
Why this matters for ML
La derivada es la idea que hace posible el aprendizaje: mide cuánto cambia la salida cuando mueves la entrada un poquito. El chain rule que ves aquí, en su versión multivariable, ES backpropagation. Y las derivadas de ex, lnx y la sigmoid aparecen en cada loss y cada activación.
Concepts covered
- Derivada como límite (definición) y como pendiente/tasa de cambio
- Reglas: power, sum, product, quotient, chain rule
- Derivadas de funciones clave: xn, ex, lnx, sin/cos, sigmoid
- Higher-order derivatives (segunda derivada, etc.)
- Notación (f′, dxdf)
Intuition first
🎬 3Blue1Brown Essence of Calculus cap. 2 ("The paradox of the derivative"), cap. 3 (reglas), cap. 4 (chain rule), cap. 5 (ex). Esta es la columna vertebral del módulo.
Theory & key results
Definición:
f′(x)=dxdf=h→0limhf(x+h)−f(x).
Es la pendiente de la recta tangente = tasa de cambio instantánea.
Reglas (memorízalas y sabe de dónde salen):
| Regla |
Fórmula |
| Power |
(xn)′=nxn−1 |
| Sum |
(f+g)′=f′+g′ |
| Product |
(fg)′=f′g+fg′ |
| Quotient |
(f/g)′=g2f′g−fg′ |
| Chain |
(f(g(x)))′=f′(g(x))⋅g′(x) |
Derivadas clave para ML:
- (ex)′=ex (¡se deriva a sí misma!)
- (lnx)′=1/x
- (sinx)′=cosx, (cosx)′=−sinx
- Sigmoid σ(x)=1+e−x1: σ′(x)=σ(x)(1−σ(x)) — bellísima y baratísima (se reusa el forward pass). Sale de aplicar quotient/chain rule.
Chain rule (la joya): derivar funciones compuestas multiplicando derivadas "capa por capa". Una red neuronal es composición de muchas funciones; backprop es el chain rule aplicado eficientemente (Calc-07).
Higher-order: f′′(x) es la derivada de la derivada = curvatura/aceleración. En optimización, f′′>0 indica convexidad local (cuenco → mínimo) — esto se generaliza a la Hessian (Calc-06).
Worked example
f(x)=(3x2+1)4. Chain rule con outer u4 e inner u=3x2+1:
f′(x)=4(3x2+1)3⋅(6x)=24x(3x2+1)3.
Sigmoid: σ(x)=(1+e−x)−1. Chain: σ′=−(1+e−x)−2⋅(−e−x)=(1+e−x)2e−x. Reescribiendo, =σ(x)(1−σ(x)). ✓
Notebook exercises (by hand)
- Deriva f(x)=5x3−2x+7.
- Deriva g(x)=x2ex (product rule).
- Deriva h(x)=1+x2x (quotient rule).
- Deriva p(x)=ln(1+ex) (chain rule) — esta es la "softplus", muy usada en ML.
- Demuestra σ′(x)=σ(x)(1−σ(x)) desde la definición de sigmoid.
- Calcula f′′(x) para f(x)=x4 e interpreta el signo.
- Deriva L(w)=(wx−y)2 respecto a w (¡es el gradiente de un error cuadrático!).
Python lab
import numpy as np, sympy as sp
x = sp.symbols("x")
print(sp.diff((3*x**2 + 1)**4, x)) # 24x(3x^2+1)^3
sig = 1/(1+sp.exp(-x))
print(sp.simplify(sp.diff(sig, x) - sig*(1-sig))) # 0 -> identidad confirmada
# derivada numérica (finite differences) vs. analítica
f = lambda t: (3*t**2 + 1)**4
df = lambda t: 24*t*(3*t**2 + 1)**3
h = 1e-6; t0 = 1.5
print("numérica:", (f(t0+h)-f(t0-h))/(2*h), " analítica:", df(t0))
Examen final 📝
Intenta cada nivel antes de abrir las soluciones.
🟡 Medio
- Deriva f(x)=3x4−2x2+ex.
- Deriva g(x)=x2lnx (product rule).
🟠 Medio-difícil
- Deriva la "softplus" p(x)=ln(1+ex) y muestra que p′(x)=σ(x) (¡la sigmoid!).
- Deriva h(x)=1+exex y comprueba que coincide con la sigmoid y con su derivada σ(1−σ).
🔴 Difícil
- Deriva la MSE de una neurona lineal L(w)=n1∑i=1n(wxi−yi)2 respecto a w, iguala a 0 y despeja el w óptimo (te sale la fórmula de regresión 1D).
- Usando la definición por límite f′(x)=limh→0hf(x+h)−f(x), demuestra desde cero la power rule para f(x)=x3.
✅ Soluciones
- 12x3−4x+ex.
- 2xlnx+x2⋅x1=2xlnx+x.
- p′(x)=1+exex=1+e−x1=σ(x).
- h=σ(x) (multiplica arriba y abajo por e−x). h′=(1+ex)2ex(1+ex)−exex=(1+ex)2ex=σ(1−σ).
- L′(w)=n2∑(wxi−yi)xi=0⇒w∑xi2=∑xiyi⇒w*=∑xi2∑xiyi.
- h(x+h)3−x3=h3x2h+3xh2+h3=3x2+3xh+h2→3x2 cuando h→0. ✓