Calculus·Unidad 2

Calc-02 — Derivatives (single variable)

La derivada es la idea que hace posible el aprendizaje: mide cuánto cambia la salida cuando mueves la entrada un poquito. El chain rule que ves aquí, en su versión multivariable, ES backpropagation. Y las derivadas de $e^x$, $\ln x$ y la sigmoid aparecen en cada loss y cada activación.

Why this matters for ML

La derivada es la idea que hace posible el aprendizaje: mide cuánto cambia la salida cuando mueves la entrada un poquito. El chain rule que ves aquí, en su versión multivariable, ES backpropagation. Y las derivadas de exe^x, lnx\ln x y la sigmoid aparecen en cada loss y cada activación.

Concepts covered

  • Derivada como límite (definición) y como pendiente/tasa de cambio
  • Reglas: power, sum, product, quotient, chain rule
  • Derivadas de funciones clave: xnx^n, exe^x, lnx\ln x, sin/cos\sin/\cos, sigmoid
  • Higher-order derivatives (segunda derivada, etc.)
  • Notación (ff', dfdx\frac{df}{dx})

Intuition first

🎬 3Blue1Brown Essence of Calculus cap. 2 ("The paradox of the derivative"), cap. 3 (reglas), cap. 4 (chain rule), cap. 5 (exe^x). Esta es la columna vertebral del módulo.

Theory & key results

Definición: f(x)=dfdx=limh0f(x+h)f(x)h.f'(x) = \frac{df}{dx} = \lim_{h\to0}\frac{f(x+h)-f(x)}{h}. Es la pendiente de la recta tangente = tasa de cambio instantánea.

Reglas (memorízalas y sabe de dónde salen):

Regla Fórmula
Power (xn)=nxn1(x^n)' = n x^{n-1}
Sum (f+g)=f+g(f+g)' = f' + g'
Product (fg)=fg+fg(fg)' = f'g + fg'
Quotient (f/g)=fgfgg2(f/g)' = \dfrac{f'g - fg'}{g^2}
Chain (f(g(x)))=f(g(x))g(x)\big(f(g(x))\big)' = f'(g(x))\cdot g'(x)

Derivadas clave para ML:

  • (ex)=ex(e^x)' = e^x (¡se deriva a sí misma!)
  • (lnx)=1/x(\ln x)' = 1/x
  • (sinx)=cosx(\sin x)' = \cos x, (cosx)=sinx(\cos x)' = -\sin x
  • Sigmoid σ(x)=11+ex\sigma(x)=\frac{1}{1+e^{-x}}: σ(x)=σ(x)(1σ(x))\sigma'(x)=\sigma(x),(1-\sigma(x)) — bellísima y baratísima (se reusa el forward pass). Sale de aplicar quotient/chain rule.

Chain rule (la joya): derivar funciones compuestas multiplicando derivadas "capa por capa". Una red neuronal es composición de muchas funciones; backprop es el chain rule aplicado eficientemente (Calc-07).

Higher-order: f(x)f''(x) es la derivada de la derivada = curvatura/aceleración. En optimización, f>0f''>0 indica convexidad local (cuenco → mínimo) — esto se generaliza a la Hessian (Calc-06).

Worked example

f(x)=(3x2+1)4f(x)=(3x^2+1)^4. Chain rule con outer u4u^4 e inner u=3x2+1u=3x^2+1: f(x)=4(3x2+1)3(6x)=24x(3x2+1)3.f'(x)=4(3x^2+1)^3\cdot(6x)=24x(3x^2+1)^3.

Sigmoid: σ(x)=(1+ex)1\sigma(x)=(1+e^{-x})^{-1}. Chain: σ=(1+ex)2(ex)=ex(1+ex)2\sigma'=-(1+e^{-x})^{-2}\cdot(-e^{-x})=\frac{e^{-x}}{(1+e^{-x})^2}. Reescribiendo, =σ(x)(1σ(x))=\sigma(x)(1-\sigma(x)). ✓

Notebook exercises (by hand)

  1. Deriva f(x)=5x32x+7f(x)=5x^3-2x+7.
  2. Deriva g(x)=x2exg(x)=x^2 e^x (product rule).
  3. Deriva h(x)=x1+x2h(x)=\frac{x}{1+x^2} (quotient rule).
  4. Deriva p(x)=ln(1+ex)p(x)=\ln(1+e^{x}) (chain rule) — esta es la "softplus", muy usada en ML.
  5. Demuestra σ(x)=σ(x)(1σ(x))\sigma'(x)=\sigma(x)(1-\sigma(x)) desde la definición de sigmoid.
  6. Calcula f(x)f''(x) para f(x)=x4f(x)=x^4 e interpreta el signo.
  7. Deriva L(w)=(wxy)2L(w)=(w x - y)^2 respecto a ww (¡es el gradiente de un error cuadrático!).

Python lab

import numpy as np, sympy as sp

x = sp.symbols("x")
print(sp.diff((3*x**2 + 1)**4, x))                 # 24x(3x^2+1)^3
sig = 1/(1+sp.exp(-x))
print(sp.simplify(sp.diff(sig, x) - sig*(1-sig)))  # 0  -> identidad confirmada

# derivada numérica (finite differences) vs. analítica
f  = lambda t: (3*t**2 + 1)**4
df = lambda t: 24*t*(3*t**2 + 1)**3
h = 1e-6; t0 = 1.5
print("numérica:", (f(t0+h)-f(t0-h))/(2*h), " analítica:", df(t0))

Examen final 📝

Intenta cada nivel antes de abrir las soluciones.

🟡 Medio

  1. Deriva f(x)=3x42x2+exf(x)=3x^4-2x^2+e^x.
  2. Deriva g(x)=x2lnxg(x)=x^2\ln x (product rule).

🟠 Medio-difícil

  1. Deriva la "softplus" p(x)=ln(1+ex)p(x)=\ln(1+e^x) y muestra que p(x)=σ(x)p'(x)=\sigma(x) (¡la sigmoid!).
  2. Deriva h(x)=ex1+exh(x)=\frac{e^x}{1+e^x} y comprueba que coincide con la sigmoid y con su derivada σ(1σ)\sigma(1-\sigma).

🔴 Difícil

  1. Deriva la MSE de una neurona lineal L(w)=1ni=1n(wxiyi)2L(w)=\frac1n\sum_{i=1}^n (wx_i-y_i)^2 respecto a ww, iguala a 0 y despeja el ww óptimo (te sale la fórmula de regresión 1D).
  2. Usando la definición por límite f(x)=limh0f(x+h)f(x)hf'(x)=\lim_{h\to0}\frac{f(x+h)-f(x)}{h}, demuestra desde cero la power rule para f(x)=x3f(x)=x^3.
✅ Soluciones
  1. 12x34x+ex12x^3-4x+e^x.
  2. 2xlnx+x21x=2xlnx+x2x\ln x + x^2\cdot\frac1x=2x\ln x + x.
  3. p(x)=ex1+ex=11+ex=σ(x)p'(x)=\frac{e^x}{1+e^x}=\frac{1}{1+e^{-x}}=\sigma(x).
  4. h=σ(x)h=\sigma(x) (multiplica arriba y abajo por exe^{-x}). h=ex(1+ex)exex(1+ex)2=ex(1+ex)2=σ(1σ)h'=\frac{e^x(1+e^x)-e^x e^x}{(1+e^x)^2}=\frac{e^x}{(1+e^x)^2}=\sigma(1-\sigma).
  5. L(w)=2n(wxiyi)xi=0wxi2=xiyiw*=xiyixi2L'(w)=\frac{2}{n}\sum(wx_i-y_i)x_i=0\Rightarrow w\sum x_i^2=\sum x_i y_i\Rightarrow w^*=\frac{\sum x_i y_i}{\sum x_i^2}.
  6. (x+h)3x3h=3x2h+3xh2+h3h=3x2+3xh+h23x2\frac{(x+h)^3-x^3}{h}=\frac{3x^2h+3xh^2+h^3}{h}=3x^2+3xh+h^2\to 3x^2 cuando h0h\to0. ✓