Foundations·Unidad 1

00 — Notation & Refresher

Antes de correr necesitas que la notación no te frene. En ML vas a leer fórmulas llenas de $\sum$, $\prod$, $\log$, subíndices y funciones compuestas. Este módulo fija ese "alfabeto" para que después leas cualquier ecuación sin tropezar. Es corto porque tu base de precálculo ya es sólida: úsalo como repaso rápido y detector de huecos.

Why this matters for ML

Antes de correr necesitas que la notación no te frene. En ML vas a leer fórmulas llenas de \sum, \prod, log\log, subíndices y funciones compuestas. Este módulo fija ese "alfabeto" para que después leas cualquier ecuación sin tropezar. Es corto porque tu base de precálculo ya es sólida: úsalo como repaso rápido y detector de huecos.

Concepts covered

  • Summation notation (\sum) y product notation (\prod)
  • Set notation (\in, \subseteq, R\mathbb{R}, Rn\mathbb{R}^n, intervalos)
  • Functions, domain/range, composition (fgf \circ g)
  • Exponentials y logarithms (y por qué el log aparece en todo ML)
  • Repaso exprés de trigonometría (lo mínimo útil)
  • Cómo leer statements matemáticos (∀, ∃, ⇒, ⇔)

Intuition first

No hay video obligatorio. Si algún símbolo te resulta ajeno, búscalo puntualmente en Khan Academy. Ojea MML sección 2.1 para acostumbrarte a su notación (la usaremos).

Theory & key results

Summation y product

i=1nxi=x1+x2++xni=1nxi=x1x2xn\sum_{i=1}^{n} x_i = x_1 + x_2 + \dots + x_n \qquad \prod_{i=1}^{n} x_i = x_1 \cdot x_2 \cdots x_n Propiedades que usarás sin parar:

  • i(axi)=aixi\sum_i (a x_i) = a \sum_i x_i (saca constantes)
  • i(xi+yi)=ixi+iyi\sum_i (x_i + y_i) = \sum_i x_i + \sum_i y_i (linealidad)
  • El dot product de dos vectores es literalmente ixiyi\sum_i x_i y_i. Media aritmética: xˉ=1nixi\bar{x} = \frac{1}{n}\sum_i x_i.

Sets y Rn\mathbb{R}^n

  • xRx \in \mathbb{R}: "x es un número real". xRn\mathbf{x} \in \mathbb{R}^n: "x es un vector de n números reales".
  • ABA \subseteq B: A es subconjunto de B. Un subspace (LA-02) será un subconjunto especial de Rn\mathbb{R}^n.
  • Convención: vectores en negrita minúscula (x\mathbf{x}), matrices en mayúscula (AA), escalares en cursiva (λ\lambda).

Functions y composición

Una función f:RnRmf: \mathbb{R}^n \to \mathbb{R}^m toma un vector de nn dimensiones y devuelve uno de mm. La composición (fg)(x)=f(g(x))(f \circ g)(x) = f(g(x)) es la base del chain rule (Calc-02, Calc-07) y de por qué una red neuronal es "funciones dentro de funciones".

Exponentials y logarithms

logb(xy)=logbx+logby,logb(xk)=klogbx,blogbx=x\log_b(xy) = \log_b x + \log_b y, \quad \log_b(x^k) = k\log_b x, \quad b^{\log_b x} = x En ML el logaritmo natural ln=loge\ln = \log_e es el rey. Por qué aparece tanto:

  1. Convierte productos en sumas — y las probabilidades de datos independientes se multiplican; tomar log las vuelve sumables (log-likelihood, MLE en Prob-07).
  2. Es monótono — maximizar ff es lo mismo que maximizar logf\log f, pero el log es más estable numéricamente y más fácil de derivar.
  3. La derivada de lnx\ln x es 1/x1/x, limpia y central en gradientes.

La sigmoid σ(x)=11+ex\sigma(x) = \frac{1}{1+e^{-x}} y la softmax viven de exp; tenlas en el radar.

Leer statements

  • \forall = "para todo", \exists = "existe".
  • PQP \Rightarrow Q = "P implica Q"; PQP \Leftrightarrow Q = "P si y solo si Q".
  • :=:= = "se define como".

Worked example

Reescribe la media y la varianza con notación de suma y verifica una propiedad.

Media: xˉ=1ni=1nxi\bar{x} = \frac{1}{n}\sum_{i=1}^n x_i. Varianza: Var=1ni=1n(xixˉ)2\text{Var} = \frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^2.

Propiedad "log de producto → suma": para x1=2,x2=5x_1=2, x_2=5, ln(25)=ln102.302yln2+ln50.693+1.609=2.302. \ln(2 \cdot 5) = \ln 10 \approx 2.302 \quad\text{y}\quad \ln 2 + \ln 5 \approx 0.693 + 1.609 = 2.302.\ ✓

Notebook exercises (by hand)

  1. Expande i=14(2i1)\sum_{i=1}^{4} (2i - 1) y suma.
  2. Escribe el producto i=131i\prod_{i=1}^{3} \frac{1}{i} como una sola fracción.
  3. Simplifica ln(e3)+ln(1)ln(e)\ln(e^3) + \ln(1) - \ln(e).
  4. Dado f(x)=x2f(x)=x^2 y g(x)=x+1g(x)=x+1, calcula (fg)(2)(f\circ g)(2) y (gf)(2)(g\circ f)(2). ¿Son iguales?
  5. Reescribe log2(84)\log_2(8 \cdot 4) como suma de logs y evalúa.
  6. Traduce a palabras: "xR, x20\forall x \in \mathbb{R},\ x^2 \ge 0".
  7. Demuestra que i=1n(xixˉ)=0\sum_{i=1}^n (x_i - \bar{x}) = 0 (pista: usa la definición de xˉ\bar{x}).

Python lab

import numpy as np, sympy as sp

x = np.array([2.0, 4.0, 4.0, 4.0, 5.0, 5.0, 7.0, 9.0])
print("media:", x.mean(), "==", x.sum()/len(x))
print("varianza:", ((x - x.mean())**2).mean())

# verifica log(producto) = suma(logs)
print(np.log(x).sum(), "==", np.log(x.prod()))

# composición de funciones
f = lambda t: t**2
g = lambda t: t + 1
print((f(g(2)), g(f(2))))  # (9, 5) -> no conmutan

# sympy: derivada de ln(x) y de la sigmoid
s = sp.symbols("s")
print(sp.diff(sp.log(s), s))                 # 1/s
print(sp.simplify(sp.diff(1/(1+sp.exp(-s)), s)))  # sigmoid'

Examen final 📝

Ponte a prueba sin mirar el módulo. Intenta cada nivel antes de abrir las soluciones.

🟡 Medio

  1. Expresa i=1n(3i+2)\sum_{i=1}^{n}(3i+2) en forma cerrada (usa i=n(n+1)2\sum i = \frac{n(n+1)}{2}).
  2. Demuestra logb(x/y)=logbxlogby\log_b(x/y)=\log_b x-\log_b y a partir de la regla del producto.

🟠 Medio-difícil

  1. Con f(x)=exf(x)=e^x y g(x)=lnxg(x)=\ln x: calcula (fg)(x)(f\circ g)(x) y (gf)(x)(g\circ f)(x) e indica el dominio de cada una.
  2. Reescribe la likelihood de nn Bernoulli independientes i=1npxi(1p)1xi\prod_{i=1}^n p^{x_i}(1-p)^{1-x_i} como una suma usando logs.

🔴 Difícil

  1. Demuestra la identidad de varianza i=1n(xixˉ)2=ixi2nxˉ2\sum_{i=1}^n (x_i-\bar x)^2=\sum_i x_i^2 - n\bar x^2.
  2. Explica y justifica por qué argmaxθip(xiθ)=argmaxθilogp(xiθ)\arg\max_\theta \prod_i p(x_i\mid\theta)=\arg\max_\theta \sum_i \log p(x_i\mid\theta) (fundamento de la MLE).
✅ Soluciones (ábrelas solo tras intentarlo)
  1. 3n(n+1)2+2n=3n2+7n23\cdot\frac{n(n+1)}{2}+2n=\frac{3n^2+7n}{2}.
  2. logb(xy1)=logbx+logb(y1)=logbxlogby\log_b(x\cdot y^{-1})=\log_b x+\log_b(y^{-1})=\log_b x-\log_b y.
  3. (fg)(x)=elnx=x(f\circ g)(x)=e^{\ln x}=x (dominio x>0x>0); (gf)(x)=ln(ex)=x(g\circ f)(x)=\ln(e^x)=x (dominio R\mathbb{R}). Distinto dominio ⇒ no son la misma función pese a "simplificar" a xx.
  4. (p)=i[xilogp+(1xi)log(1p)]\ell(p)=\sum_i\big[x_i\log p+(1-x_i)\log(1-p)\big].
  5. (xixˉ)2=(xi22xˉxi+xˉ2)=xi22xˉxi+nxˉ2\sum(x_i-\bar x)^2=\sum(x_i^2-2\bar x x_i+\bar x^2)=\sum x_i^2-2\bar x\sum x_i+n\bar x^2. Como xi=nxˉ\sum x_i=n\bar x: =xi22nxˉ2+nxˉ2=xi2nxˉ2=\sum x_i^2-2n\bar x^2+n\bar x^2=\sum x_i^2-n\bar x^2.
  6. log\log es estrictamente creciente (monótona), así que preserva el punto donde se alcanza el máximo; y log\log de un producto es la suma de logs. Por eso maximizar la likelihood equivale a maximizar la log-likelihood, que además es numéricamente estable.