Why this matters for ML
Una capa de red neuronal es, en su corazón, : una multiplicación por matriz más un sesgo. Toda transformación de features (rotar, proyectar, mezclar) es una matriz. Entender la matriz como transformación (no como tabla de números) es el salto conceptual más rentable de todo el pilar.
Concepts covered
- Matriz como datos y como linear map (transformación lineal)
- Matrix–vector product (dos interpretaciones)
- Matrix–matrix product como composición de transformaciones
- Transpose
- Matrices especiales: identity, diagonal, triangular, orthogonal, symmetric
- No conmutatividad ()
Intuition first
🎬 3Blue1Brown E.o.L.A. cap. 3 ("Linear transformations and matrices") y cap. 4 ("Matrix multiplication as composition"). Estos dos videos son oro puro: la matriz es dónde caen los vectores base.
Theory & key results
Linear map: una función que respeta suma y scaling: y . Toda transformación lineal se representa con una matriz, y las columnas de esa matriz son a dónde van los vectores base.
Matrix–vector product — dos formas de leerlo (¡domina ambas!):
- Fila por fila: cada entrada del resultado es el dot product de una fila de con .
- Columna (la más importante): es una combinación lineal de las columnas de , con pesos : Esta segunda lectura explica el column space (LA-04) y por qué tiene solución solo si está en el span de las columnas.
Matrix–matrix product: representa "aplica , luego " — composición. Entrada = dot product de la fila de con la columna de . Dimensiones: ; deben "encajar" en .
No conmuta: en general (rotar-luego-estirar ≠ estirar-luego-rotar).
Transpose : refleja sobre la diagonal, . Reglas: , .
Matrices especiales:
- Identity : no hace nada, .
- Diagonal: escala cada eje por separado.
- Triangular (upper/lower): ceros bajo/sobre la diagonal — clave para resolver sistemas (LA-04) y en LU/Cholesky.
- Symmetric (): aparece en covariance matrices y Hessians (LA-08).
- Orthogonal (): rotaciones/reflexiones, preservan longitudes y ángulos (LA-06).
Worked example
(un shear). ¿A dónde manda la base? Columna 1 = ; columna 2 = . Entonces queda fijo y se inclina a : la matriz es esas dos columnas. Composición: (shear doble). Verás que multiplicar acumula transformaciones.
Notebook exercises (by hand)
- Multiplica e interpreta geométricamente.
- Con , : calcula y ; confirma que difieren.
- Escribe como combinación lineal de las columnas de .
- Da la matriz que rota 90° en el plano (pista: ¿a dónde van y ?).
- Verifica con las matrices del ej. 2.
- Explica por qué (capa de red) es afín, no puramente lineal, y qué añade .
Python lab
import numpy as np
A = np.array([[1., 2.],[3., 4.]])
B = np.array([[0., 1.],[1., 0.]])
print("AB=\n", A @ B, "\nBA=\n", B @ A) # distintos
x = np.array([3., -1.])
# matrix-vector como combinación de columnas:
col_view = x[0]*A[:,0] + x[1]*A[:,1]
print(np.allclose(A @ x, col_view)) # True
# a dónde van los basis vectors = columnas de A
print("A e1 =", A @ np.array([1.,0.]), " (col 0)")
# rotación 90°
theta = np.pi/2
R = np.array([[np.cos(theta), -np.sin(theta)],
[np.sin(theta), np.cos(theta)]])
print("R@(1,0)=", R @ np.array([1.,0.])) # ~ (0,1)
Examen final 📝
Intenta cada nivel antes de abrir las soluciones.
🟡 Medio
- Con , : calcula y y confirma que difieren.
- Da la matriz que refleja sobre el eje y verifica a dónde manda .
🟠 Medio-difícil
- Demuestra que para matrices genéricas.
- Una matriz de rotación compuesta consigo misma debería rotar . Verifica usando identidades trigonométricas (te salen las fórmulas de ángulo doble).
🔴 Difícil
- Una capa de red es con . Explica qué dimensiones tienen entrada y salida, por qué esta capa no puede aumentar el rank de la información más allá de 3, y qué añade una segunda capa (composición).
- Demuestra que el conjunto de matrices ortogonales (con ) es cerrado bajo producto (si son ortogonales, también). ¿Qué significa geométricamente?
✅ Soluciones
- , . Distintos ⇒ no conmutan.
- ; manda .
- Entrada de es . Entrada de es . Iguales.
- da entradas y ⇒ .
- Entrada , salida . Como tiene a lo sumo rank 3, : la salida vive en un subspace de dimensión ≤3. La segunda capa compone: , una sola transformación lineal (por eso, sin no-linealidad entre capas, dos capas lineales colapsan a una — motivo de las activaciones).
- . Geométricamente: componer dos transformaciones que preservan longitudes/ángulos (rotaciones/reflexiones) da otra que también las preserva.