El aprendizaje profundo (deep learning) es la rama del machine learning que apila muchas capas de "neuronas" artificiales para aprender representaciones cada vez más abstractas de los datos. Es la tecnología detrás del reconocimiento de imágenes, la voz y los grandes modelos de lenguaje.
Cómo abordaremos el tema
En vez de empezar por lo intimidante —arquitecturas gigantes, miles de millones de parámetros—, este módulo hace lo contrario: arranca en la pieza más pequeña, una sola neurona artificial, y va sumando capas e ideas hasta que "red profunda" deja de sonar a magia. Si entiendes la unidad mínima, el resto es repetirla con criterio.
¿Qué tiene de "profundo"?
Una red neuronal es una función que transforma la entrada en la salida pasando por capas intermedias. Cuando hay muchas capas apiladas, hablamos de una red profunda. Cada capa aprende a detectar patrones un poco más complejos que la anterior:
- En una imagen: la primera capa detecta bordes, la siguiente formas, la siguiente objetos.
- En texto: de letras a palabras, de palabras a significado.
Esa capacidad de aprender representaciones jerárquicas por sí sola —sin que un humano diseñe las características a mano— es lo que hace tan potente al deep learning.
¿Por qué ahora?
Las ideas son de los años 50 y 80, pero despegaron en la última década por la combinación de tres factores: muchos datos, hardware potente (GPU) y mejores algoritmos de entrenamiento. La misma receta —descenso de gradiente a gran escala— llevada al extremo.
El plan de este módulo
- El perceptrón — la neurona artificial: la unidad mínima de todo.
- Redes neuronales — apilar neuronas en capas para resolver problemas que una sola no puede.
- Funciones de activación — la chispa no lineal sin la cual apilar capas no serviría de nada.
- Backpropagation — el algoritmo que permite a la red aprender de sus errores.
Con esa base, la arquitectura estrella de hoy —el Transformer— y los grandes modelos de lenguaje dejan de ser una caja negra.
Para llevar
El deep learning apila capas de neuronas para aprender representaciones cada vez más abstractas, sin diseñar las características a mano. En este módulo lo construiremos desde cero: del perceptrón a la red multicapa y su algoritmo de aprendizaje. Todo es, en el fondo, la misma idea de ajustar parámetros con descenso de gradiente, repetida a una escala enorme.
