← Volver a Aprende con CDIA

Deep LearningFunciones de activación

IntermedioDeep Learning9 min de lectura

Funciones de activación

La chispa no lineal que le da sentido a apilar capas: del escalón a la sigmoide, y de ahí a la ReLU que destrabó el deep learning. Por qué sin ellas una red profunda sería solo una recta.

Hay una pregunta que suena tonta pero tiene una respuesta profunda: si una red neuronal es solo un montón de sumas y multiplicaciones, ¿por qué no colapsa en una simple recta? La respuesta es una piecita que se cuela entre cada capa y que hace todo el trabajo pesado de la no linealidad: la función de activación. Sin ella, apilar cien capas sería tan potente como tener una sola. Con ella, la red puede aprender curvas, fronteras retorcidas y patrones que ninguna recta captaría.

Por qué sin activación no hay "profundidad"

Cada neurona calcula una suma ponderada de sus entradas: . Eso es una operación lineal. Y aquí está el detalle matemático que lo cambia todo: la composición de funciones lineales sigue siendo lineal. Si apilas capas que solo suman y multiplican, por muchas que pongas, el resultado equivale a una única capa lineal. Toda esa profundidad, desperdiciada.

La función de activación rompe la linealidad. La neurona no entrega , entrega , y esa pequeña curva, repetida capa tras capa, es lo que le da a la red su capacidad de aproximar casi cualquier función.

El zoológico, en orden histórico

Escalón: el abuelo

El perceptrón original usaba un escalón: si supera un umbral, dispara 1; si no, 0. Intuitivo, pero inútil para aprender: es plano en todas partes, y una función plana tiene pendiente cero. Como el entrenamiento por descenso de gradiente necesita justamente pendientes que le digan hacia dónde moverse, el escalón deja a la red a ciegas.

Sigmoide: suavizar el escalón

La sigmoide es el escalón hecho curva suave. Aplasta cualquier número al rango :

Fue la reina durante años porque es derivable en todas partes y su salida se lee como una probabilidad. La misma que usamos en regresión logística.

Tanh: la sigmoide centrada

La tangente hiperbólica tiene la misma forma de S, pero va de a y está centrada en cero. Esa simetría suele ayudar al entrenamiento, así que durante un tiempo se prefirió a la sigmoide en las capas ocultas.

sigmoide / tanh (curva en S) ReLU (quiebre)
Las activaciones tipo S (sigmoide, tanh) se saturan en los extremos —se aplanan—, mientras que ReLU es una recta partida: cero a la izquierda, identidad a la derecha.

El problema que frenó al deep learning: gradientes que se desvanecen

Sigmoide y tanh comparten un defecto grave. En sus extremos son casi planas: para un muy grande o muy pequeño, la pendiente es prácticamente cero. Y cuando el backpropagation multiplica muchas de esas pendientes minúsculas al retroceder por decenas de capas, el gradiente se desvanece: llega convertido en polvo a las primeras capas, que dejan de aprender.

Durante años, ese vanishing gradient fue el muro que impedía entrenar redes de verdad profundas.

ReLU: la idea tonta que lo destrabó todo

La solución resultó casi ridícula de simple. La ReLU (Rectified Linear Unit) es:

Si el valor es negativo, cero; si es positivo, se deja igual. Eso es todo. Pero tiene dos virtudes enormes: en la zona positiva su pendiente es exactamente 1 —no se desvanece por más capas que atraviese— y es baratísima de calcular. La ReLU es, en buena medida, lo que hizo prácticas las redes profundas modernas, y sigue siendo la opción por defecto en las capas ocultas.

No es perfecta: una neurona ReLU que cae siempre en la zona negativa entrega cero para siempre y "muere" (el problema de las dying ReLU). Por eso existen variantes como Leaky ReLU, que deja pasar una pizca de los negativos en vez de aplanarlos del todo, o GELU, una versión suave muy usada hoy en los Transformers.

Softmax: el caso especial de la salida

Todo lo anterior vive en las capas ocultas. Pero en la última capa, cuando la red debe elegir entre varias clases, se usa otra función: softmax. Toma los números crudos de salida y los convierte en una distribución de probabilidad —todos positivos, sumando 1:

Es la generalización de la sigmoide a más de dos clases, y es la misma pieza que reparte la atención en el mecanismo de atención y que, en un LLM, convierte los puntajes en la probabilidad de cada palabra siguiente. Vale la pena reconocerla: aparece por todas partes.

La chuleta práctica

  • Capas ocultas → empieza con ReLU. Si sospechas de neuronas muertas, prueba Leaky ReLU o GELU.
  • Salida, clasificación binariasigmoide (una probabilidad).
  • Salida, varias clasessoftmax (una distribución).
  • Salida, regresiónninguna: deja el número tal cual.

En resumen

La función de activación es la chispa no lineal que le da sentido a apilar capas: sin ella, una red profunda no sería más que una recta disfrazada. El recorrido histórico —del escalón plano a la sigmoide/tanh que se saturan, y de ahí a la ReLU que destrabó el gradiente— es también la historia de por qué el deep learning despegó cuando lo hizo. Y el softmax cierra la jugada convirtiendo la salida en probabilidades. Con las activaciones claras, ya podemos ver cómo la red aprende a ajustar sus pesos: eso es el backpropagation.