Función de Activación
La función de activación es la pieza que introduce no linealidad en una red neuronal, y sin ella las redes profundas no podrían aprender patrones complejos. Explicamos por qué es imprescindible, las principales funciones —sigmoide, tanh, ReLU y softmax— con sus virtudes y problemas, y por qué la ReLU marcó un antes y un después.
La función de activación es la función que se aplica a la salida de una neurona —a la suma ponderada de sus entradas— para producir su respuesta, y su papel esencial es introducir no linealidad en la red. Es una pieza pequeña con una importancia enorme.
Por qué es imprescindible
La razón es algebraica. La composición de dos transformaciones afines sigue siendo afín: sin una activación no lineal entre capas, multiplicar matrices y sumar sesgos puede reescribirse como una sola capa. El capítulo de redes feedforward de Deep Learning muestra por qué la capa oculta necesita esa no linealidad. El resultado teórico debe decirse con cuidado: el teorema de aproximación de Cybenko establece, bajo condiciones concretas, que una red con suficientes unidades sigmoides puede aproximar funciones continuas sobre un dominio compacto. No afirma que cualquier red, profundidad o entrenamiento encuentre automáticamente la función deseada.
Las funciones clásicas
Hay varias, cada una con su carácter. La sigmoide comprime cualquier valor al rango (0, 1), lo que la hace útil para expresar probabilidades, pero satura y sufre el desvanecimiento del gradiente. La tanh comprime a (−1, 1) y tiene la ventaja de estar centrada en cero. La ReLU deja pasar los valores positivos y pone a cero los negativos. Nair y Hinton mostraron en 2010 que esas unidades rectificadas podían entrenar modelos profundos con buen rendimiento sin la saturación positiva de sigmoide o tanh. Su sencillez no garantiza una neurona útil: si las entradas permanecen en la zona negativa, el gradiente local es cero y la unidad puede dejar de actualizarse. Leaky ReLU conserva una pendiente pequeña en esa zona; GELU suaviza la compuerta con otra formulación. Son alternativas con supuestos distintos, no reparaciones universales. Y la softmax se coloca en la capa de salida para convertir un vector en una distribución de probabilidad sobre las clases.
La ReLU, un punto de inflexión
Merece un lugar aparte. AlexNet aplicó la ReLU a todas sus capas convolucionales y totalmente conectadas; en una comparación auxiliar sobre CIFAR-10, una red de cuatro capas con ReLU alcanzó un 25 % de error de entrenamiento seis veces antes que su equivalente con tanh. Los autores advirtieron que la magnitud variaba con la arquitectura, aunque observaban de forma consistente un aprendizaje varias veces más rápido frente a unidades saturantes. Fue un cambio pequeño en apariencia, pero de consecuencias enormes para el auge del aprendizaje profundo.
Piezas que usan este término
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.