Perceptrón Multicapa
El perceptrón multicapa es una red feedforward con capas ocultas y activaciones no lineales, entrenada por retropropagación. Corregimos un error extendido —no lo creó Hinton; sus raíces están en Rosenblatt (1958)—, aclaramos que «multicapa» no es «profundo» y mostramos que sigue vivo dentro de los Transformers.
El perceptrón multicapa (MLP) es una red neuronal artificial de tipo feedforward —sin ciclos— y totalmente conectada, organizada en capas: una de entrada, una o más capas ocultas y una de salida, con funciones de activación no lineales y entrenada mediante retropropagación. Su requisito mínimo es tener al menos una capa oculta.
Una corrección histórica
Conviene deshacer un error extendido: el perceptrón multicapa no lo creó Geoffrey Hinton. Sus raíces incluyen el perceptrón que Frank Rosenblatt publicó en 1958; ese artículo no formuló por sí solo el MLP moderno. Entre los antecedentes del método usado para entrenarlo están la diferenciación en modo inverso que Seppo Linnainmaa desarrolló en su tesis de 1970 y publicó en 1976 y la formulación general de retropropagación de la tesis de Paul Werbos de 1974. Lo que Hinton hizo, junto a David Rumelhart y Ronald Williams, fue popularizar en 1986 el algoritmo de retropropagación, que permitió entrenar con eficacia redes con capas ocultas. En otras palabras, Hinton no inventó el MLP: contribuyó a hacer práctico su entrenamiento.
Multicapa no es lo mismo que profundo
Otra precisión: «multicapa» no implica «profundo». Basta una sola capa oculta para tener un MLP legítimo, y esa red es poco profunda. «Profundo» alude a muchas capas ocultas apiladas: todo MLP profundo es multicapa, pero no todo MLP es profundo.
Cómo funciona
Cada neurona calcula una suma ponderada de sus entradas más un sesgo y le aplica una función de activación no lineal. Esa no linealidad es imprescindible: sin ella, apilar capas no aportaría nada, porque la composición de transformaciones lineales sigue siendo lineal y la red equivaldría a un único modelo lineal. El teorema de aproximación universal (Cybenko, 1989; Hornik, 1991) muestra que un MLP con una sola capa oculta y suficientes neuronas ya puede aproximar cualquier función continua sobre un dominio acotado; la profundidad ayuda a la eficiencia, pero no es un requisito para esa expresividad. El entrenamiento por retropropagación propaga el error desde la salida hacia atrás, mediante la regla de la cadena, para ajustar los pesos.
Su lugar hoy
El MLP es el ladrillo canónico de la red totalmente conectada y sigue muy vivo: dentro de cada capa de un Transformer hay un bloque que es, literalmente, un MLP aplicado a cada posición —dos transformaciones lineales con una activación no lineal en medio—. De modo que esta idea con raíces en los años cincuenta sostiene también los grandes modelos de lenguaje actuales.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.