Redes Neuronales Modulares
Una red neuronal modular divide el problema en subredes especializadas cuyas salidas se combinan. Deslindamos la modularidad de los ensembles, las cascadas y la mezcla de expertos (MoE) —hoy clave para escalar los grandes modelos de lenguaje— y separamos los ejes de arquitectura, enrutamiento y composición.
Una red neuronal modular se compone de varios módulos o subredes especializados, cada uno encargado de una parte del problema, cuyas salidas se combinan para dar la respuesta final. Su motivación es de ingeniería —descomponer el problema, reutilizar bloques y ganar eficiencia—, no «emular el pensamiento humano»: la modularidad se inspira en la organización del cerebro solo como principio de diseño.
Conceptos que conviene no mezclar
El término reúne ideas distintas. La modularidad propiamente dicha es una propiedad interna de un mismo modelo dividido en subredes. Un ensemble es otra cosa: varios modelos independientes que se ejecutan en paralelo y cuyas predicciones se promedian o se votan; se activan todos. Una cascada encadena módulos en serie, donde la salida de uno alimenta al siguiente. Y una mezcla de expertos (Mixture of Experts, MoE) combina varios «expertos» con una red de enrutamiento que, según la entrada, activa solo algunos.
La mezcla de expertos hoy
La mezcla de expertos con enrutamiento disperso se ha vuelto clave para escalar los grandes modelos de lenguaje, porque desacopla los parámetros totales del cómputo por cada token: añadir expertos multiplica la capacidad, pero solo se activan unos pocos por token, de modo que el coste se mantiene acotado. Jacobs, Jordan, Nowlan y Hinton publicaron una mezcla adaptativa de expertos en 1991; Shazeer y sus colegas llevaron en 2017 el enrutamiento disperso a gran escala; el Switch Transformer (2021) la llevó a modelos de un billón de parámetros activando un solo experto por token, y modelos recientes como Mixtral la usan para igualar a modelos densos mucho mayores con una fracción de los parámetros activos.
Tres ejes para entenderlas
Conviene separar tres ejes ortogonales que el uso corriente confunde: la arquitectura (cómo se divide la red en módulos), el enrutamiento (cómo se decide qué módulo actúa ante cada entrada) y la composición (cómo se combinan las salidas: suma ponderada, promedio, votación o encadenamiento).
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.