IA 360
Glosario Inteligencia Artificial

Redes Neuronales Modulares

Una red neuronal modular divide el problema en subredes especializadas cuyas salidas se combinan. Deslindamos la modularidad de los ensembles, las cascadas y la mezcla de expertos (MoE) —hoy clave para escalar los grandes modelos de lenguaje— y separamos los ejes de arquitectura, enrutamiento y composición.

Admin IA360 4 min de lectura Generado con IA Read in English
Redes Neuronales Modulares

Una red neuronal modular se compone de varios módulos o subredes especializados, cada uno encargado de una parte del problema, cuyas salidas se combinan para dar la respuesta final. Su motivación es de ingeniería —descomponer el problema, reutilizar bloques y ganar eficiencia—, no «emular el pensamiento humano»: la modularidad se inspira en la organización del cerebro solo como principio de diseño.

Conceptos que conviene no mezclar

El término reúne ideas distintas. La modularidad propiamente dicha es una propiedad interna de un mismo modelo dividido en subredes. Un ensemble es otra cosa: varios modelos independientes que se ejecutan en paralelo y cuyas predicciones se promedian o se votan; se activan todos. Una cascada encadena módulos en serie, donde la salida de uno alimenta al siguiente. Y una mezcla de expertos (Mixture of Experts, MoE) combina varios «expertos» con una red de enrutamiento que, según la entrada, activa solo algunos.

La mezcla de expertos hoy

La mezcla de expertos con enrutamiento disperso se ha vuelto clave para escalar los grandes modelos de lenguaje, porque desacopla los parámetros totales del cómputo por cada token: añadir expertos multiplica la capacidad, pero solo se activan unos pocos por token, de modo que el coste se mantiene acotado. Jacobs, Jordan, Nowlan y Hinton publicaron una mezcla adaptativa de expertos en 1991; Shazeer y sus colegas llevaron en 2017 el enrutamiento disperso a gran escala; el Switch Transformer (2021) la llevó a modelos de un billón de parámetros activando un solo experto por token, y modelos recientes como Mixtral la usan para igualar a modelos densos mucho mayores con una fracción de los parámetros activos.

Tres ejes para entenderlas

Conviene separar tres ejes ortogonales que el uso corriente confunde: la arquitectura (cómo se divide la red en módulos), el enrutamiento (cómo se decide qué módulo actúa ante cada entrada) y la composición (cómo se combinan las salidas: suma ponderada, promedio, votación o encadenamiento).

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar