Redes Neuronales Profundas
Una red neuronal profunda tiene varias capas ocultas; «profunda» alude al número de capas. Aclaramos que no es una subdisciplina sino una clase de modelos, y que más profundidad no implica mejor rendimiento: depende de la arquitectura, los datos y la tarea. Repasamos sus arquitecturas y la tendencia a la eficiencia.
Una red neuronal profunda es una red neuronal artificial con varias capas ocultas entre la entrada y la salida. El adjetivo «profunda» se refiere a esa profundidad —el número de capas—, no a ninguna otra cualidad. Cada capa transforma la salida de la anterior, de modo que la red va componiendo representaciones sucesivas de los datos.
Una precisión de partida: una red profunda no es una «subdisciplina», sino una clase de modelos definida por su profundidad. La subdisciplina es el aprendizaje profundo como campo; las redes profundas son los modelos con los que ese campo trabaja.
Más profundo no significa mejor
Es un error frecuente afirmar que las redes profundas superan, en general, a las menos profundas. El rendimiento depende de la arquitectura, los datos disponibles, la regularización y la tarea; añadir capas a ciegas puede no ayudar o incluso perjudicar. De hecho, el teorema de aproximación universal muestra que una red con una sola capa oculta y suficientes neuronas ya puede aproximar cualquier función continua en un dominio acotado: en teoría, la profundidad no es imprescindible para la expresividad. La profundidad puede aportar eficiencia de representación en familias concretas. Telgarsky construye funciones que redes profundas pequeñas representan y que ciertas redes menos profundas solo aproximan con un número exponencialmente mayor de nodos. Es un resultado de separación bajo arquitecturas y funciones definidas, no la promesa de que cualquier red profunda logre la misma precisión con menos parámetros. En la práctica también aumenta la ruta de cómputo y puede dificultar la optimización; ReLU, normalización y conexiones residuales mitigan problemas específicos, pero no eliminan la necesidad de validar arquitectura, datos y regularización.
Arquitecturas
Distintas arquitecturas son «profundas» cuando componen muchos bloques, y se distinguen por la operación y el patrón de conexiones. Un perceptrón multicapa apila capas densas; una red recurrente reutiliza estado sobre una secuencia. AlexNet es un caso histórico de bloques convolucionales profundos aplicados a visión. El Transformer original sustituyó recurrencia y convolución por atención en traducción. Esos trabajos documentan arquitecturas y tareas concretas; «dominante» o «base de todos los modelos actuales» requeriría definir fecha, corpus y cuota, por lo que aquí no se usa como propiedad técnica.
Escala y eficiencia
Escalar no significa solo añadir capas. El estudio de leyes de escalado de modelos de lenguaje midió cómo la pérdida variaba con parámetros, datos y cómputo dentro de sus regímenes experimentales. El informe que definió modelos fundacionales subraya que un modelo entrenado a gran escala se adapta después a muchas tareas, junto con riesgos y límites. También existen diseños que cambian la operación dominante: Mamba usa estados selectivos y tiempo lineal en la longitud de secuencia. Un resultado eficiente en un benchmark no establece una tendencia universal: deben compararse calidad, memoria, latencia, datos y hardware para la tarea concreta.
Piezas que usan este término
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.