Redes Neuronales Profundas
Una red neuronal profunda tiene varias capas ocultas; «profunda» alude al número de capas. Aclaramos que no es una subdisciplina sino una clase de modelos, y que más profundidad no implica mejor rendimiento: depende de la arquitectura, los datos y la tarea. Repasamos sus arquitecturas y la tendencia a la eficiencia.
Una red neuronal profunda es una red neuronal artificial con varias capas ocultas entre la entrada y la salida. El adjetivo «profunda» se refiere a esa profundidad —el número de capas—, no a ninguna otra cualidad. Cada capa transforma la salida de la anterior, de modo que la red va componiendo representaciones sucesivas de los datos.
Una precisión de partida: una red profunda no es una «subdisciplina», sino una clase de modelos definida por su profundidad. La subdisciplina es el aprendizaje profundo como campo; las redes profundas son los modelos con los que ese campo trabaja.
Más profundo no significa mejor
Es un error frecuente afirmar que las redes profundas superan, en general, a las menos profundas. El rendimiento depende de la arquitectura, los datos disponibles, la regularización y la tarea; añadir capas a ciegas puede no ayudar o incluso perjudicar. De hecho, el teorema de aproximación universal muestra que una red con una sola capa oculta y suficientes neuronas ya puede aproximar cualquier función continua: en teoría, la profundidad no es imprescindible para la expresividad. Lo que la profundidad aporta en la práctica es eficiencia: una red profunda puede lograr la misma precisión con muchos menos parámetros que una red ancha equivalente, y construye una jerarquía de representaciones. Pero tiene un precio —mayor coste de cómputo, riesgo de sobreajuste y dificultades de entrenamiento como el desvanecimiento del gradiente—, mitigado, que no eliminado, por técnicas como las funciones ReLU, la normalización o las conexiones residuales.
Arquitecturas
Distintas arquitecturas son «profundas» cuando apilan varias capas, y se diferencian por cómo las conectan: el perceptrón multicapa apila capas densas; las redes convolucionales, bloques de convolución, dominantes en visión; las redes recurrentes procesan secuencias; y los Transformers apilan bloques de atención y son la base de los modelos de lenguaje y multimodales actuales.
Escala y eficiencia
El escalado —más parámetros, más capas y más datos— ha impulsado los modelos fundacionales de los últimos años. Pero conviene evitar la exageración: en paralelo se investigan alternativas más eficientes, como los modelos de espacio de estados o arquitecturas sin atención, y modelos de lenguaje pequeños competitivos. La tendencia real no es «profundidad ilimitada», sino obtener más capacidad con menos cómputo, lo que refuerza la idea de que la ventaja depende del problema, no de la profundidad en abstracto.
Piezas que usan este término
- Volkswagen Incorporará ChatGPT en Sus Vehículos (2024-01-09)
- Perplexity AI Recibe Nueva Financiación (2024-01-05)
- En el sector financiero, la IA se utiliza para procesar grandes cantidades de datos y predecir tendencias del mercado (2024-01-05)
- Transparencia y Regulación en IA (2023-12-31)
- Microsoft y Sindicatos: Forjando un Nuevo Camino en la Era de la Inteligencia Artificial (2023-12-12)
- ¿Qué es Stable Diffusion? (2023-12-10)
- ¿Qué es Grok? (2023-12-01)
- ¿Qué es Microsoft Copilot? (2023-10-20)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.