IA 360
Glosario Inteligencia Artificial

Gradiente Descendente

El gradiente descendente es el algoritmo que entrena a la mayoría de los modelos de aprendizaje profundo: minimiza una función avanzando, paso a paso, en la dirección opuesta a su gradiente. Explicamos su mecánica, el papel crucial de la tasa de aprendizaje, sus variantes según cuántos datos usa, las extensiones como Adam y sus límites.

Admin IA360 4 min de lectura Generado con IA Read in English
Gradiente Descendente

El gradiente descendente es un algoritmo iterativo de optimización que minimiza una función avanzando, paso a paso, en la dirección opuesta a su gradiente.

La mecánica

El gradiente de una función apunta en la dirección de máximo crecimiento; por eso, para minimizar, hay que moverse en la dirección opuesta. En cada iteración, el algoritmo actualiza los parámetros con una regla sencilla: nuevos parámetros = parámetros − (tasa de aprendizaje) × gradiente. Repitiendo ese paso, desciende por la superficie de la pérdida hacia un mínimo.

La tasa de aprendizaje

El hiperparámetro más delicado es la tasa de aprendizaje, el tamaño del paso. Si es demasiado grande, el algoritmo se pasa de largo el mínimo y puede oscilar o divergir; si es demasiado pequeña, converge con una lentitud exasperante. Ajustarla bien es un problema práctico central, y a menudo se usan programas que la van reduciendo a lo largo del entrenamiento.

Sus variantes

Según cuántos datos usa en cada paso, hay tres versiones. El gradiente descendente por lotes calcula el gradiente sobre todo el conjunto de datos: estable, pero lento. El estocástico (SGD) usa un solo ejemplo por paso: rápido, pero ruidoso. Y el mini-batch, que usa pequeños lotes, equilibra ambos y es el estándar. Sobre esta base se construyen extensiones como el momentum, que acelera la bajada, y los optimizadores adaptativos como Adam, que afina el paso de cada parámetro. Documentación: guía técnica de descenso de gradiente; artículo original de Adam.

Sus límites

El método tiene puntos débiles. En funciones no convexas —como las de una red neuronal— puede quedar atrapado en mínimos locales o ralentizarse cerca de los puntos de silla, que en dimensiones altas son más frecuentes que los malos mínimos. Y es sensible a la escala de las características: por eso conviene normalizar los datos antes de entrenar. Documentación: análisis de puntos de silla.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar