IA 360
Glosario Inteligencia Artificial

Gradiente Descendente por Lotes

El descenso de gradiente por lotes calcula el gradiente con todo el conjunto de entrenamiento antes de cada actualización: da pasos exactos y estables, pero lentos y difíciles de escalar frente al descenso estocástico y el mini-batch.

Admin IA360 3 min de lectura Generado con IA Read in English
Gradiente Descendente por Lotes

El descenso de gradiente por lotes (Batch Gradient Descent) es un algoritmo de optimización que ajusta los parámetros de un modelo para minimizar una función de pérdida. Su rasgo distintivo es el momento del cálculo: obtiene el gradiente de esa función usando el conjunto de entrenamiento completo antes de cada actualización de los parámetros.

Cómo funciona: un gradiente exacto sobre todo el conjunto

En cada iteración, el algoritmo recorre todos los ejemplos de entrenamiento, suma el error que produce cada uno y calcula el gradiente promedio de la función de pérdida. Solo entonces da un paso: resta a los parámetros ese gradiente multiplicado por la tasa de aprendizaje (θ = θ − η·∇J(θ)). Como describe Sebastian Ruder en su repaso de los algoritmos de descenso de gradiente, esto supone una única actualización por cada pasada completa a los datos. El gradiente resultante es exacto —la dirección real de máxima pendiente sobre todo el conjunto—, de modo que la trayectoria hacia el mínimo es suave y apenas ruidosa.

Ventajas y límites

La ventaja es la estabilidad. Sobre superficies de error convexas el método está garantizado a converger al mínimo global, y a un mínimo local en las no convexas, con actualizaciones que no oscilan. El precio es la escala. Calcular el gradiente sobre todo el conjunto para dar un solo paso resulta lento, y exige mantener todos los datos en memoria: cuando el conjunto no cabe, el método se vuelve inviable, como advierte el propio Ruder. Tampoco permite el aprendizaje en línea, es decir, incorporar ejemplos nuevos sobre la marcha, porque necesita el lote entero para cada paso.

Batch frente a estocástico y mini-batch

El contraste con sus dos parientes ordena la elección. El descenso estocástico (SGD) actualiza los parámetros con un único ejemplo por paso: muchas actualizaciones, rápidas pero ruidosas, que hacen fluctuar la función objetivo. El mini-batch usa un subconjunto pequeño en cada paso, un término medio que, como señala Ruder, reduce la varianza de las actualizaciones y logra una convergencia más estable. Así, el batch ofrece actualizaciones exactas pero infrecuentes; SGD y mini-batch, actualizaciones aproximadas pero numerosas y escalables. En problemas convexos el batch converge de forma limpia, pero en la práctica del aprendizaje profundo, con millones de datos, domina el mini-batch: el manual Deep Learning de Goodfellow, Bengio y Courville y el texto Dive into Deep Learning coinciden en que es la opción por defecto para entrenar redes neuronales, por su equilibrio entre eficiencia de cómputo y estabilidad.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar