Tasa de Aprendizaje
La tasa de aprendizaje fija el tamaño del paso del descenso de gradiente: demasiado alta y el entrenamiento diverge, demasiado baja y se arrastra. Repasamos su papel, las planificaciones (warmup, coseno) y los métodos adaptativos como Adam.
La tasa de aprendizaje es el hiperparámetro que fija el tamaño del paso en el descenso de gradiente: determina cuánto se ajustan los parámetros de un modelo en cada actualización. En cada iteración el algoritmo calcula el gradiente de la función de pérdida y lo multiplica por la tasa de aprendizaje para decidir la magnitud del cambio; de ahí que en la literatura de optimización se la conozca también como «tamaño de paso» (step size).
Goodfellow, Bengio y Courville la describen en su manual Deep Learning como «quizá el hiperparámetro más importante» a la hora de entrenar una red neuronal, porque gobierna directamente si el entrenamiento converge, lo hace de forma estable o fracasa por completo.
Qué ocurre si es demasiado alta o demasiado baja
El valor correcto vive en un equilibrio estrecho. Si la tasa es demasiado alta, cada paso sobrepasa el mínimo de la función de pérdida: la optimización oscila de un lado a otro o diverge, y la pérdida puede dispararse en lugar de bajar. Si es demasiado baja, cada paso avanza tan poco que el entrenamiento se vuelve lentísimo y consume tiempo y cómputo; además, el modelo puede estancarse en mesetas o mínimos locales pobres sin impulso para salir de ellos. Conviene precisar un matiz que la divulgación suele repetir mal: en redes de alta dimensión los obstáculos más frecuentes no son tanto los mínimos locales como los puntos de silla y las regiones planas del paisaje de pérdida.
Planificaciones de la tasa
Rara vez se mantiene una tasa fija durante todo el entrenamiento. Las planificaciones (schedules) la varían con el tiempo. Las clásicas aplican decaimiento: la reducen por escalones (step decay) o de forma exponencial para dar pasos grandes al principio y afinar al final. El calentamiento (warmup) hace lo contrario al comienzo: parte de un valor pequeño y lo eleva gradualmente hasta el objetivo. No existe una receta única. El Transformer original usó 4.000 pasos de warmup y después un descenso por raíz inversa. SGDR, de Loshchilov y Hutter, propuso recocido por coseno: la tasa sigue media onda desde un máximo hasta un mínimo y los reinicios en caliente la devuelven al pico. GPT-3 documentó warmup lineal seguido de descenso por coseno. Son ejemplos fechados de esos mecanismos, no una norma para todo modelo.
Métodos adaptativos y cómo elegirla
Los métodos adaptativos ajustan un paso efectivo distinto para cada parámetro a partir del historial de gradientes. AdaGrad, de Duchi y colaboradores, fue pionero; RMSProp, propuesto por Geoffrey Hinton, usa una media móvil de los gradientes al cuadrado; y Adam, de Kingma y Ba, combina esa idea con el momento. Conviene recordar algo que muchos textos confunden: estos métodos no eliminan la tasa de aprendizaje, sino que siguen dependiendo de una tasa base que hay que fijar como hiperparámetro. Para elegir ese valor, Leslie N. Smith describió un learning rate range test: ejecutar un entrenamiento mientras la tasa aumenta entre dos límites y registrar la precisión y la pérdida frente a cada valor. El barrido ayuda a proponer fronteras para un experimento posterior; no garantiza por sí solo la mejor tasa para cualquier modelo.
Piezas que usan este término
- Cómo leer un paper de IA sin ser investigador (2026-07-26)
- Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña (2026-07-25)
- Centros de datos en el espacio: la física que decide si la IA se mudará a la órbita (2026-07-13)
- Andrej Karpathy deja OpenAI para centrarse en proyectos personales (2024-02-13)
- Cómo aprende una red profunda: del forward pass al gradiente (2023-05-09)
- Escalar aprendizaje automático: cuatro cuellos de botella distintos (2023-05-09)
- Transferencia de conocimiento y aprendizaje semi-supervisado en modelos de lenguaje (2023-05-09)
- Herramientas y técnicas para entrenar modelos de lenguaje personalizados (2023-05-09)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.