DistilBERT
DistilBERT es una versión compacta de BERT por destilación de conocimiento: según su artículo de 2019, un 40 % más pequeño, un 60 % más rápido y con el 97 % del rendimiento. Explicamos cómo funciona la destilación, por qué no es «podar» el modelo y qué lugar ocupa frente a la compresión actual.
DistilBERT es una versión compacta de BERT obtenida por destilación de conocimiento. La presentaron Victor Sanh y sus colegas de Hugging Face en 2019. Según su artículo original, reduce el tamaño de BERT en torno a un 40 % (de 110 a 66 millones de parámetros), es alrededor de un 60 % más rápido en inferencia y conserva aproximadamente el 97 % de su rendimiento en el conjunto de pruebas GLUE.
Cómo funciona la destilación
La destilación de conocimiento, formalizada por Hinton, Vinyals y Dean en 2015, entrena un modelo pequeño (el «estudiante») para que reproduzca la distribución de probabilidades de salida de un modelo grande (el «maestro», aquí BERT), en lugar de aprender solo de las etiquetas correctas. Esas probabilidades suavizadas transmiten cómo generaliza el maestro —qué clases considera parecidas—, una señal más rica que la etiqueta dura. DistilBERT combina tres pérdidas durante el preentrenamiento: la de destilación, la de modelado de lenguaje enmascarado propia de BERT y una de similitud entre los estados internos de ambos modelos. Su arquitectura reduce a la mitad el número de capas (de doce a seis) y se inicializa a partir de una de cada dos capas del maestro.
Un matiz importante
Conviene precisar qué hace la destilación, porque suele describirse mal. DistilBERT no elimina «parámetros redundantes» de BERT ni lo poda. Se diseña una red nueva más pequeña y se la entrena para imitar el comportamiento del modelo grande. La reducción de tamaño viene de una decisión de arquitectura —menos capas—, y la conservación del rendimiento, de aprovechar la señal de generalización del maestro. Es distinto de la poda, que sí elimina pesos de un modelo ya entrenado, y de la cuantización, que reduce la precisión numérica de los pesos.
Qué lugar ocupa hoy
DistilBERT es de 2019, de la era de los modelos tipo BERT (codificadores), y fue una demostración influyente de que un modelo compacto puede acercarse al grande con mucho menos coste, algo valioso para desplegar en producción con baja latencia. Sigue siendo un punto de partida habitual para tareas de clasificación o extracción de información. No es, sin embargo, el estado del arte de la compresión: el catálogo actual combina cuantización, poda, adaptadores de bajo rango como LoRA y modelos de lenguaje pequeños de nueva generación, donde la destilación es una herramienta más, no la única.
Piezas que usan este término
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.