T5 (Text-to-Text Transfer Transformer)
T5, de Google (Raffel et al., 2019), trata toda tarea de lenguaje como un problema «de texto a texto». Explicamos ese enfoque unificado, su arquitectura codificador-decodificador frente a GPT y BERT, su preentrenamiento sobre el corpus C4 y variantes como mT5 y Flan-T5.
T5 (Text-to-Text Transfer Transformer) es un modelo de lenguaje de Google, presentado por Colin Raffel y sus colegas en 2019, que enmarca toda tarea de procesamiento del lenguaje como un problema «de texto a texto»: la entrada es texto y la salida es texto, sea cual sea la tarea. Esa unificación permite usar el mismo modelo, la misma función de pérdida y el mismo procedimiento para traducir, resumir, clasificar o responder preguntas.
El enfoque «de texto a texto»
La clave es anteponer a la entrada una instrucción que indica la tarea: por ejemplo, «translate English to German: …» o «summarize: …». Incluso una tarea de clasificación produce texto, porque el modelo genera la palabra de la clase en lugar de emitir una etiqueta numérica. Así se elimina la necesidad de diseñar una arquitectura específica para cada tarea: todas se tratan como generación de secuencias.
Arquitectura y preentrenamiento
T5 es un Transformer codificador-decodificador, lo que lo diferencia de sus contemporáneos: GPT usa solo el decodificador y BERT solo el codificador. Se preentrena sobre C4 (Colossal Clean Crawled Corpus), un gran corpus de texto web filtrado que se introdujo en el mismo trabajo, con un objetivo de corrupción de tramos: se enmascaran fragmentos del texto y el modelo aprende a reconstruirlos, convirtiendo el propio preentrenamiento en una tarea de texto a texto. Se publicó en cinco tamaños, desde unos 60 millones hasta 11.000 millones de parámetros.
Variantes y lugar histórico
De T5 derivan variantes muy usadas: mT5, su versión multilingüe entrenada sobre más de cien idiomas, y Flan-T5, ajustado con instrucciones sobre un gran conjunto de tareas para mejorar su desempeño en tareas nuevas. T5 es un hito de 2019-2020, contemporáneo de la primera oleada de grandes modelos de transferencia; no es el último grito, pero sigue siendo una referencia sólida y eficiente para tareas de generación de secuencias como el resumen y la traducción.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.