Procesamiento del Lenguaje Natural (PLN)
El PLN es la rama de la IA que permite a las máquinas comprender y generar lenguaje humano. De los sistemas de reglas a los modelos fundacionales: qué abarca, cómo se evalúa y qué riesgos documentados arrastra.
El procesamiento del lenguaje natural (PLN) es la rama de la inteligencia artificial que busca que las máquinas analicen, comprendan y generen lenguaje humano. Combina lingüística computacional y aprendizaje automático, y sostiene desde los traductores automáticos hasta los actuales modelos de lenguaje conversacionales. El manuscrito Speech and Language Processing, de Daniel Jurafsky y James H. Martin, publicado en línea en enero de 2026, permite ver el alcance del campo en su propio índice: palabras y gramáticas, clasificación, recuperación, transformers, traducción y tecnologías del habla.
Qué abarca
Entre las tareas clásicas del PLN están la traducción automática, el resumen de textos, el reconocimiento de entidades nombradas —identificar personas, lugares u organizaciones en un texto—, el análisis de sentimiento y la respuesta a preguntas. Muchas se abordaron históricamente con sistemas, objetivos y datos etiquetados específicos. Los modelos de lenguaje preentrenados permiten reutilizar una arquitectura en tareas distintas, pero no significa que una sola arquitectura “las resuelva todas”: el paper de GPT-3 evaluó el modelo sin actualizar sus pesos en numerosos conjuntos de datos y declaró tanto resultados fuertes como tareas en las que el aprendizaje con pocos ejemplos seguía fallando.
De las reglas a los modelos fundacionales
La historia del PLN no es una sustitución limpia de una técnica por otra. Sistemas tempranos como ELIZA usaban correspondencia de patrones; el mismo capítulo de Jurafsky y Martin explica que esa familia de operaciones todavía aparece en la tokenización. A esa capa se sumaron métodos que aprenden regularidades de corpus. En 2013, Mikolov y sus coautores propusieron dos arquitecturas eficientes para calcular vectores de palabras y evaluaron si esos vectores recogían similitudes sintácticas y semánticas.
En 2017, Attention Is All You Need presentó el transformer: una arquitectura de transducción basada en atención, sin recurrencia ni convoluciones, que en sus experimentos de traducción era más paralelizable. La publicación de BERT en NAACL 2019 informó resultados de estado del arte en once tareas de PLN mediante preentrenamiento bidireccional y ajuste posterior. GPT-3, con 175.000 millones de parámetros, fue evaluado sin actualizar los pesos: las tareas y demostraciones se suministraban como texto. En 2021, Bommasani y más de cien coautores llamaron modelos fundacionales a modelos entrenados con datos amplios a escala y adaptables a una gama extensa de tareas posteriores.
Cómo se evalúa
La evaluación pasó de pruebas aisladas por tarea a baterías amplias. MMLU cubre 57 tareas de ámbitos como matemáticas, historia, informática y derecho. HELM propuso medir siete métricas en total —precisión, calibración, robustez, equidad, sesgo, toxicidad y eficiencia—, no siete dimensiones adicionales a la precisión. Estos exámenes también tienen límites medibles. En NAACL 2024, Deng y sus coautores ocultaron opciones de preguntas de MMLU y registraron un 57% de coincidencia exacta de GPT-4 al reconstruirlas, un indicio de posible contaminación que exige pruebas más robustas. La meseta tampoco es sólo una impresión: MMLU-Pro partió de que MMLU discriminaba cada vez menos entre modelos, endureció las preguntas y observó caídas de precisión de entre el 16% y el 33%.
Riesgos y límites
Dos riesgos cuentan con evidencia directa. Las alucinaciones son salidas no fieles a la entrada o a la fuente; el survey de Ji y sus coautores revisa cómo se miden y mitigan en tareas como resumen, diálogo, respuesta a preguntas y traducción. Los sesgos también se pueden medir: Bolukbasi y sus coautores encontraron estereotipos de género en embeddings entrenados con artículos de Google News y probaron métodos para reducirlos. La bibliografía crítica incluye además On the Dangers of Stochastic Parrots; la página de Emily M. Bender identifica el trabajo de Bender, Gebru y sus coautoras y su presentación en FAccT 2021. Las mitigaciones y la interpretación siguen siendo investigación activa: la revisión de Belinkov y Glass organiza métodos de análisis de redes neuronales para PLN, sus límites y las preguntas que permanecen abiertas.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.