Glosario Inteligencia Artificial
226 términos
A
A* (A-estrella)
A* (a-estrella) es un algoritmo de búsqueda informada que encuentra el camino de menor coste en un grafo combinando el coste ya recorrido con una estimación heurística. Explicamos su fórmula f = g + h, cuándo garantiza el camino óptimo, sus usos —del GPS a los videojuegos— y su principal límite: la memoria.
AdaBoost
AdaBoost combina clasificadores débiles, reponderando en cada ronda los ejemplos mal clasificados, para formar un voto ponderado más preciso. Su reverso es la sensibilidad al ruido y a los outliers, que las extensiones multiclase (SAMME) y de regresión (AdaBoost.R2) no eliminan.
Agentes Inteligentes
Qué es un agente inteligente: la entidad que percibe su entorno y actúa para alcanzar objetivos, del agente racional de Russell y Norvig a los agentes con grandes modelos de lenguaje de hoy.
Agrupamiento
El agrupamiento (clustering) divide datos sin etiquetas en grupos según su similitud. Un recorrido por sus familias —k-medias, jerárquico, DBSCAN y mezclas de gaussianas—, cómo elegir el número de grupos y por qué no existe una única respuesta correcta.
Algoritmo Alfa-Beta
La poda alfa-beta es una optimización del algoritmo Minimax que reduce las posiciones a evaluar en un árbol de juego sin cambiar la jugada elegida. Explicamos cómo funciona con los valores alfa y beta, cuánto cómputo ahorra según el orden de las jugadas, y dónde se usa, del ajedrez al relevo del Go.
Algoritmo de Colonia de Hormigas
El algoritmo de colonia de hormigas es una metaheurística de optimización inspirada en el comportamiento de las hormigas reales al buscar comida. Explicamos la ingeniosa idea biológica que lo sustenta —el rastro de feromonas—, cómo la traslada a la resolución de problemas, su origen y sus aplicaciones en la optimización de rutas y redes.
Algoritmo de Enjambre de Partículas
Metaheurística de optimización de Kennedy y Eberhart (1995) inspirada en bandadas: cada partícula actualiza su velocidad y su posición hacia su mejor solución personal (pbest) y la del enjambre (gbest). No garantiza el óptimo global y es sensible a sus parámetros.
Algoritmo de Hill Climbing
El ascenso de colina (hill climbing) es una búsqueda local voraz que avanza siempre al mejor vecino hasta alcanzar una cima. Rápido y de poca memoria, su punto débil son los óptimos locales, que variantes como el reinicio aleatorio y el temple simulado ayudan a sortear.
Algoritmo de Levenshtein
La distancia de Levenshtein mide cuán distintas son dos cadenas de texto: el número mínimo de ediciones de un carácter —insertar, borrar o sustituir— para convertir una en la otra. Explicamos su definición, su origen, cómo se calcula por programación dinámica, sus propiedades y sus usos, del corrector ortográfico a la bioinformática.
Algoritmo Minimax
El algoritmo Minimax elige, en un juego adversarial, la jugada que maximiza la ganancia mínima garantizada suponiendo un rival óptimo. Explicamos cómo recorre el árbol del juego, sus supuestos (dos jugadores, suma cero, información perfecta), la poda alfa-beta y su relación —matizada— con el equilibrio de Nash.
Algoritmos
Qué es un algoritmo: una secuencia finita y bien definida de pasos para resolver un problema o hacer un cálculo. Sus propiedades según Knuth, ejemplos clásicos, complejidad y su relación con la inteligencia artificial.
Algoritmos de Búsqueda
En inteligencia artificial, los algoritmos de búsqueda resuelven problemas explorando un espacio de estados hasta alcanzar un objetivo. Explicamos qué define un problema de búsqueda, la diferencia entre la búsqueda no informada y la informada (heurística), y otras familias como la búsqueda local y la adversarial.
Algoritmos de Clusterización Jerárquica
El clustering jerárquico es una familia de métodos de agrupamiento no supervisado que organiza los datos en un árbol de clústeres anidados, el dendrograma. Explicamos sus dos enfoques —aglomerativo y divisivo—, cómo se lee el dendrograma para elegir el número de grupos, los criterios de enlace (simple, completo, promedio y Ward) y sus ventajas y límites.
Algoritmos de Clusterización Partitiva
La clusterización partitiva reparte los datos en K grupos no solapados de una sola vez, con K-means como método emblemático. Repasamos su funcionamiento, cómo elegir K y por qué falla con grupos de forma irregular.
Algoritmos Genéticos
Metaheurística de optimización inspirada en la evolución: una población de soluciones que se refina por selección, cruce y mutación a lo largo de generaciones. Útil en espacios difíciles, pero sin garantía de óptimo global y con un alto coste de evaluación.
Alineamiento de Secuencias
El alineamiento de secuencias organiza dos o más secuencias de ADN, ARN o proteínas para identificar regiones de similitud. Explicamos sus tipos (global y local), los algoritmos clásicos de programación dinámica (Needleman-Wunsch, Smith-Waterman) y las heurísticas rápidas, y su relación con la IA moderna, de AlphaFold a la distancia de edición.
Análisis de Componentes Principales (PCA)
El análisis de componentes principales (PCA) es la técnica más común de reducción de dimensionalidad lineal: transforma variables correlacionadas en un nuevo conjunto de variables no correlacionadas, ordenadas por la varianza que explican. Explicamos cómo funciona, por qué conviene centrar y estandarizar los datos, para qué se usa y su límite: solo captura relaciones lineales.
Análisis de Datos Espaciales
El análisis de datos espaciales estudia datos con localización geográfica, donde la posición condiciona lo observado. Explicamos la autocorrelación espacial (la primera ley de la geografía de Tobler y la I de Moran), conceptos propios como el problema MAUP, y por qué no es lo mismo que un sistema de información geográfica.
Análisis de Datos Espacio-temporales
El análisis de datos espacio-temporales trata observaciones ligadas a la vez a un lugar y a un instante, cuya clave es que casi nunca son independientes: autocorrelación espacial y temporal, datos irregulares y fuga temporal en la validación deciden si un modelo es fiable o solo lo aparenta.
Análisis de Datos Temporales
El análisis de series temporales aprovecha que el orden en el tiempo es información. Definimos tendencia, estacionalidad y estacionariedad, explicamos por qué la evaluación debe respetar el orden temporal y recorremos los modelos desde ARIMA hasta los fundacionales como TimesFM y Chronos.
Análisis de Redes Sociales
El análisis de redes sociales estudia las estructuras sociales representándolas como grafos: las personas u organizaciones son nodos y sus relaciones, aristas. Explicamos sus métricas de centralidad, conceptos como comunidades y mundo pequeño, sus raíces históricas y su conexión actual con la IA a través de las redes neuronales de grafos.
Análisis de Sentimiento
El análisis de sentimiento, o minería de opiniones, es la tarea del procesamiento del lenguaje natural que identifica y clasifica la carga emocional de un texto: si expresa una opinión positiva, negativa o neutra. Explicamos sus niveles de detalle, la evolución de sus enfoques, sus retos —como el sarcasmo o la negación— y sus aplicaciones.
Análisis de Vídeo
El análisis de vídeo aplica la visión por computador a secuencias de imágenes en el tiempo. Separamos sus tareas (clasificación, detección, seguimiento, segmentación, comprensión temporal), recorremos los modelos de las convoluciones 3D a los transformadores de vídeo y los sistemas de vídeo-lenguaje, y sus riesgos de sesgo y vigilancia.
Aprendizaje Activo
El aprendizaje activo permite que el algoritmo elija de qué ejemplos aprender, pidiendo las etiquetas más informativas a un anotador humano para alcanzar buena precisión con menos datos etiquetados. Explicamos su bucle con el humano dentro, las estrategias para decidir qué preguntar, su relación con el semi-supervisado y el riesgo de sesgo de muestreo.
Aprendizaje Automático
El aprendizaje automático es la rama de la IA que desarrolla algoritmos capaces de aprender de los datos y generalizar a datos no vistos. Repasamos su definición operativa, los tres grandes paradigmas y el autosupervisado, su relación con el aprendizaje profundo y la IA, y sus límites (sobreajuste, sesgos, calidad de los datos).
Aprendizaje Automático de Ontologías
El aprendizaje automático de ontologías construye ontologías de forma semiautomática a partir de texto, extrayendo conceptos, jerarquías y relaciones. Explicamos qué es una ontología, cómo se organiza este aprendizaje por capas, y lo delimitamos de la ingeniería de ontologías, la extracción de relaciones y los grafos de conocimiento.
Aprendizaje Basado en Instancias
El aprendizaje basado en instancias, o «aprendizaje perezoso», es una familia de métodos que no construyen un modelo durante el entrenamiento, sino que guardan los ejemplos y responden comparando cada consulta nueva con ellos. Explicamos su ejemplo canónico —los k vecinos más cercanos—, su contraste con el aprendizaje «ansioso» y sus ventajas y límites.
Aprendizaje Basado en Reglas
Familia de métodos de aprendizaje automático que inducen reglas legibles «si… entonces» a partir de datos, a diferencia de los sistemas expertos, cuyas reglas se escriben a mano. De CN2 y RIPPER a los sistemas de puntuación interpretables y la IA neuro-simbólica.
Aprendizaje Colaborativo
En inteligencia artificial, el aprendizaje colaborativo es el paradigma en el que varias entidades —modelos, dispositivos o nodos— entrenan de forma conjunta compartiendo conocimiento en lugar de datos. Aclaramos su doble sentido, lo situamos como un paraguas con el aprendizaje federado en el centro, lo distinguimos del filtrado colaborativo y repasamos sus beneficios y retos.
Aprendizaje de Ensamble
El aprendizaje de ensamble combina las predicciones de varios modelos para obtener un resultado mejor y más robusto que el de cualquiera por separado: la «sabiduría de la multitud» aplicada al aprendizaje automático. Explicamos por qué funciona, sus tres métodos principales —bagging, boosting y stacking— y sus ventajas y límites.
Aprendizaje de Máquinas de Estados Finitos
Aprender una máquina de estados finitos no es usar un autómata diseñado a mano, sino inferirlo desde datos. Repasamos qué significa aprenderlo, por qué es difícil (Gold, Angluin) y qué relación real, y con qué límites, guarda con las redes neuronales.
Aprendizaje de Representaciones
El aprendizaje de representaciones es el conjunto de técnicas que permiten a un sistema descubrir por sí mismo las características útiles de los datos crudos, en lugar de que un humano las diseñe a mano. Explicamos su idea central, su contraste con la ingeniería manual de características, sus formas —de los embeddings al aprendizaje autosupervisado— y por qué es un pilar del aprendizaje profundo.
Aprendizaje en Línea
El aprendizaje en línea actualiza el modelo con cada dato de un flujo, en vez de entrenar una vez sobre un conjunto fijo. Corregimos su fundamento teórico —la minimización del arrepentimiento, no el teorema de aproximación universal—, distinguimos online, incremental y continuo, y explicamos la deriva de concepto.
Aprendizaje Estadístico Relacional
El aprendizaje estadístico relacional (SRL) combina la lógica de primer orden, que representa relaciones entre entidades, con los modelos probabilísticos, que manejan la incertidumbre. Explicamos el problema que resuelve —datos interconectados que la mayoría del aprendizaje automático ignora—, sus principales formalismos, su relación con campos vecinos y sus aplicaciones.
Aprendizaje Evolutivo
El aprendizaje evolutivo es un enfoque de optimización y aprendizaje automático inspirado en la evolución biológica: hace evolucionar una población de soluciones a lo largo de generaciones. Explicamos su mecánica, la familia de la computación evolutiva, cómo se aplica al aprendizaje —incluida la neuroevolución—, sus ventajas frente a los métodos con gradiente y sus límites.
Aprendizaje Federado
El aprendizaje federado entrena un modelo compartido entre muchos dispositivos sin reunir sus datos en un servidor: cada cliente entrena en local y solo envía actualizaciones del modelo. Explicamos su ciclo cliente-servidor, sus usos y sus límites, entre ellos que no garantiza por sí solo la privacidad.
Aprendizaje Incremental
El aprendizaje incremental aprende de datos secuenciales sin olvidar lo anterior; su barrera, el olvido catastrófico, solo se mitiga, nunca se elimina. Continual y lifelong learning nombran el mismo problema.
Aprendizaje Multi-Dominio
El aprendizaje multi-dominio entrena un solo modelo para resolver la misma tarea en varios dominios a la vez. Lo distinguimos con nitidez del aprendizaje multitarea, del aprendizaje por transferencia y del aprendizaje continuo —donde encaja realmente la técnica EWC— y explicamos sus métodos.
Aprendizaje Multi-etiqueta
El aprendizaje multi-etiqueta asigna varias etiquetas a la vez a cada ejemplo, a diferencia de la multiclase, que elige solo una. Repasamos sus enfoques —de Binary Relevance a los transformers con salida sigmoide—, sus métricas y el papel de los umbrales de decisión.
Aprendizaje Multi-Instancia
El aprendizaje multi-instancia agrupa los ejemplos en «bolsas» y etiqueta solo la bolsa entera, no cada instancia: una supervisión débil que abarata entrenar modelos donde anotar cada dato sería inviable, del cribado de fármacos a la detección de cáncer en biopsias digitales.
Aprendizaje Multi-tarea
El aprendizaje multi-tarea entrena una sola red para resolver varias tareas relacionadas a la vez, compartiendo representaciones entre ellas. Bien emparejado mejora la generalización; mal emparejado, provoca transferencia negativa.
Aprendizaje Multi-Vista
El aprendizaje multi-vista combina varias «vistas» —conjuntos de características distintos— de los mismos datos para aprender mejor y aprovechar ejemplos sin etiquetar. Del co-entrenamiento de Blum y Mitchell (1998) al puente con el aprendizaje multimodal.
Aprendizaje No Supervisado
El aprendizaje no supervisado busca estructura en datos sin etiquetas: agrupar, reducir dimensiones, estimar densidades y aprender representaciones. Su forma autosupervisada, que fabrica sus propias etiquetas, es hoy el motor de los modelos fundacionales.
Aprendizaje No Supervisado de Representaciones
El aprendizaje no supervisado de representaciones permite a un modelo aprender por sí mismo, sin etiquetas humanas, representaciones útiles de los datos. Aclaramos su relación con el aprendizaje autosupervisado, repasamos sus métodos (autoencoders, contrastivos, enmascarado) y explicamos por qué sostiene los modelos fundacionales.
Aprendizaje por Transferencia
Técnica que reutiliza el conocimiento aprendido por un modelo en una tarea para resolver otra relacionada. Hoy sustenta la adaptación de modelos fundacionales mediante ajuste fino eficiente (LoRA, adapters, prompt tuning), con beneficios que dependen de la similitud entre dominios: transferir mal puede dañar.
Aprendizaje Profundo
El aprendizaje profundo usa redes de muchas capas para aprender representaciones jerárquicas de los datos, sin características diseñadas a mano. Repasamos sus fundamentos (retropropagación, aprendizaje de representaciones), sus arquitecturas y el escalado, y sus límites: datos, cómputo, robustez, interpretabilidad, alucinaciones y sesgos.
Aprendizaje Reforzado
El aprendizaje por refuerzo es el paradigma en que un agente aprende por ensayo y error a maximizar una recompensa acumulada dentro de un entorno. Del Q-learning y los MDP al RLHF que alinea a los grandes modelos de lenguaje.
Aprendizaje Semi-Supervisado
El aprendizaje semi-supervisado combina pocas etiquetas con muchos datos sin etiquetar. Explicamos cuándo funciona (supuestos de suavidad, agrupamiento y variedad), sus métodos (pseudoetiquetado, consistencia, grafos), por qué no es lo mismo que el autosupervisado y su riesgo de sesgo de confirmación.
Aprendizaje Supervisado
El aprendizaje supervisado entrena un modelo con datos etiquetados —pares de entrada y salida deseada— para que asigne nuevas entradas a su salida correcta. Explicamos sus dos tareas (clasificación y regresión), cómo funciona y por qué busca generalizar, y su contraste con otros enfoques, junto a sus límites: el coste del etiquetado y los sesgos.
Asociación de Datos
La asociación de datos es el problema de decidir qué observación de un sensor corresponde a qué objeto cuando se siguen varios a la vez, en medio de ruido y falsas alarmas. Explicamos por qué es difícil, los métodos clásicos (vecino más cercano, JPDA, seguimiento de hipótesis múltiples), su relación con el filtro de Kalman y su versión moderna con aprendizaje profundo.
Atención
El mecanismo que permite a una red neuronal ponderar dinámicamente las partes relevantes de su entrada en lugar de comprimirla en un vector fijo. De la traducción automática de Bahdanau (2014) al Transformer, es hoy el cimiento de los grandes modelos de lenguaje.
AUC-ROC
El AUC-ROC es el área bajo la curva ROC, que resume en un número el rendimiento de un clasificador binario a través de todos sus umbrales. Explicamos su lectura probabilística, y tres límites que a menudo se olvidan: mide discriminación pero no calibración, no fija un umbral y puede ser optimista con clases desbalanceadas.
Autoencoders
Una red neuronal que aprende comprimiendo su entrada por un cuello de botella y reconstruyéndola: así descubre la estructura esencial de los datos. De la reducción de dimensiones a la detección de anomalías y al VAE generativo.
B
Backpropagation
La retropropagación (backpropagation) es el algoritmo que calcula el gradiente de la función de pérdida en una red neuronal mediante la regla de la cadena. Aclaramos una confusión frecuente —calcular el gradiente no es actualizar los pesos, que es tarea del optimizador—, explicamos las pasadas hacia delante y hacia atrás y repasamos su historia.
Bagging
El bagging es una técnica de aprendizaje por conjuntos que entrena varios modelos sobre distintas muestras aleatorias del conjunto de datos y combina sus predicciones. Su efecto principal es reducir la varianza y el sobreajuste. Explicamos su mecánica de bootstrap y agregación, por qué funciona, su relación con Random Forest y su contraste con el boosting.
BERT
BERT, el codificador bidireccional que Google presentó en 2018, enseñó a las máquinas a interpretar el lenguaje por su contexto. Repasamos cómo se entrena con MLM y NSP —y por qué RoBERTa demostró que NSP era prescindible—, su lugar frente a los LLM generativos y los encoders que hoy lo actualizan.
Big Data
Big Data no es una era ni una tecnología concreta, sino el problema de extraer valor de datos que desbordan las herramientas convencionales. Repasamos las «uves» de Laney, el salto de Hadoop y Spark a la nube y el lakehouse, la gobernanza del dato y su relación real —y sobria— con la IA.
Boosting
El boosting combina en secuencia muchos aprendices débiles —cada uno centrado en los errores del anterior— para formar un predictor fuerte. De AdaBoost al gradient boosting de XGBoost, LightGBM y CatBoost, sigue siendo la técnica de referencia para los datos tabulares.
Búsqueda Heurística
La búsqueda heurística usa una función que estima el coste que falta hasta el objetivo para guiar la exploración de un espacio de estados. Explicamos con la notación correcta la búsqueda voraz y el algoritmo A* (f = g + h) y la admisibilidad, y deslindamos la búsqueda informada de las metaheurísticas de optimización.
C
Cadenas de Markov
Una cadena de Markov es un proceso estocástico en el que el próximo estado depende solo del actual, no de la historia previa. Con su matriz de transición y su distribución estacionaria sostiene los modelos ocultos de Márkov, el muestreo MCMC y el PageRank de Google.
CatBoost
CatBoost es una biblioteca de potenciación por gradiente de Yandex que maneja de forma nativa las variables categóricas. Explicamos sus aportaciones —el ordered boosting y los árboles simétricos—, qué es la fuga del objetivo que corrige y cuándo conviene elegirlo frente a XGBoost y LightGBM.
Clasificación
La clasificación asigna cada entrada a una categoría discreta mediante aprendizaje supervisado, frente a la regresión, que predice un número. Distinguimos sus tipos (binaria, multiclase y multietiqueta), el abanico real de algoritmos y cómo se evalúa cuando las clases están desbalanceadas.
Clasificación de Procesos Gaussianos
La clasificación con procesos gaussianos aplica un modelo bayesiano no paramétrico —una distribución sobre funciones— al problema de asignar clases. Explicamos qué es un proceso gaussiano, cómo se adapta de la regresión a la clasificación mediante una función de enlace, por qué la inferencia exige aproximaciones y cuáles son sus ventajas y su principal límite.
Codificación de Huffman
La codificación de Huffman es un algoritmo clásico de compresión sin pérdida de la teoría de la información —no una técnica de IA— que asigna códigos prefijo más cortos a los símbolos frecuentes construyendo un árbol binario óptimo.
Compresión de Datos
Técnica que reduce los bits necesarios para representar información. Su gran frontera separa la compresión sin pérdida —limitada por la entropía de Shannon— de la compresión con pérdida, y hoy enlaza con la IA: comprimir bien equivale a predecir bien.
Computación Afectiva
La computación afectiva es el campo de la IA que busca reconocer, interpretar y simular emociones humanas a partir del rostro, la voz, la fisiología y el texto. Nacida con Rosalind Picard (1997), promete interfaces más sensibles, aunque la fiabilidad de inferir emociones desde la cara sigue siendo materia de debate científico.
Control Inteligente
El control inteligente aplica técnicas de IA —lógica difusa, redes neuronales, control adaptativo y aprendizaje por refuerzo— para gobernar sistemas dinámicos donde el control clásico, atado a un modelo exacto, se queda corto. No lo sustituye: lo complementa donde reina la incertidumbre.
Curriculum Learning
Curriculum learning ordena los ejemplos de fáciles a difíciles para entrenar un modelo. Repasamos cómo se mide esa dificultad y por qué la evidencia sobre su utilidad es mixta: ayuda con datos ruidosos o poco tiempo, pero no siempre.
D
Deep Reinforcement Learning
El aprendizaje por refuerzo profundo une el aprendizaje por refuerzo con redes neuronales profundas que aproximan la política o el valor, lo que permite decidir a partir de estados de alta dimensión como los píxeles. De DQN a AlphaGo, sus hitos, sus métodos (valor, política, PPO) y sus límites honestos.
Detección de Anomalías
La detección de anomalías identifica las observaciones que se desvían de lo «normal». Repasamos sus tipos, los enfoques según las etiquetas y métodos como el Isolation Forest o los autoencoders, junto a sus retos: desequilibrio, deriva y falsos positivos.
Detección de Comunidades
La detección de comunidades es la tarea de encontrar, dentro de una red, grupos de nodos muy conectados entre sí y con menos vínculos hacia el resto. Explicamos el concepto de modularidad, los algoritmos clásicos (Girvan-Newman, Louvain, Leiden, propagación de etiquetas), los retos como el límite de resolución y las comunidades solapadas, y su relación actual con la IA.
Detección de Eventos
La detección de eventos identifica ocurrencias de interés en flujos de datos —series, texto, audio o vídeo—; a diferencia de la anomalía, un evento es un suceso reconocible que puede ser frecuente y esperado.
Detección de Fraude
Cómo el aprendizaje automático distingue las pocas operaciones fraudulentas entre millones de legítimas: clasificadores supervisados frente a detección de anomalías, el coste asimétrico de los falsos positivos y la revisión humana, y por qué la IA generativa y la deriva de concepto obligan a validar los modelos sin descanso.
Distancia de Coseno
La similitud del coseno mide el coseno del ángulo entre dos vectores, y la distancia del coseno es 1 menos esa similitud. Explicamos la diferencia entre ambas, que miden orientación y no magnitud, su uso para comparar embeddings de texto y un matiz técnico: la distancia del coseno no es una métrica en sentido estricto.
Distancia de Hamming
La distancia de Hamming cuenta en cuántas posiciones difieren dos cadenas de igual longitud. Nacida con los códigos correctores de Hamming en 1950, hoy es clave para comparar hashes binarios y buscar vecinos más cercanos en IA.
Distancia de Jaccard
El índice de Jaccard mide la similitud entre dos conjuntos como su intersección dividida por su unión, y la distancia de Jaccard es su complemento. Explicamos la fórmula, su origen en la ecología, sus propiedades, su relación con el coeficiente de Dice y sus usos en IA, de la comparación de textos al IoU en visión por computador.
Distancia de Mahalanobis
La distancia de Mahalanobis es una medida —no un algoritmo— que calcula la separación entre un punto y una distribución teniendo en cuenta la covarianza entre variables, lo que la hace invariante a la escala y a la correlación.
Distancia de Manhattan
La distancia de Manhattan mide la separación entre dos puntos como la suma de las diferencias absolutas de sus coordenadas, igual que un taxi recorre una cuadrícula de calles sin atajos en diagonal. Como caso p = 1 de la distancia de Minkowski, es robusta frente a valores atípicos y útil en alta dimensión.
Distancia de Minkowski
La distancia de Minkowski es la métrica general que, según el orden p, se convierte en Manhattan (p = 1), euclídea (p = 2) o Chebyshev (p → ∞).
Distancia Euclidiana
La distancia euclidiana es la separación «en línea recta» entre dos puntos, una generalización del teorema de Pitágoras. Explicamos su uso como medida de similitud en aprendizaje automático (k-NN, k-means), dos precauciones importantes —la escala y la dimensionalidad— y su relación con otras métricas.
DistilBERT
DistilBERT es una versión compacta de BERT por destilación de conocimiento: según su artículo de 2019, un 40 % más pequeño, un 60 % más rápido y con el 97 % del rendimiento. Explicamos cómo funciona la destilación, por qué no es «podar» el modelo y qué lugar ocupa frente a la compresión actual.
E
Ensamble de Modelos
Combinar varios modelos cuyos errores son diversos produce predicciones más fiables que las de cualquiera por separado. Bagging, boosting y stacking son las tres familias que explotan esta idea.
Entropía
La entropía de Shannon mide la incertidumbre o la información media de una variable aleatoria. Damos su definición y su fórmula, explicamos su intuición en bits, distinguimos la entropía de la entropía cruzada y recorremos sus usos en el aprendizaje automático, de los árboles de decisión al aprendizaje por refuerzo.
Entropía Cruzada
La entropía cruzada mide, en bits, cuánto se aparta una predicción de la realidad; se descompone en entropía más divergencia de Kullback-Leibler y es la función de pérdida estándar de la clasificación en aprendizaje automático.
Entropía Máxima
El principio de máxima entropía (Jaynes, 1957) elige la distribución más incierta compatible con lo conocido. Distinguimos tres ideas que suelen confundirse —el principio, la entropía cruzada y la regularización— y aclaramos por qué el «modelo de máxima entropía» es la regresión logística, no una GAN o un Transformer.
Estimación de Pose
La estimación de pose localiza las articulaciones de personas o la posición y orientación 6DoF de objetos en imágenes y vídeo: qué distingue sus variantes 2D y 3D, cómo se evalúa (PCK, OKS, MPJPE) y qué modelos, usos y riesgos definen hoy el campo.
Evaluación de Modelos
La evaluación de modelos mide cómo de bien un modelo generaliza a datos nuevos, no cómo reproduce los del entrenamiento. Explicamos la partición en entrenamiento, validación y prueba, la validación cruzada, las métricas por tarea y conceptos clave como el compromiso sesgo-varianza y la fuga de datos.
Exactitud
La exactitud es la fracción de predicciones correctas de un clasificador, pero con clases desbalanceadas engaña: por eso se acompaña de precisión, exhaustividad, F1 y MCC.
Explicabilidad y Transparencia en IA
Explicabilidad, interpretabilidad y transparencia no son lo mismo: explicar una decisión concreta, diseñar un modelo comprensible y documentar su gobierno son tres exigencias distintas, con métodos, regulación y límites propios —incluidas explicaciones que pueden no ser fieles al modelo.
Extracción de Entidades
La extracción de entidades (NER) localiza y clasifica menciones como personas, lugares o fechas en un texto. La distinguimos de la extracción de relaciones y del enlazado de entidades, recorremos los métodos de las reglas a los modelos de lenguaje —con el matiz justo sobre BERT— y su dimensión de privacidad.
Extracción de Información
La extracción de información obtiene automáticamente datos estructurados —entidades, relaciones, eventos— a partir de texto no estructurado. Aclaramos que es un paraguas de varias subtareas y no un sinónimo de NER, recorremos la evolución de sus métodos, de las reglas a los grandes modelos de lenguaje, y sus retos.
F
F1-score
El F1-score combina la precisión y la exhaustividad (recall) mediante su media armónica: F1 = 2 · (precisión · recall) / (precisión + recall). Repasamos sus variantes micro, macro y weighted, su comparación con accuracy y MCC, y sus límites.
FastText
FastText, la biblioteca de código abierto de Facebook AI Research que representa cada palabra como una bolsa de n-gramas de caracteres. Así compone vectores para palabras nunca vistas y brilla en lenguas de morfología rica y en clasificación de texto rápida.
Few-Shot Learning
El aprendizaje con pocos ejemplos (few-shot learning) permite a un modelo abordar una tarea nueva con muy pocos ejemplos etiquetados. Distinguimos sus dos sentidos —el meta-aprendizaje clásico, en el que los ejemplos entrenan, y el aprendizaje en contexto de los grandes modelos, en el que van en el prompt— y explicamos sus métodos y límites.
Filtrado Basado en Contenido
El filtrado basado en contenido es el enfoque de recomendación que sugiere ítems parecidos a los que el usuario ya valoró bien, fijándose en los atributos de los propios ítems y no en el comportamiento de otros usuarios. Explicamos cómo construye el perfil del usuario, su contraste con el filtrado colaborativo, y sus ventajas y límites.
Filtrado Colaborativo
El filtrado colaborativo es la técnica de recomendación que predice lo que le gustará a un usuario a partir del comportamiento de muchos otros. Explicamos su principio, su contraste con el filtrado por contenido, sus enfoques de vecindario y de factorización de matrices —popularizada por el Premio Netflix—, sus problemas conocidos y su versión neuronal.
FrameNet
FrameNet es un recurso léxico del inglés, creado en el ICSI de Berkeley a partir de la semántica de marcos de Charles Fillmore, que describe las palabras según las situaciones que evocan y sus participantes. Herramienta clave del etiquetado de roles semánticos, hoy convive con los grandes modelos de lenguaje.
Función de Activación
La función de activación es la pieza que introduce no linealidad en una red neuronal, y sin ella las redes profundas no podrían aprender patrones complejos. Explicamos por qué es imprescindible, las principales funciones —sigmoide, tanh, ReLU y softmax— con sus virtudes y problemas, y por qué la ReLU marcó un antes y un después.
Función de Pérdida
Una función de pérdida mide cuánto se equivoca un modelo, y el entrenamiento ajusta sus parámetros para minimizarla. Explicamos por qué no es lo mismo que una métrica ni que el objetivo, repasamos las pérdidas más habituales por tipo de tarea y las condiciones que debe cumplir.
G
Generación de Texto
La generación de texto, o generación de lenguaje natural, produce automáticamente texto humano a partir de una entrada. Explicamos cómo lo hacen los modelos actuales —de forma autorregresiva, con estrategias de muestreo—, para qué sirve, cómo se evalúa y sus riesgos, como las alucinaciones y los sesgos.
GloVe
GloVe convierte palabras en vectores partiendo de la matriz global de co-ocurrencias de todo un corpus. Un método de Stanford que popularizó la aritmética «rey − hombre + mujer ≈ reina» y hoy es un hito didáctico de los embeddings estáticos.
GPT
GPT (Generative Pre-trained Transformer) no es un modelo, sino una familia de sistemas de OpenAI construidos sobre un transformer solo-decoder y preentrenados de forma autosupervisada. Un recorrido por su método y su linaje, de GPT-1 a la familia actual, sin coronar ninguna versión.
Gradiente Descendente
El gradiente descendente es el algoritmo que entrena a la mayoría de los modelos de aprendizaje profundo: minimiza una función avanzando, paso a paso, en la dirección opuesta a su gradiente. Explicamos su mecánica, el papel crucial de la tasa de aprendizaje, sus variantes según cuántos datos usa, las extensiones como Adam y sus límites.
Gradiente Descendente Estocástico
El descenso de gradiente estocástico (SGD) minimiza el error de un modelo estimando el gradiente con un solo ejemplo o mini-lote en vez de todo el conjunto de datos. Es el motor del entrenamiento de redes neuronales: del ruido y la tasa de aprendizaje a variantes como el momento y Adam.
Gradiente Descendente por Lotes
El descenso de gradiente por lotes calcula el gradiente con todo el conjunto de entrenamiento antes de cada actualización: da pasos exactos y estables, pero lentos y difíciles de escalar frente al descenso estocástico y el mini-batch.
GRU
La GRU (unidad recurrente con puertas) es un tipo de unidad para redes neuronales recurrentes que usa «puertas» para controlar qué información conservar a lo largo del tiempo. Explicamos su origen, cómo funcionan sus dos puertas, su contraste con la LSTM —más simple, con menos parámetros— y su lugar hoy, tras la llegada de los transformers.
H
I
ICA (Análisis de Componentes Independientes)
El análisis de componentes independientes (ICA) separa una señal formada por varias fuentes mezcladas en sus componentes originales, suponiéndolos estadísticamente independientes. Explicamos el problema de la fiesta que ejemplifica la idea, en qué se diferencia del PCA y sus usos, de la separación de audio a las señales biomédicas.
Inception
Inception es una familia de arquitecturas de redes neuronales convolucionales para visión por computador cuya primera versión, GoogLeNet, ganó el desafío ImageNet de 2014. Explicamos su innovación central —el módulo Inception—, el truco que la hizo eficiente, su origen y su evolución posterior.
Inferencia Bayesiana
La inferencia bayesiana es un método estadístico que actualiza la probabilidad de una hipótesis a medida que llega nueva evidencia, mediante el teorema de Bayes. Explicamos sus tres elementos —prior, verosimilitud y posterior—, por qué no es sinónimo de inteligencia artificial y para qué se usa en aprendizaje automático.
Inferencia Estadística
Qué es la inferencia estadística: inferir las propiedades de una población a partir de una muestra mediante estimación, intervalos de confianza y contraste de hipótesis, con una lectura correcta del p-valor y de los marcos frecuentista y bayesiano.
Ingeniería de Características
La ingeniería de características transforma los datos crudos en variables que un modelo puede aprovechar. Central en el aprendizaje automático clásico, el aprendizaje profundo la ha reducido —que no eliminado— al aprender representaciones por sí mismo.
Integración de Datos
La integración de datos combina fuentes heterogéneas —bases de datos, APIs, ficheros y sensores— en una vista unificada y coherente, reconciliando esquemas, entidades y calidad. Es la condición previa para que cualquier modelo de IA aprenda de datos fiables.
Inteligencia Artificial
La inteligencia artificial es la disciplina que busca crear sistemas capaces de realizar tareas que normalmente requerirían inteligencia humana. Explicamos una definición rigurosa, su origen en el taller de Dartmouth de 1956, la distinción entre IA estrecha, general y superinteligencia —y en qué punto estamos en 2026— y sus grandes ramas, del enfoque simbólico al aprendizaje profundo y la IA generativa.
Inteligencia Artificial Distribuida
La subdisciplina de la IA donde varios agentes o nodos distribuidos cooperan o compiten para resolver problemas que superan a uno solo: de la resolución distribuida de problemas y los sistemas multiagente al resurgir de 2026 con LLM y aprendizaje federado.
Interacción Humano-Robot
La interacción humano-robot (HRI) es el campo interdisciplinar que estudia cómo las personas y los robots se comunican, colaboran y trabajan juntos. Explicamos qué la distingue de la interacción con un ordenador, los ejes con que se caracteriza, conceptos clave como la seguridad, la confianza y el valle inquietante, y sus aplicaciones.
Interpretación de Modelos
La interpretación de modelos reúne tres ideas que no son sinónimas: interpretabilidad, explicabilidad y causalidad. Explicamos por qué los valores de Shapley (SHAP) atribuyen importancia pero no prueban causas, ordenamos los métodos (intrínsecos y post hoc, locales y globales) y sus límites de fidelidad y estabilidad.
K
L
LDA (Latent Dirichlet Allocation)
LDA (Latent Dirichlet Allocation) es el modelo probabilístico de temas propuesto por Blei, Ng y Jordan en 2003: cada documento como mezcla de temas y cada tema como distribución de palabras. Explicamos cómo funciona, sus límites documentados y qué lugar ocupa hoy frente a los embeddings y los grandes modelos de lenguaje.
LightGBM
LightGBM es la biblioteca de gradient boosting de Microsoft que entrena árboles de decisión con histogramas y crecimiento por hojas para lograr modelos precisos, rápidos y ligeros. Repasamos sus técnicas GOSS y EFB, su riesgo de sobreajuste y cómo se compara con XGBoost y CatBoost.
LSTM
Las LSTM son redes neuronales recurrentes que Hochreiter y Schmidhuber idearon en 1997 para vencer el desvanecimiento del gradiente y recordar dependencias largas. Una celda de memoria y tres puertas explican por qué dominaron el modelado de secuencias antes de la llegada de los transformers.
Lógica Difusa
La lógica difusa es una lógica de múltiples valores en la que la verdad es un grado entre 0 y 1, en lugar del verdadero/falso tajante de la lógica clásica. Sirve para modelar conceptos vagos como «alto» o «caliente». Explicamos su origen, los conjuntos difusos y las funciones de pertenencia, los sistemas de inferencia y sus aplicaciones en el control.
M
Mapas Autoorganizados
Los mapas autoorganizados de Kohonen proyectan datos de alta dimensión sobre una rejilla 2D preservando de forma aproximada su topología: puntos cercanos en el origen caen en neuronas cercanas. Hoy t-SNE, UMAP y el clustering dedicado suelen preferirse, pero el SOM conserva usos propios.
Mecanismos de Atención
Qué son los mecanismos de atención, cómo Bahdanau, Cho y Bengio (2014) los introdujeron en la traducción automática, y por qué el esquema consulta-clave-valor y la atención multi-cabeza del Transformer los convirtieron en el núcleo de los grandes modelos de lenguaje.
Meta-aprendizaje
El meta-aprendizaje —«aprender a aprender»— busca que un sistema mejore su propio proceso de aprendizaje a partir de la experiencia en muchas tareas, para adaptarse rápido a tareas nuevas con muy pocos ejemplos. Explicamos su relación con el aprendizaje con pocos datos, sus tres grandes familias de métodos, su diferencia con el transfer learning y su eco en los grandes modelos de lenguaje.
Minería de Datos
La minería de datos es el proceso de descubrir patrones útiles y no evidentes en grandes volúmenes de datos, en la intersección de la estadística, el aprendizaje automático y las bases de datos. Explicamos su relación con el proceso KDD, sus tareas principales, la metodología CRISP-DM, su diferencia con términos vecinos y sus consideraciones de privacidad.
Minería de Opiniones
La minería de opiniones es, en esencia, otro nombre del análisis de sentimiento, pero suele poner el acento en la extracción estructurada de opiniones: no solo si un texto es positivo o negativo, sino sobre qué, de quién y cuándo. Explicamos el modelo del quíntuple de Bing Liu, sus tareas y su relación con el análisis basado en aspectos.
Minería de Texto
La minería de texto es el proceso de extraer información y patrones útiles de grandes cantidades de texto no estructurado, transformándolo en datos aprovechables. Combina el procesamiento del lenguaje natural, la estadística y el aprendizaje automático. Explicamos su relación con la minería de datos, el preprocesado típico, sus tareas y el impacto de los grandes modelos de lenguaje.
Modelos
Un modelo es el resultado de entrenar un algoritmo sobre datos: los parámetros ya ajustados que sirven para predecir. Aclaramos la confusión clásica entre modelo y algoritmo y repasamos sus tipos, el ajuste y la máxima de Box.
Modelos Condicionalmente Generativos
Un modelo generativo condicional genera datos condicionados a una información adicional, modelando p(x|y) en lugar de p(x), lo que permite controlar qué se produce. Explicamos su contraste con los modelos incondicionales, cómo se implementa en GAN, autoencoders variacionales y difusión, y sus usos.
Modelos de Markov Ocultos
Un modelo de Markov oculto (HMM) describe secuencias en las que unos estados ocultos generan observaciones visibles. Explicamos qué lo define (estados, transiciones, emisiones, distribución inicial), los tres problemas clásicos que resuelve (evaluación, Viterbi y Baum-Welch) y su lugar frente a las redes neuronales.
Modelos de Tópicos
Los modelos de tópicos son algoritmos no supervisados que descubren los temas latentes que organizan una gran colección de documentos, sin etiquetas previas. Explicamos su idea central —un tópico como distribución de palabras—, el modelo clásico (LDA) y sus antecedentes, cómo se interpretan y su evolución en 2026 con los embeddings y los transformers.
Modelos Discriminativos
Un modelo discriminativo aprende a separar clases modelando p(y|x), frente al generativo, que modela la distribución conjunta p(x,y) y puede generar datos. Aclaramos que no es lo mismo que «clasificador», con ejemplos de cada enfoque, y qué conviene según la cantidad de datos (Ng y Jordan, 2001).
Modelos Generativos
Qué son los modelos generativos: sistemas que aprenden la distribución de los datos para crear muestras nuevas —texto, imágenes, audio— en vez de solo clasificarlas. Repasamos sus cuatro familias (autorregresivos, VAE, GAN y difusión), por qué sostienen la IA generativa y dónde están sus límites.
Muestreo de Gibbs
El muestreo de Gibbs es un algoritmo de Monte Carlo por cadenas de Markov (MCMC) que obtiene muestras de una distribución conjunta difícil descomponiéndola en muestreos más simples: actualiza cada variable a partir de su distribución condicional. Explicamos cómo funciona, su origen, sus usos en inferencia bayesiana y sus límites de convergencia.
Muestreo de Importancia
El muestreo de importancia estima promedios difíciles muestreando de una distribución cómoda q y reponderando cada muestra con el cociente p(x)/q(x). Bien elegida, q reduce la varianza; mal elegida, la dispara.
Muestreo de Metropolis-Hastings
Algoritmo MCMC que muestrea distribuciones difíciles proponiendo candidatos y aceptándolos con una probabilidad calculada. Es base de la inferencia bayesiana y es distinto de HMC y NUTS, que usan gradientes.
Máquinas de Boltzmann
Una máquina de Boltzmann es una red neuronal recurrente, estocástica y generativa, basada en energía. Explicamos su estructura de unidades visibles y ocultas, su versión práctica —la máquina restringida (RBM)— y por qué, pese a su enorme influencia histórica, hoy está en gran medida en desuso frente a otras arquitecturas generativas.
Máquinas de Boltzmann Restringidas
Las máquinas de Boltzmann restringidas son redes neuronales generativas de dos capas que, entrenadas con divergencia contrastiva, impulsaron el renacimiento del aprendizaje profundo hacia 2006. Hoy su valor es sobre todo histórico y didáctico, desplazadas por modelos como los autoencoders variacionales, las GAN y la difusión.
Máquinas de Vectores de Soporte
Las máquinas de vectores de soporte buscan el hiperplano que separa dos clases con el máximo margen, definido solo por los puntos más cercanos a la frontera. El margen blando, el parámetro C y el kernel trick las hacen potentes en datos pequeños y de alta dimensión.
Máxima Verosimilitud
El método que elige los parámetros de un modelo haciendo más probables los datos observados: de Fisher a la log-verosimilitud y la entropía cruzada que entrena las redes.
Método de Máxima Entropía
El método de máxima entropía es un principio de inferencia que, entre todas las distribuciones de probabilidad compatibles con lo que sabemos, elige la de mayor entropía: la más «honesta», la que no asume nada de más. Explicamos el principio de Jaynes, su intuición, su versión en aprendizaje automático —el clasificador de máxima entropía— y sus aplicaciones.
Métricas de Evaluación
Las métricas de evaluación son las medidas cuantitativas con que se juzga un modelo, y no hay una sola. Repasamos las de clasificación (matriz de confusión, precisión, sensibilidad, F1 y ROC-AUC), por qué la exactitud engaña con clases desbalanceadas y las de regresión (MAE, MSE, RMSE y R²).
N
O
One-Shot Learning
El one-shot learning reconoce una clase nueva a partir de un único ejemplo, apoyándose en el aprendizaje de métrica (redes siamesas, matching, prototypical) y el meta-aprendizaje; en los LLM, «one-shot» designa además dar un solo ejemplo en el prompt (aprendizaje en contexto).
OpenAI
Organización de investigación en IA fundada en San Francisco en 2015. Su misión declarada es que la inteligencia artificial general beneficie a toda la humanidad; es la creadora de GPT, ChatGPT, DALL·E, Whisper y Sora.
Optimización
Optimizar es encontrar la mejor solución de una función objetivo, su máximo o su mínimo. En el aprendizaje automático es el motor del entrenamiento: ajustar los parámetros de un modelo para minimizar su error. Explicamos qué es una función objetivo, la diferencia entre problemas convexos y no convexos, el descenso de gradiente y sus variantes, y por qué no siempre se alcanza el óptimo global.
Optimización Multiobjetivo
La optimización multiobjetivo consiste en optimizar a la vez varios objetivos en conflicto, donde mejorar uno suele empeorar otro. En lugar de una única solución, entrega un conjunto de compromisos. Explicamos la dominancia y el frente de Pareto, los métodos para abordarla —de la suma ponderada a NSGA-II— y por qué la elección final sigue siendo humana.
Overfitting
El overfitting, o sobreajuste, es uno de los problemas centrales del aprendizaje automático: ocurre cuando un modelo se ajusta tan bien a los datos de entrenamiento —incluido su ruido— que generaliza mal a datos nuevos. Explicamos cómo se detecta, su contraste con el subajuste y el compromiso sesgo-varianza, y las técnicas para mitigarlo.
P
Perceptrón
El perceptrón, propuesto por Frank Rosenblatt en 1958, es el modelo más simple de neurona artificial: una suma ponderada seguida de una función escalón. Su incapacidad para resolver el XOR, señalada por Minsky y Papert, abrió el camino al perceptrón multicapa.
Perceptrón Multicapa
El perceptrón multicapa es una red feedforward con capas ocultas y activaciones no lineales, entrenada por retropropagación. Corregimos un error extendido —no lo creó Hinton; sus raíces están en Rosenblatt (1958)—, aclaramos que «multicapa» no es «profundo» y mostramos que sigue vivo dentro de los Transformers.
Planificación
La planificación automática es la rama de la IA que busca una secuencia de acciones capaz de llevar del estado inicial a una meta. Del formalismo STRIPS y el lenguaje PDDL a la búsqueda heurística y los agentes con grandes modelos de lenguaje.
pLSA
El pLSA, propuesto por Thomas Hofmann en 1999, dio un fundamento probabilístico al modelado de temas, pero su falta de un modelo generativo a nivel de documento lo hacía propenso al sobreajuste; el LDA lo corrigió en 2003 con un prior de Dirichlet.
Precisión
La precisión es una métrica de clasificación que mide qué proporción de los casos que un modelo marca como positivos lo son de verdad. Explicamos su fórmula, su lugar en la matriz de confusión, por qué no debe confundirse con la exactitud, su tensión con el recall y cuándo conviene priorizar una precisión alta.
Privacidad y Seguridad en IA
Privacidad y seguridad en IA son problemas distintos con defensas distintas: proteger los datos que alimentan a los modelos y proteger al modelo frente a ataques como la inyección de prompts. Repasamos los riesgos reales, por qué el aprendizaje federado no garantiza privacidad por sí solo y qué exigen ya el EU AI Act y el marco del NIST.
Procesamiento de Señales
El procesamiento de señales es el campo clásico de la ingeniería que analiza, filtra y transforma señales como el audio, la imagen o el ECG. La IA se apoya en él para adquirir y preparar los datos, aunque el aprendizaje profundo aprenda cada vez más de la señal cruda.
Procesamiento del Lenguaje Natural (PLN)
El PLN es la rama de la IA que permite a las máquinas comprender y generar lenguaje humano. De los sistemas de reglas a los modelos fundacionales: qué abarca, cómo se evalúa y qué riesgos documentados arrastra.
Procesos de Dirichlet
El proceso de Dirichlet es una distribución sobre distribuciones, pieza clave de la estadística bayesiana no paramétrica. Permite agrupar datos sin decidir de antemano cuántos grupos hay: el modelo lo infiere y deja que crezca con las observaciones.
Procesos de Poisson
Un proceso de Poisson cuenta eventos aleatorios en el tiempo bajo hipótesis precisas: independencia y una tasa λ. Damos su definición formal (conteos de Poisson, tiempos exponenciales), distinguimos el caso homogéneo del no homogéneo, y explicamos por qué en neuronas o mercados es un modelo con supuestos, no la realidad.
Procesos Gaussianos
Un proceso gaussiano es una distribución sobre funciones, definida por una media y un kernel, que sustenta dos tareas: la regresión con incertidumbre calibrada y la clasificación aproximada. Su límite es el coste O(n³), que motiva las aproximaciones dispersas.
Programación Lógica Inductiva
La programación lógica inductiva es una rama de la IA simbólica que aprende reglas lógicas a partir de ejemplos y de conocimiento previo. A diferencia del aprendizaje automático estadístico, produce hipótesis interpretables y aprende con muy pocos datos. Explicamos su idea, qué la distingue, sus sistemas y su papel en la IA neuro-simbólica.
PyTorch
PyTorch es el framework de aprendizaje profundo de código abierto nacido en Meta y gobernado desde 2022 por la PyTorch Foundation, bajo la Linux Foundation. De autograd a torch.compile y ExecuTorch: qué lo distingue, cómo ha evolucionado desde PyTorch 2.0 y cuándo elegirlo.
R
Random Forest
Random Forest (bosque aleatorio) es uno de los algoritmos más usados del aprendizaje automático: combina muchos árboles de decisión, cada uno entrenado con un toque de azar, y agrega sus predicciones. Explicamos sus dos fuentes de aleatoriedad, su origen, sus notables ventajas —robustez, importancia de características— y sus límites.
Razonamiento Basado en Casos
El razonamiento basado en casos resuelve problemas nuevos reutilizando soluciones de casos pasados similares, mediante el ciclo de las cuatro R (recuperar, reutilizar, revisar y retener) formalizado por Aamodt y Plaza en 1994.
Razonamiento Basado en Reglas
El razonamiento basado en reglas representa el conocimiento como reglas «si… entonces…» y usa un motor de inferencia. Explicamos el encadenamiento hacia delante y hacia atrás, por qué no es lo mismo que la retropropagación ni el backtracking, y por qué estos sistemas no son «autoevolutivos».
Razonamiento Probabilístico
El razonamiento probabilístico es el enfoque de la IA para operar con conocimiento incierto: representa lo que no se sabe con probabilidades y saca conclusiones con las reglas de la probabilidad. Explicamos su herramienta central, las redes bayesianas, qué significa hacer inferencia y en qué se diferencia del razonamiento lógico.
Recall
El recall —también llamado exhaustividad o sensibilidad— es una métrica de clasificación que mide qué proporción de los casos positivos reales identificó correctamente un modelo. Explicamos su fórmula, su lugar en la matriz de confusión, su tensión con la precisión, la F1 que las combina y cuándo conviene priorizar un recall alto.
Recocido Simulado (Simulated Annealing)
El recocido simulado es una metaheurística de optimización probabilística inspirada en el enfriamiento controlado de los metales. Su truco es aceptar a veces soluciones peores para escapar de óptimos locales, con una probabilidad que baja al enfriarse. Explicamos su origen, su criterio de aceptación, sus usos y sus límites.
Reconocimiento de Escritura a Mano
Qué es el reconocimiento de escritura a mano, online y offline: de LeNet y las LSTM con CTC a transformers como TrOCR y Donut y a los modelos multimodales, cómo se mide con CER y WER, y dónde están sus límites reales.
Reconocimiento de Imágenes
El reconocimiento de imágenes es la tarea de la visión por computador que identifica y clasifica el contenido de una imagen. Explicamos sus matices —clasificar, detectar, segmentar—, el punto de inflexión que supuso AlexNet en 2012, cómo funcionan a grandes rasgos las redes convolucionales, sus aplicaciones y sus límites, como los sesgos y los ejemplos adversarios.
Reconocimiento de Voz
El reconocimiento de voz es la tecnología que convierte el lenguaje hablado en texto. Explicamos qué la distingue de tareas afines, su evolución desde los modelos ocultos de Markov hasta el aprendizaje profundo de extremo a extremo (wav2vec 2.0, Whisper), la métrica con que se evalúa (la tasa de error de palabra) y sus retos pendientes.
Reconocimiento Óptico de Caracteres (OCR)
El OCR convierte el texto contenido en imágenes en texto editable por una máquina. Explicamos cómo funciona —del pipeline clásico a los Transformers como TrOCR y Donut—, por qué BERT no es un modelo de OCR y cómo se mide su precisión.
Redes Adversariales Generativas
Qué son las redes adversariales generativas (GAN): dos redes que compiten en un juego minimax, sus límites reales —inestabilidad y colapso de modos— y por qué los modelos de difusión las han desplazado en 2026.
Redes Bayesianas
Una red bayesiana es un modelo gráfico probabilístico que representa variables aleatorias y sus dependencias mediante un grafo dirigido acíclico. Explicamos cómo codifica de forma compacta la distribución conjunta con tablas de probabilidad condicional, qué significa hacer inferencia con ella y sus usos, del diagnóstico médico al filtrado de spam.
Redes Neuronales Artificiales
Qué es una red neuronal artificial: un modelo de neuronas conectadas por pesos que aprende de los datos, inspirado en el cerebro pero sin simularlo. Recorre la neurona, las capas, el entrenamiento por retropropagación y sus límites.
Redes Neuronales Continuas
«Redes neuronales continuas» no es un método con nombre propio, sino la familia de profundidad y tiempo continuo cuya expresión más verificable son las Ecuaciones Diferenciales Ordinarias Neuronales (Neural ODEs): sustituyen la pila de capas discretas por una transformación gobernada por una ecuación diferencial.
Redes Neuronales Convolucionales
Arquitectura de aprendizaje profundo que aprende a mirar imágenes mediante filtros que se deslizan por ellas, con pesos compartidos e invariancia a la traslación. De LeNet-5 a AlexNet, las CNN destraparon la visión por computadora moderna.
Redes Neuronales de Crecimiento Adaptativo
Arquitecturas que no fijan su tamaño de antemano, sino que añaden neuronas o capas durante el entrenamiento. El rótulo es poco estándar: la familia real son las redes neuronales constructivas, de la Cascade-Correlation a la búsqueda de arquitecturas.
Redes Neuronales de Impulsos
Las redes neuronales de impulsos (SNN) son modelos más próximos a la biología en los que las neuronas se comunican mediante impulsos discretos en el tiempo. Explicamos cómo funcionan, el reto de entrenarlas y su eficiencia en hardware neuromórfico, con el matiz de que no sustituyen a las redes profundas convencionales.
Redes Neuronales Modulares
Una red neuronal modular divide el problema en subredes especializadas cuyas salidas se combinan. Deslindamos la modularidad de los ensembles, las cascadas y la mezcla de expertos (MoE) —hoy clave para escalar los grandes modelos de lenguaje— y separamos los ejes de arquitectura, enrutamiento y composición.
Redes Neuronales Profundas
Una red neuronal profunda tiene varias capas ocultas; «profunda» alude al número de capas. Aclaramos que no es una subdisciplina sino una clase de modelos, y que más profundidad no implica mejor rendimiento: depende de la arquitectura, los datos y la tarea. Repasamos sus arquitecturas y la tendencia a la eficiencia.
Redes Neuronales Recurrentes
Las redes neuronales recurrentes procesan secuencias manteniendo un estado oculto que actúa como memoria. Repasamos cómo funcionan, por qué el gradiente que se desvanece dio lugar a la LSTM y la GRU, y qué papel conservan frente a los Transformers.
Redes Siamesas
Una red siamesa usa dos subredes gemelas de pesos compartidos para medir cuánto se parecen dos entradas en un espacio de embeddings. De la verificación de firmas y rostros al aprendizaje de un solo ejemplo, es la herramienta del aprendizaje métrico.
Reducción de Dimensionalidad
Qué es la reducción de dimensionalidad y por qué selección, extracción y visualización son trabajos distintos: de PCA a UMAP y los embeddings, con las trampas de la fuga de datos y los mapas malinterpretados.
Regresión
La regresión es la tarea del aprendizaje supervisado que predice un valor continuo —un número—, frente a la clasificación, que predice categorías. Del ajuste por mínimos cuadrados a las métricas MSE, MAE y R², las variantes regularizadas y el matiz de la regresión logística.
Regresión de Procesos Gaussianos
La regresión por procesos gaussianos es un método bayesiano y no paramétrico que define una distribución de probabilidad sobre funciones y la actualiza con los datos. Explicamos el papel del kernel, su gran ventaja —predecir con una medida de incertidumbre— y su principal límite, un coste que escala con el cubo del número de datos.
Regularización
La regularización reúne las técnicas que reducen el sobreajuste de un modelo y mejoran su capacidad de generalizar. Explicamos las penalizaciones clásicas L1 y L2 y su combinación Elastic-Net, otras técnicas propias de las redes neuronales como el dropout, y el compromiso entre sesgo y varianza que se ajusta con ellas.
Reinicio Coseno
El reinicio coseno, o cosine annealing with warm restarts (SGDR), es una estrategia para planificar la tasa de aprendizaje durante el entrenamiento: combina un decaimiento en forma de coseno con reinicios periódicos que ayudan a escapar de mínimos locales. Explicamos cómo funciona, por qué se usa y sus parámetros.
ResNet
ResNet es la arquitectura de red neuronal que introdujo las conexiones residuales o «de salto», permitiendo entrenar redes mucho más profundas de lo que antes era posible. Explicamos el problema de la degradación que resolvió, cómo funciona su bloque residual, su origen ganador en 2015 y por qué su idea sigue presente hasta en los Transformers.
Robótica
La robótica es el campo interdisciplinar dedicado al diseño, la construcción y el uso de robots: máquinas capaces de percibir su entorno, decidir y actuar físicamente sobre el mundo. Explicamos el bucle percepción-planificación-acción, su relación con la inteligencia artificial —que le aporta la inteligencia—, el origen de las palabras «robot» y «robótica», y hacia dónde va en 2026.
S
Satisfacción de Restricciones
Un problema de satisfacción de restricciones (CSP) se define con variables, sus dominios de valores posibles y las restricciones que limitan las combinaciones válidas. Explicamos qué es una solución, ejemplos como el Sudoku o los horarios, los métodos para resolverlos y la diferencia entre satisfacción y optimización con restricciones.
Scikit-learn
Scikit-learn es una biblioteca de código abierto de aprendizaje automático para Python, centrada en el machine learning clásico. Repasamos qué ofrece, su origen, la API consistente que la ha hecho estándar y por qué no es un marco de aprendizaje profundo.
Segmentación de Imágenes
Segmentar una imagen es etiquetar cada uno de sus píxeles. Esta entrada distingue las variantes semántica, por instancias y panóptica, y recorre el camino de U-Net y Mask R-CNN a los transformers y los modelos fundacionales SAM y SAM 2, con sus métricas, usos y límites.
Segmentación Semántica
La segmentación semántica asigna una etiqueta de clase a cada píxel de una imagen y produce un mapa denso de la escena. De las redes totalmente convolucionales (FCN) a DeepLab y Segment Anything, esta guía la distingue de la clasificación, la detección y la segmentación de instancias.
Selección de Características
La selección de características elige un subconjunto de las variables originales —descartando el resto y conservando su interpretabilidad— y se distingue de la extracción, que crea variables nuevas. Su mayor riesgo es la fuga de datos: seleccionar antes de separar train y test infla el rendimiento.
Series Temporales
Una serie temporal es una secuencia de observaciones ordenadas en el tiempo —precios, temperatura, demanda— cuyo análisis busca sobre todo predecir el futuro. Repasamos sus componentes, la estacionariedad y la autocorrelación, los métodos de ARIMA a las redes neuronales y por qué la validación debe respetar el orden temporal.
Sesgo
«Sesgo» nombra al menos cuatro conceptos distintos en IA: el intercepto de una neurona, el sesgo de un estimador, el del compromiso sesgo-varianza y el algorítmico. Este glosario los separa uno a uno.
Sistemas de Creencias Dinámicas
«Sistemas de Creencias Dinámicas» no es un término técnico estándar: describe cómo un agente mantiene y actualiza una creencia probabilística —una distribución sobre el mundo— con cada nueva evidencia. Su base verificable son las redes bayesianas dinámicas y el filtrado de Bayes.
Sistemas de Diálogo
Qué es un sistema de diálogo o agente conversacional: de la distinción entre sistemas orientados a tarea y de dominio abierto y la tubería clásica (NLU, gestor y NLG) a ELIZA y el giro de los grandes modelos de lenguaje, con sus límites honestos.
Sistemas de Razonamiento Basado en Modelos
El razonamiento basado en modelos es un método de la IA simbólica que diagnostica fallos comparando lo observado con lo que predice un modelo explícito del sistema. Del choque entre modelo y observación surgen conflictos y, de ellos, los diagnósticos, incluidos fallos nunca vistos.
Sistemas de Recomendación
Los sistemas de recomendación son sistemas de filtrado de información que predicen qué ítems le interesarán a un usuario para sugerírselos: productos, películas, música o noticias. Explicamos sus enfoques principales, los datos que usan, sus problemas clásicos, su evolución hasta el aprendizaje profundo y las métricas con las que se evalúan.
Sistemas Expertos
Qué es un sistema experto: un programa de IA que emula el juicio de un especialista humano mediante una base de conocimiento de reglas SI-ENTONCES y un motor de inferencia. Su edad de oro con DENDRAL y MYCIN, y por qué el aprendizaje automático acabó relevándolos.
Sistemas Multiagente
Un sistema multiagente está formado por varios agentes autónomos que interactúan en un entorno común para resolver problemas que superan a un agente aislado. Definimos primero qué es un agente, repasamos las propiedades del sistema (autonomía, descentralización, interacción), la coordinación entre agentes y sus usos, incluidos los sistemas basados en grandes modelos de lenguaje.
SSD (Single Shot Detector)
SSD (Single Shot MultiBox Detector) es una arquitectura de detección de objetos presentada por Wei Liu y colaboradores en ECCV 2016 que localiza y clasifica objetos en una sola pasada de red neuronal, sin etapa previa de propuestas de regiones.
Síntesis de Voz
La síntesis de voz, o texto a voz, es la tecnología que genera habla artificial a partir de texto. Explicamos su evolución desde la unión de fragmentos grabados hasta los modelos neuronales que hoy producen voces casi humanas, cómo se organiza el proceso, con qué métrica se mide la calidad y los dilemas éticos de la clonación de voz.
T
t-SNE
t-SNE es una técnica de reducción de dimensionalidad no lineal muy usada para visualizar datos de alta dimensión en dos o tres dimensiones. Explicamos su propósito, cómo funciona a grandes rasgos, el papel del hiperparámetro de perplejidad y, muy importante, las advertencias sobre cómo leer —y cómo no leer— sus mapas.
T5 (Text-to-Text Transfer Transformer)
T5, de Google (Raffel et al., 2019), trata toda tarea de lenguaje como un problema «de texto a texto». Explicamos ese enfoque unificado, su arquitectura codificador-decodificador frente a GPT y BERT, su preentrenamiento sobre el corpus C4 y variantes como mT5 y Flan-T5.
Tasa de Aprendizaje
La tasa de aprendizaje fija el tamaño del paso del descenso de gradiente: demasiado alta y el entrenamiento diverge, demasiado baja y se arrastra. Repasamos su papel, las planificaciones (warmup, coseno) y los métodos adaptativos como Adam.
TensorFlow
Biblioteca de código abierto para aprendizaje automático creada por Google Brain y liberada en 2015. Opera con tensores que fluyen por un grafo de cómputo y hoy comparte el trono del aprendizaje profundo con PyTorch.
Teorema de Bayes
El teorema de Bayes es la regla para actualizar nuestras creencias a la luz de la evidencia: combina lo que ya sabíamos con lo que acabamos de observar. De él nacen la inferencia bayesiana y el clasificador Naive Bayes.
Teoría de la Información
El marco matemático que Claude Shannon fundó en 1948 para cuantificar la información —entropía, información mutua, divergencia KL y capacidad de canal—, hoy en el corazón del machine learning.
Traducción Automática
Del RBMT a la estadística y a las redes neuronales: cómo la traducción automática llegó al Transformer y a los grandes modelos de lenguaje, cómo se evalúa con BLEU y sus límites, y por qué aún falla en lenguas de pocos recursos.
Transformers
Los Transformers son la arquitectura de red neuronal que sostiene a los grandes modelos de lenguaje actuales. Presentada en 2017, sustituyó la recurrencia por el mecanismo de atención. Explicamos qué es la autoatención, cómo se organizan en codificador y decodificador, sus variantes (BERT, GPT) y su principal límite: el coste cuadrático de la atención.
U
U-Net
U-Net es la arquitectura convolucional en forma de U que Ronneberger, Fischer y Brox crearon en 2015 para segmentar imágenes con pocos datos. Hoy es, además, la columna vertebral de los modelos de difusión que generan imágenes.
Underfitting
El subajuste ocurre cuando un modelo es demasiado simple para capturar la estructura de los datos: rinde mal en entrenamiento y en prueba, señal de un sesgo alto. Es el opuesto del sobreajuste y se corrige con más capacidad, mejores características o menos regularización.
V
Validación Cruzada
La validación cruzada es una técnica de remuestreo que estima cómo generalizará un modelo a datos no vistos reutilizando los disponibles. Su método estrella, la validación de k pliegues, sirve para comparar modelos, ajustar hiperparámetros y detectar el sobreajuste.
Varianza
La varianza mide cuánto se dispersan los valores en torno a su media —el valor esperado del cuadrado de la desviación— y, en aprendizaje automático, nombra además la sensibilidad de un modelo a sus datos de entrenamiento.
VGG
VGG es una familia de redes neuronales convolucionales para imágenes, creada en Oxford en 2014, que demostró el valor de la profundidad apilando filtros pequeños de 3×3. Explicamos su idea de diseño, las variantes VGG-16 y VGG-19, su lugar en la historia —con el matiz de que es pesada y hoy está superada— y sus usos.
Visión por Computadora
Cómo la IA enseña a las máquinas a interpretar imágenes y vídeo: de las características diseñadas a mano al salto de AlexNet en 2012, los Vision Transformers y los modelos multimodales, con sus usos y sus límites aún abiertos.
W
Word2Vec
Word2Vec (Google, 2013) aprende vectores de palabras a partir de sus contextos, con las arquitecturas CBOW y Skip-gram. Explicamos la famosa aritmética de vectores y su matiz, por qué produce embeddings estáticos que no manejan la polisemia, y su lugar frente a los embeddings contextuales de 2018.
WordNet
Base de datos léxica del inglés iniciada en Princeton en 1985 por el equipo de George A. Miller: 117.659 conjuntos de sinónimos enlazados por relaciones semánticas como la hiperonimia. Congelada en su versión oficial, sigue viva como recurso estructurado en plena era de los LLM.
X
Y
Z
Á
É
No se encontraron resultados.