IA 360
Glosario Inteligencia Artificial

Aprendizaje Multi-Vista

El aprendizaje multi-vista combina varias «vistas» —conjuntos de características distintos— de los mismos datos para aprender mejor y aprovechar ejemplos sin etiquetar. Del co-entrenamiento de Blum y Mitchell (1998) al puente con el aprendizaje multimodal.

Admin IA360 3 min de lectura Generado con IA Read in English
Aprendizaje Multi-Vista

El aprendizaje multi-vista (Multi-View Learning) es la familia de métodos que aprende a partir de varios conjuntos de características distintos —las «vistas»— que describen los mismos datos desde ángulos complementarios. Una página web, por ejemplo, puede describirse por el texto que contiene y, por separado, por las palabras de los enlaces que apuntan a ella; un vídeo, por su imagen y por su audio. Cada vista es una representación completa del mismo objeto, no un fragmento de él.

La intuición es sencilla: si las vistas aportan información parcialmente independiente, combinarlas rinde más que usar una sola y, punto decisivo, permite exprimir los datos no etiquetados —que abundan— en lugar de depender solo de ejemplos anotados a mano.

Por qué ayuda: vistas que se complementan

El valor del enfoque descansa en dos principios que la literatura resume como consenso y complementariedad. Por complementariedad, cada vista aporta señales que la otra no ve: el texto de una página y sus enlaces entrantes capturan aspectos distintos de un mismo tema. Por consenso, se busca que los modelos entrenados sobre cada vista coincidan en sus predicciones, y forzar ese acuerdo sobre ejemplos sin etiqueta actúa como una guía adicional que reduce el error. Dos ventanas parcialmente independientes al mismo fenómeno se restringen mutuamente, y el sistema aprende de material que, con un solo conjunto de características, se habría desperdiciado.

El co-entrenamiento de Blum y Mitchell (1998) y el CCA

El método fundacional es el co-entrenamiento (co-training), propuesto por Avrim Blum y Tom Mitchell en 1998 para clasificar páginas web. La idea: entrenar dos clasificadores, uno por vista, con los pocos ejemplos etiquetados disponibles; después, cada clasificador etiqueta los casos no etiquetados en los que está más seguro y se los pasa al otro como nuevo material de entrenamiento. Los modelos se enseñan mutuamente y el conjunto anotado crece sin intervención humana. De ahí derivan otras familias: la co-regularización, que en vez de intercambiar etiquetas añade un término que penaliza el desacuerdo entre vistas, y el análisis de correlación canónica (CCA), que se remonta a Hotelling (1936) y busca proyecciones de dos vistas máximamente correlacionadas para captar la estructura que comparten.

Supuestos, límites y el puente con lo multimodal

El co-entrenamiento clásico exige dos condiciones exigentes, y conviene ser honesto con ellas: que cada vista sea suficiente por sí sola para predecir la clase y que las vistas sean condicionalmente independientes dada esa clase. En datos reales rara vez se cumplen del todo —el texto de una página y sus enlaces comparten, de hecho, mucha información—, así que las garantías teóricas se relajan y el rendimiento depende de cuán complementarias sean de verdad las vistas. El enfoque es el antecesor conceptual del aprendizaje multimodal actual, que combina texto, imagen y audio; la diferencia es que la tradición multi-vista solía trabajar con varios conjuntos de características de una misma naturaleza, mientras que lo multimodal cruza modalidades sensoriales distintas. Por su uso de datos no etiquetados, es también pariente cercano del aprendizaje semi-supervisado. Queda sin resolver, en el caso general, cómo saber de antemano si dos vistas son lo bastante independientes para que combinarlas compense: sigue siendo una cuestión empírica más que una receta cerrada.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar