IA 360
Inteligencia Artificial General (AGI)

Machine learning y deep learning: un mapa de señales, modelos y pruebas

Deep learning es una familia dentro de machine learning. Un mapa para elegir señal, modelo, objetivo y evaluación sin prometer IAG.

Admin IA360 5 min de lectura Generado con IA Read in English
Machine learning y deep learning: un mapa de señales, modelos y pruebas

Reeditado el 30 de julio de 2026, este artículo sustituye una escalera ficticia por un mapa: deep learning es una familia dentro de machine learning, no un campo paralelo ni un peldaño que conduzca por sí mismo a inteligencia artificial general. Supervisado, autosupervisado y por refuerzo describen de dónde llega la señal para ajustar el sistema; profundo describe el tipo de modelo.

La elección correcta empieza por el problema, no por la técnica de moda. Hay que declarar qué entrada existe, qué salida se necesita, quién proporciona retroalimentación, qué error importa y cómo cambiará el entorno. Un modelo puede aprender de millones de ejemplos y seguir siendo específico; también puede necesitar mucho trabajo humano aunque las etiquetas no se escriban a mano.

Un mapa con ejes, no una jerarquía

En aprendizaje supervisado, cada ejemplo contiene una entrada y una salida objetivo: imagen y diagnóstico, mensaje y categoría, vivienda y precio. El algoritmo ajusta una función para reducir el error en el conjunto de entrenamiento. La prueba está en datos separados y debe representar la población futura. Si se filtra información del objetivo o se repiten personas entre particiones, la puntuación se infla.

El aprendizaje no supervisado busca estructura sin una etiqueta objetivo equivalente: grupos, densidades o factores. El autosupervisado crea una tarea a partir del propio dato, como ocultar una parte y predecirla o comparar dos transformaciones de un ejemplo. El aprendizaje por refuerzo usa consecuencias de acciones a lo largo del tiempo. Estos regímenes pueden combinarse: un modelo se preentrena de forma autosupervisada, se ajusta con etiquetas y después aprende una política con retroalimentación.

La revisión de Deep learning de LeCun, Bengio y Hinton describe modelos con múltiples niveles de representación que transforman datos brutos en rasgos progresivamente abstractos. «Profundo» se refiere a esa composición de capas. No significa que la explicación sea profunda, que el sistema imite la conectividad cerebral ni que su conocimiento sea general.

Conviene separar tres preguntas que el vocabulario comercial mezcla. La arquitectura dice qué transformaciones puede representar el modelo; el régimen de aprendizaje dice qué señal modifica sus parámetros; y el sistema completo dice cómo se obtienen datos, herramientas y decisiones. La misma red puede entrenarse con etiquetas, con una tarea autosupervisada o dentro de un agente por refuerzo. Y una aplicación puede combinar una red con reglas explícitas, búsqueda y controles humanos. Llamarla «deep learning» no identifica por sí solo ninguna de esas elecciones.

La supervisión no elimina el trabajo humano: lo desplaza

Las etiquetas proceden de expertos, usuarios, sensores, registros o reglas. Cada fuente contiene decisiones y errores. Antes de entrenar se define la unidad, el periodo, las clases y el tratamiento del desacuerdo. Una etiqueta clínica puede depender de una prueba posterior; una categoría de fraude puede aparecer meses después; una acción de usuario puede reflejar posición en pantalla y no preferencia.

Las redes profundas pueden aprender rasgos y predictor conjuntamente, reduciendo ingeniería manual en algunos problemas. Pero siguen incorporando decisiones humanas sobre datos, pérdida, arquitectura y umbral. Representation Learning revisa criterios y métodos para aprender representaciones, incluida la utilidad de factores explicativos y transferibles. Aprender una representación no garantiza que coincida con las causas del mundo ni que conserve lo necesario para otra tarea.

El control mínimo separa entrenamiento, validación y prueba por la unidad que será nueva en producción —persona, dispositivo, lugar o tiempo— y conserva una línea base sencilla. Regresión lineal, árboles o reglas pueden superar una red cuando los datos son pocos, tabulares o estables. La complejidad solo se justifica si mejora la métrica pertinente después de incluir latencia, mantenimiento y posibilidad de revisión.

Autosupervisión: fabricar una señal no es aprender sin supuestos

BERT ocultaba tokens y entrenaba al modelo para recuperarlos antes de ajustarlo en tareas con etiquetas. SimCLR aprendía representaciones visuales aproximando dos transformaciones de la misma imagen y separando otras. En ambos casos, los diseñadores eligieron qué se oculta, qué transformaciones conservan identidad y qué ejemplos cuentan como comparación.

Un autoencoder aprende a reconstruir la entrada después de pasar por una representación. Puede comprimir o eliminar ruido si el cuello de botella y la pérdida lo favorecen. También puede aprender atajos y conservar detalles irrelevantes. Una buena reconstrucción no demuestra que el código represente enfermedad, intención o significado; esa utilidad se prueba en tareas posteriores y bajo cambios de distribución.

La autosupervisión aprovecha grandes corpus sin etiquetar cada ejemplo, pero «sin etiqueta» no significa sin curación, permisos o coste. Recoger, deduplicar, filtrar y documentar datos es trabajo. Además, la tarea previa puede favorecer capacidades distintas de la final. El beneficio se mide comparando desde cero y preentrenado con los mismos datos etiquetados, presupuesto y protocolo.

Refuerzo: una recompensa define conducta, no inteligencia

En aprendizaje por refuerzo, un agente observa un estado, elige una acción, recibe una recompensa y afecta estados futuros. Debe equilibrar explorar alternativas y explotar lo que parece funcionar. El resultado depende del entorno, la recompensa, el horizonte, la observabilidad y la posibilidad de reiniciar; «aprende solo» oculta esas decisiones de diseño.

Deep Q-Network combinó aprendizaje Q y redes convolucionales para aprender políticas en juegos de Atari a partir de píxeles y puntuaciones. AlphaGo combinó redes de políticas y valor, búsqueda en árboles y datos de partidas con autojuego. Fueron sistemas distintos dentro de entornos con acciones y objetivos definidos, no etapas de un mismo agente general.

Una recompensa incompleta puede producir una estrategia que maximiza el número y viola la intención. Por eso se prueban atajos, efectos laterales, cambios de regla y capacidad de detenerse. En un producto real, permisos, supervisión y coste de una acción importan tanto como el retorno simulado. Acertar decisiones secuenciales en un juego no demuestra conducción segura ni juicio clínico.

Datos, hardware y evaluación deciden el resultado

Las GPU aceleraron operaciones matriciales paralelas; los aceleradores especializados adaptan memoria, precisión y flujo a ciertas cargas. El artículo sobre el TPU de primera generación en centros de datos evaluó cargas de inferencia concretas y rendimiento por vatio. No establece que todo ASIC entrene más rápido o consuma menos energía: hay que declarar modelo, lote, precisión, utilización, sistema de comparación y ciclo completo.

La robustez tampoco se deriva de la exactitud media. Intriguing properties of neural networks documentó que perturbaciones pequeñas, construidas de forma adversaria, podían cambiar predicciones de redes. Una prueba responsable incluye variaciones naturales y deliberadas, subgrupos, calibración, abstención y degradación cuando cambia el sensor o el idioma.

La ficha de un experimento registra seis campos: señal de aprendizaje; modelo y sesgo inductivo; datos y partición; objetivo; recursos; y evaluación con fallos. Después explica el sistema alrededor: reglas, búsqueda, herramientas y revisión. Una mejora se atribuye a la diferencia probada, no a «ML» o «DL» en bloque.

Para leer una demostración, conviene reconstruir su comparación. ¿Cambia solo el modelo o también aumentan los datos y el cómputo? ¿La métrica representa el coste real de un falso positivo y de un falso negativo? ¿El conjunto de prueba se fijó antes de ajustar? ¿Se informa variación entre ejecuciones y subgrupos? Una cifra aislada no permite atribuir una mejora. El resultado útil es una relación condicionada: bajo esos datos, recursos, umbral y población, este sistema rindió así frente a esta alternativa.

Machine learning y deep learning pueden formar parte de sistemas muy amplios, pero no son componentes suficientes ni necesariamente exclusivos de una futura IAG. La capacidad transferible es clasificar cualquier afirmación por señal, objetivo, adaptación, métrica y dominio de validez. Ese mapa permite elegir una técnica hoy y reconocer sus límites sin convertir el aprendizaje a partir de datos en una cuenta atrás hacia la IAG.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar