Inception
Inception es una familia de arquitecturas de redes neuronales convolucionales para visión por computador cuya primera versión, GoogLeNet, ganó el desafío ImageNet de 2014. Explicamos su innovación central —el módulo Inception—, el truco que la hizo eficiente, su origen y su evolución posterior.
Inception es una familia de arquitecturas de redes neuronales convolucionales para visión por computador, cuya primera versión, GoogLeNet, fue una red profunda de 22 capas que ganó el gran desafío de reconocimiento visual ImageNet de 2014. La presentó un equipo de Google encabezado por Christian Szegedy, en un artículo con un título revelador: «Going Deeper with Convolutions» («ir más profundo con convoluciones»).
La innovación: el módulo Inception
Su idea central resolvió un dilema recurrente en el diseño de redes: ¿qué tamaño de filtro usar en cada capa? El módulo Inception responde «todos a la vez». En lugar de elegir uno, aplica en paralelo convoluciones de varios tamaños (1×1, 3×3 y 5×5) y una operación de pooling, y concatena sus salidas. Así, una misma capa capta patrones a distintas escalas simultáneamente.
El truco de la eficiencia
Aplicar tantas convoluciones a la vez sería carísimo, así que Inception introdujo un ingenioso ahorro: usar convoluciones 1×1 como «cuellos de botella» que reducen el número de canales antes de las convoluciones costosas de 3×3 y 5×5. Con ese recorte, la red pudo ser profunda y potente pero sorprendentemente ligera en parámetros, muchos menos que otras arquitecturas de su época.
El nombre
El nombre tiene su gracia. «GoogLeNet» es un homenaje a LeNet, una red pionera; e «Inception» alude al meme de internet «necesitamos ir más profundo», nacido de la película Origen (Inception) —un guiño a la profundidad de la red que los propios autores reconocieron en el artículo—.
Su evolución
A la primera versión le siguieron mejoras sucesivas. Inception v2 y v3 incorporaron la normalización por lotes y la factorización de convoluciones (descomponer una de 5×5 en dos de 3×3, más baratas). Y Inception v4 e Inception-ResNet combinaron el módulo Inception con las conexiones residuales popularizadas por ResNet, que aceleran el entrenamiento.
Piezas que usan este término
- GAN: cómo distinguir calidad, diversidad y memoria (2023-05-09)
- Visión artificial: cinco tareas que no deben medirse igual (2023-05-09)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.