IA 360
Glosario Inteligencia Artificial

Reconocimiento de Escritura a Mano

Qué es el reconocimiento de escritura a mano, online y offline: de LeNet y las LSTM con CTC a transformers como TrOCR y Donut y a los modelos multimodales, cómo se mide con CER y WER, y dónde están sus límites reales.

Admin IA360 Generado con IA Read in English
Reconocimiento de Escritura a Mano

El reconocimiento de escritura a mano es la tarea de convertir texto manuscrito en texto digital que una máquina puede buscar, editar y procesar. Es uno de los problemas fundacionales de la visión por computador y, pese a décadas de avances, sigue abierto: la caligrafía humana varía tanto entre personas, épocas e idiomas que ningún sistema la lee con fiabilidad total.

Online y offline: dos problemas distintos

El survey de Plamondon y Srihari, publicado en IEEE TPAMI en 2000, examina por separado el reconocimiento online y el offline. En el reconocimiento online el sistema recibe la trayectoria del trazo mientras se escribe —posición y orden de la punta del stylus sobre una tableta o pantalla—, información temporal que facilita la tarea. En el reconocimiento offline solo existe la imagen del texto ya escrito, como en un documento escaneado; es el caso más difícil y el que concentra la investigación actual bajo la etiqueta HTR (handwritten text recognition).

De las redes clásicas a los transformers

El artículo de 1998 de Yann LeCun, Léon Bottou, Yoshua Bengio y Patrick Haffner describe LeNet-5, compara métodos en una tarea estándar de reconocimiento de dígitos manuscritos y señala que uno de los sistemas expuestos se desplegó comercialmente para leer varios millones de cheques al día. La clasificación temporal conexionista o CTC, presentada por Graves y sus coautores en ICML 2006, introdujo un método para entrenar redes recurrentes que etiquetan secuencias no segmentadas directamente, sin exigir datos de entrenamiento presegmentados ni convertir después cada salida en una secuencia de etiquetas.

La generación actual es transformer de extremo a extremo. TrOCR, de Microsoft (2021), une un transformer visual y otro de texto preentrenados y reporta un 2,89% de error de carácter en el benchmark IAM, según su repositorio oficial. Donut, presentado en ECCV 2022, se define como un modelo de comprensión visual de documentos libre de OCR: procesa la imagen sin externalizar la lectura a un motor de OCR separado. Una evaluación académica de GPT-4V publicada en 2023 encontró buen reconocimiento y comprensión de contenido latino, pero dificultades en escenarios multilingües, escritura deficiente capturada por cámara y tareas complejas; sus resultados no autorizan a extender la misma conclusión a Gemini.

Cómo se mide

Las métricas estándar son el CER (character error rate), la proporción de caracteres que hay que insertar, borrar o sustituir para reconstruir la transcripción correcta, y el WER (word error rate), su equivalente a nivel de palabra. Se calculan sobre benchmarks públicos: una descripción del equipo de la Universidad de Berna señala que IAM reunía entonces más de 1.500 páginas de texto manuscrito aportadas por más de 600 personas y basadas en el corpus LOB. En la competición BRESSAY de ICDAR 2024, el artículo de resultados registra un 2,88% de CER en el nivel de línea. La competición ICDAR 2026 sobre manuscritos medievales parte de nueve lenguas —ocho romances y una germánica— y reserva otra tarea para generalizar a una lengua europea no romance que no se anuncia previamente.

Usos y límites

La aplicación de mayor impacto es la digitalización de archivos: la plataforma europea Transkribus, de la cooperativa READ-COOP, declara más de 200 millones de páginas procesadas y miles de archivos y bibliotecas usuarias. Se suman la lectura automática de formularios y la conversión de notas tomadas con stylus. Los límites siguen ahí: caligrafías muy personales o degradadas, idiomas con poco corpus de entrenamiento y manuscritos históricos llenos de abreviaturas disparan el error, y en trabajo de archivo la revisión humana sigue siendo imprescindible. Fuente primaria.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar