Los modelos visión-lenguaje (VLM) han demostrado una capacidad asombrosa para entender documentos complejos, pero arrastran un defecto crítico en tareas de OCR: su tendencia a "alucinar" correcciones lingüísticas. Ante texto anómalo, ilegible o con errores intencionales en una imagen —piensen en captchas, notas manuscritas con tachaduras o documentos históricos degradados—, el modelo suele reescribir la salida para que sea gramaticalmente plausible, traicionando la fidelidad transcripcional que exige la automatización documental profesional.
Un trabajo reciente publicado en arXiv (2609.38282v1) aborda este problema desde la óptica del aprendizaje por refuerzo (RL) y la destilación de conocimiento. La investigación identifica una dinámica contraproducente en los métodos actuales como GRPO (Group Relative Policy Optimization) combinados con On-Policy Distillation (OPD) de peso fijo: a medida que el modelo estudiante mejora, la guía de un maestro congelado deja de ser útil e incluso se vuelve perjudicial, forzando al estudiante hacia distribuciones de probabilidad que ya no reflejan la realidad visual del token.
La propuesta, denominada GAD-RL (Gated and Attenuated On-Policy Distillation), introduce tres mecanismos regulatorios que actúan en tándem durante el post-entrenamiento conjunto. Primero, una compuerta (gating) dura: si algún respuesta en el grupo de muestreo alcanza una recompensa de tarea de 0.95 o superior, la destilación se desactiva por completo para ese grupo, asumiendo que el estudiante ya ha dominado ese patrón. Segundo, una atenuación continua de la fuerza de destilación proporcional a la recompensa media del grupo: a mayor confianza en la salida, menor influencia del maestro. Tercero, un ponderado de la divergencia KL forward basado en la probabilidad que el propio estudiante asigna al token top-1 del maestro; si el estudiante no "cree" en la sugerencia del maestro, la actualización auxiliar se modera automáticamente.
Los resultados son contundentes. Sobre una base Qwen3.5-2B —lo que sugiere una arquitectura de última generación optimizada para eficiencia—, GAD-RL alcanza un 59.92% de Micro Recall en CHAOS-Bench, un benchmark diseñado específicamente para evaluar la robustez frente a texto caótico y anomalías visuales. Esto representa una mejora de 8.45 puntos porcentuales frente a GRPO puro y 4.43 puntos sobre GRPO+OPD con pesos fijos. En OmniDocBench v1.6, un estándar más generalista de comprensión documental, logra un Overall score de 91.18, consolidando la ganancia sin sacrificar capacidades generales.
¿Por qué importa esto para la industria? La fidelidad OCR no es un problema académico menor; es el cuello de botella en pipelines de RAG (Retrieval-Augmented Generation) industriales, digitalización de archivos legales, procesamiento de facturas no estandarizadas y análisis de documentos históricos. Hasta ahora, mejorar la transcripción fiel requería datos sintéticos masivos o modelos enormes. GAD-RL demuestra que una regulación inteligente de la señal de entrenamiento —tratar al maestro como un consultor que calla cuando el alumno sabe más que él— es una palanca arquitectónica más eficiente que el mero escalado. Para los equipos de ML Ops, esta técnica promete modelos más pequeños, rápidos y fiables para producción real, reduciendo la dependencia de anotación humana costosa para corregir alucinaciones sistemáticas.