Datalab, la firma de investigación en inteligencia artificial de la Universidad de Oslo, ha puesto en circulación Lift, un modelo de visión preentrenado con 9 mil millones de parámetros que convierte documentos PDF y fotografías en archivos JSON estructurados, siguiendo esquemas explícitos.

El núcleo de la innovación reside en la combinación de dos técnicas que, combinadas, solucionan dos problemas clásicos de la extracción automática de datos: la falta de formato y la generación de contenido inventado.

Decodificación con esquema

A diferencia de los modelos tradicionales que generan texto libre, Lift incorpora un mecanismo de decodificación constraining que fuerza al modelo a cumplir con la estructura de un esquema JSON predefinido. Esto significa que cada campo que el usuario necesita (por ejemplo, "nombre", "fecha", "monto") debe aparecer en la salida, y el modelo no puede inventar claves que no existen en el esquema.

Abstención entrenada

Otra innovación clave es el entrenamiento de abstención. Cuando el modelo detecta que una información solicitada no está presente en el documento, devuelve un valor nulo en lugar de inventar datos. Esta característica reduce el riesgo de hallucination, un problema frecuente en los modelos de lenguaje que puede generar resultados erróneos y comprometer la confianza de los usuarios.

Resultados de la evaluación

En un benchmark de 225 documentos que incluye facturas, contratos y formularios, Lift alcanzó una precisión de 90.2 % en la detección de campos. Este resultado se sitúa muy por encima de los modelos de visión convencionales, los cuales suelen rondar el 70 % cuando se les pide extraer información estructurada.

Aplicaciones prácticas

El modelo tiene un amplio espectro de aplicaciones en el sector empresarial: automatización de procesos de facturación, extracción de datos de contratos legales, ingestión de informes financieros y generación de bases de datos a partir de documentos escaneados. En todos estos casos, la capacidad de generar JSON conforme a un esquema elimina la necesidad de etapas de post‑procesamiento y reducesos humanos.

Impacto en la industria

El lanzamiento de Lift es un hito importante porque demuestra que los modelos de visión pueden ser tan precisos y fiables como los modelos de lenguaje cuando se diseñan con restricciones adecuadas. Además, el hecho de que los pesos sean abiertos permite a la comunidad adaptar y mejorar el modelo, fomentando la innovación colaborativa.

Perspectivas futuras

Se prevé que Datalab continúe iterando sobre Lift, añadiendo más parámetros y afinando la política de abstención. También se están explorando arquitecturas híbridas que combinan Lift con modelos de lenguaje para mejorar la interpretación semántica de textos complejos dentro de los PDFs.

En resumen, Lift no solo representa un salto tecnológico, sino también una herramienta práctica que puede acelerar la transformación digital de empresas que dependen de la gestión de documentos.