La Inteligencia Artificial ha avanzado significativamente en la última década, especialmente en el área de los modelos de lenguaje grande (LLM). Sin embargo, estos modelos aún enfrentan un problema crítico: la fabricación de respuestas. Esto ocurre cuando el modelo genera respuestas que no están respaldadas por la información disponible en el contexto.

La detección de la fabricación de respuestas es un desafío importante en la comunidad de IA. La mayoría de los métodos existentes requieren supervisión externa en tiempo de inferencia, lo que puede ser lento y costoso. Un equipo de investigadores ha estado trabajando en resolver este problema y ha presentado un método innovador para detectar la fabricación de respuestas en los modelos de LLM, sin necesidad de supervisión externa.

El equipo ha desarrollado un marco de supervisión débil que combina tres señales de grounding complementarias: coincidencia de substring, similitud de emparejamiento de sentencia y un modelo de LLM como veredicto de juez para etiquetar las respuestas generadas como fundamentadas o fabricadas sin anotación humana. Con este marco, el equipo ha construido un conjunto de datos de 15.000 ejemplos a partir de SQuAD v2 (10.500 muestras de entrenamiento y desarrollo y un conjunto de prueba separado de 5.000 muestras), donde cada ejemplo pone en pareja una respuesta generada por LLaMA-2-7B con sus estados de ocultación completos y etiquetas estructuradas de fabricación.

A continuación, el equipo ha entrenado cinco clasificadores de investigación: ProbeMLP (M0), LayerWiseMLP (M1), CrossLayerTransformer (M2), HierarchicalTransformer (M3) y CrossLayerAttentionTransformerV2 (M4), directamente en estos estados de ocultación, tratando las señales de grounding externas como supervisión en tiempo de entrenamiento solo. La hipótesis central del equipo es que los señales de detección de fabricación pueden ser destilados en representaciones de transformador, permitiendo la detección interna sin ninguna verificación externa en tiempo de inferencia.

Los resultados apoyan esta hipótesis. Los clasificadores de transformador logran la mejor discriminación, con M2 realizando mejor en la mediana de AUC/F1 en 5 plegados y M3 realizando mejor en la evaluación de validación y prueba de una sola plegada. El equipo también ha evaluado la eficiencia de inferencia: el retardo de la probe se encuentra entre 0,15 y 5,62 ms (batched) y 1,55 y 6,66 ms (muestra individual), mientras que la velocidad de generación completa más probe sigue siendo aproximadamente 0,231 consultas por segundo, indicando un retraso práctico insignificante.

Este avance en la IA puede tener consecuencias significativas en la detección de la fabricación de respuestas en los modelos de lenguaje grande. Los resultados de este estudio sugieren que es posible detectar la fabricación de respuestas internamente, sin requerir supervisión externa en tiempo de inferencia. Esto puede mejorar la precisión y fiabilidad de los modelos de lenguaje grande y reducir la necesidad de verificación externa. Además, este método puede ser aplicado a otros problemas de IA, como la detección de plagio o la evaluación de la credibilidad de las fuentes.

En resumen, el equipo de investigadores ha presentado un método innovador para detectar la fabricación de respuestas en los modelos de LLM, sin necesidad de supervisión externa. Los resultados de este estudio sugieren que es posible detectar la fabricación de respuestas internamente, sin requerir verificación externa en tiempo de inferencia. Este avance en la IA puede tener consecuencias significativas en la detección de la fabricación de respuestas en los modelos de lenguaje grande y reducir la necesidad de verificación externa.