La inteligencia artificial enfrenta un desafío fundamental cuando los agentes deben actuar con información incompleta. Esta situación, conocida como observabilidad parcial, es común en entornos reales donde no disponemos de un mapa completo del mundo o del estado del sistema. Los investigadores han dado un paso adelante en este campo con ASK+, una nueva técnica que mejora la colaboración entre agentes de aprendizaje por refuerzo y modelos de lenguaje pequeños (SLMs).\n\nEl problema clave identificado por el equipo de investigación es que los enfoques tradicionales de asistencia basados en modelos de lenguaje a menudo fallen por completo. Cuando se usa un prompt simple centrado en el agente (egocentric prompt), el modelo de lenguaje no recibe suficiente contexto para actuar como un verdadero asesor. Esto resulta en una tasa de sobrescritura (overwrite rate) prácticamente cero, lo que significa que el modelo casi nunca contribuye con una acción independiente.\n\nASK+ resuelve este problema mediante el suministro de contexto trayectorial al modelo de lenguaje. En lugar de mostrar solo la acción actual, el sistema proporciona un mapa parcialmente revelado, posiciones visitadas y el historial de acciones. Este enfoque transforma al modelo de un simple verificador de redundancia en un consultor más informativo que puede corregir ocasionalmente la política del agente.\n\nLos resultados experimentales son impresionantes. En la tarea DoorKey, donde el enfoque anterior ASK alcanzaba el 89% de éxito, ASK+ mejora este rendimiento al 93%. En FourRooms, la tasa de éxito sube de 53% al 70%, una mejora del 32%. Incluso más notable es el caso de HigherLower, donde se alcanza el 73.7% de precisión, igualando el límite superior establecido por el modelo de lenguaje solo.\n\nQuizás más importante que los números es lo que revela el estudio sobre la naturaleza de la incertidumbre. Los investigadores demostraron que la señal de entropía predictiva utilizada para seleccionar cuándo consultar al modelo mide la incertidumbre de acción, no la del estado. Esto confirma que la asistencia basada en incertidumbre sigue siendo válida incluso en entornos donde no conocemos completamente el estado del mundo.\n\nOtra descubrimiento relevante es que Qwen3.5-2B, un modelo de 2 mil millones de parámetros, puede igualar o superar a Qwen3.5-4B, que tiene el doble de parámetros. Esto sugiere que el diseño del prompt y la selección inteligente de cuándo consultar son más determinantes que la escala del modelo, abriendo camino para aplicaciones más eficientes en hardware con recursos limitados.\n\nPara la industria tecnológica, estos hallazgos tienen implicaciones significativas. Las empresas pueden implementar sistemas de asistencia de IA más eficaces sin necesidad de recurrir a modelos enormes y costosos. Esto es especialmente valioso en aplicaciones como robots autónomos, sistemas de asistencia en tiempo real o entornos donde la latencia es crítica.\n\nEl trabajo también abre nuevas preguntas sobre cómo estructurar la comunicación entre diferentes tipos de modelos de IA. La idea de que un modelo pequeño pueda ser más útil que uno grande dependiendo de cómo se le presenta la información tiene un potencial transformador para la arquitectura de sistemas híbridos.\n\nEn resumen, ASK+ representa un avance importante en cómo entendemos la colaboración entre modelos de diferentes capacidades. Al enfocarnos en el contexto y la estructura de la información rather than en la escala, los investigadores han demostrado que a veces los problemas no son de capacidad, sino de comunicación.
IA y Observabilidad Parcial: Nuevo Enfoque ASK+ Revoluciona la Asistencia de LLMs
investigadores mejoran la colaboración entre agentes de RL y modelos de lenguaje pequeños usando contexto estructurado. Los resultados muestran hasta un 36% más de éxito en entornos complejos.
IAOnda Redaccion
martes, 7 de julio de 2026
Comentarios
Cargando comentarios...
Relacionados
Ciberataque con cientos de agentes IA compromete 440+ servidores PaperCut
Un actor ruso‑hablante ha usado cientos de agentes de IA para explotar dos vulnerabilidades críticas en PaperCut NG/MF, comprometiendo más de 440 instancias en todo el mundo.
Los LLMs ven un mundo más cruel: el sesgo punitivo de la IA en normas sociales
Un estudio revela que los grandes modelos de lenguaje sobrepredican castigos donde los humanos muestran tolerancia. Las metanormas, la capa invisible de la regulación social, son el nuevo reto para la alineación de la IA.
CriticGen: evaluacion de LLM con retroalimentacion que mejora respuestas
CriticGen convierte la evaluacion de LLM en un proceso de mejora accionable. Su marco genera criterios especificos por respuesta y demuestra que la retroalimentacion orientada a ejecutar cambios puede corregir resultados sin deteriorarlos de forma recurrente.