La inteligencia artificial enfrenta un desafío fundamental cuando los agentes deben actuar con información incompleta. Esta situación, conocida como observabilidad parcial, es común en entornos reales donde no disponemos de un mapa completo del mundo o del estado del sistema. Los investigadores han dado un paso adelante en este campo con ASK+, una nueva técnica que mejora la colaboración entre agentes de aprendizaje por refuerzo y modelos de lenguaje pequeños (SLMs).\n\nEl problema clave identificado por el equipo de investigación es que los enfoques tradicionales de asistencia basados en modelos de lenguaje a menudo fallen por completo. Cuando se usa un prompt simple centrado en el agente (egocentric prompt), el modelo de lenguaje no recibe suficiente contexto para actuar como un verdadero asesor. Esto resulta en una tasa de sobrescritura (overwrite rate) prácticamente cero, lo que significa que el modelo casi nunca contribuye con una acción independiente.\n\nASK+ resuelve este problema mediante el suministro de contexto trayectorial al modelo de lenguaje. En lugar de mostrar solo la acción actual, el sistema proporciona un mapa parcialmente revelado, posiciones visitadas y el historial de acciones. Este enfoque transforma al modelo de un simple verificador de redundancia en un consultor más informativo que puede corregir ocasionalmente la política del agente.\n\nLos resultados experimentales son impresionantes. En la tarea DoorKey, donde el enfoque anterior ASK alcanzaba el 89% de éxito, ASK+ mejora este rendimiento al 93%. En FourRooms, la tasa de éxito sube de 53% al 70%, una mejora del 32%. Incluso más notable es el caso de HigherLower, donde se alcanza el 73.7% de precisión, igualando el límite superior establecido por el modelo de lenguaje solo.\n\nQuizás más importante que los números es lo que revela el estudio sobre la naturaleza de la incertidumbre. Los investigadores demostraron que la señal de entropía predictiva utilizada para seleccionar cuándo consultar al modelo mide la incertidumbre de acción, no la del estado. Esto confirma que la asistencia basada en incertidumbre sigue siendo válida incluso en entornos donde no conocemos completamente el estado del mundo.\n\nOtra descubrimiento relevante es que Qwen3.5-2B, un modelo de 2 mil millones de parámetros, puede igualar o superar a Qwen3.5-4B, que tiene el doble de parámetros. Esto sugiere que el diseño del prompt y la selección inteligente de cuándo consultar son más determinantes que la escala del modelo, abriendo camino para aplicaciones más eficientes en hardware con recursos limitados.\n\nPara la industria tecnológica, estos hallazgos tienen implicaciones significativas. Las empresas pueden implementar sistemas de asistencia de IA más eficaces sin necesidad de recurrir a modelos enormes y costosos. Esto es especialmente valioso en aplicaciones como robots autónomos, sistemas de asistencia en tiempo real o entornos donde la latencia es crítica.\n\nEl trabajo también abre nuevas preguntas sobre cómo estructurar la comunicación entre diferentes tipos de modelos de IA. La idea de que un modelo pequeño pueda ser más útil que uno grande dependiendo de cómo se le presenta la información tiene un potencial transformador para la arquitectura de sistemas híbridos.\n\nEn resumen, ASK+ representa un avance importante en cómo entendemos la colaboración entre modelos de diferentes capacidades. Al enfocarnos en el contexto y la estructura de la información rather than en la escala, los investigadores han demostrado que a veces los problemas no son de capacidad, sino de comunicación.