La carrera por construir agentes de búsqueda capaces de razonar sobre la web en tiempo real acaba de recibir un nuevo contendiente de peso. Un equipo de investigadores ha publicado en arXiv los detalles técnicos de Iris-mini e Iris-pro, dos agentes basados en arquitectura Mixture-of-Experts (MoE) de 35B-A3B y 397B-A17B parámetros respectivamente, que establecen nuevos ápices de rendimiento en la categoría open-source.
Lo que distingue a Iris no es solo su tamaño, sino la ingeniería de datos radical detrás de su entrenamiento. En lugar de depender de anotación humana o distilación de modelos propietarios, los autores “reversa-construyen” tareas a partir de la estructura de hipervínculos de un corpus web real. Parten de una página semilla y sus enlaces salientes para destilar un grafo de entidades, sobre el que autorizan cadenas de razonamiento multi-salto (multi-hop). El truco decisivo: reescriben cada entidad no-respuesta como una referencia descriptiva, eliminando cualquier pista que pueda resolverse por simple coincidencia de cadenas (string matching). Solo se admiten preguntas que un modelo de referencia falla en libro cerrado pero resuelve cuando se le proporciona la evidencia.
Ese corpus curado se convierte en trayectorias de interacción herramienta-modelo, filtradas a nivel de trayectoria y de turno antes de la fase de Supervised Fine-Tuning (SFT). Aquí entra la innovación metodológica central: el "SFT-RL climbing". El policy se optimiza mediante Reinforcement Learning contra búsqueda en vivo, con el juez de recompensa y el resumidor de observaciones servidos dentro del mismo clúster de entrenamiento. Los rollouts excesivamente largos se interrumpen a nivel de petición y se reanudan desde su prefijo confirmado en el siguiente paso. Cada ronda RL devuelve los rollouts resueltos más difíciles y eficientes al siguiente pase supervisado, creando un bucle de mejora iterativa.
La evaluación revela una lección crucial para la comunidad: la gestión de contexto en tiempo de inferencia vale más que la mayoría de las diferencias arquitectónicas reportadas entre sistemas. Por eso los autores evalúan cada benchmark tanto con como sin gestión de contexto, fijando el conjunto de herramientas, el límite de contexto y el juez. Los resultados hablan por sí solos: con gestión activada, Iris-mini alcanza 82.2 / 84.8 / 86.9 / 52.3 en BrowseComp, BrowseComp-ZH, DeepSearchQA y HLE, mientras que Iris-pro llega a 88.6 / 85.1 / 92.9 / 56.4. Son los mejores resultados globales entre agentes de búsqueda abiertos en sus respectivos rangos de parámetros.
Cabe destacar la austeridad del diseño: un único agente ReAct, sin sub-agentes ni verificación en test-time. La fortaleza reside en la calidad del entrenamiento y en la gestión de contexto, no en trucos de ensemble en inferencia.
El compromiso de liberar pesos, pipeline de datos completo, receta de entrenamiento y evaluación convierte a Iris en un punto de inflexión para la investigación reproducible en agentes web. Para los ingenieros que construyen RAG avanzado o asistentes de investigación autónomos, el mensaje es claro: invertir en generación de datos sintéticos adversariales y en bucles SFT-RL cerrados con herramienta en vivo rinde más que escalar parámetros a ciegas. La frontera de la búsqueda inteligente se acaba de mover un poco más allá.