El artículo “Fast Models, Slow Evidence” de ArXiv introduce una evaluación exhaustiva de los modelos System‑1, diseñados para tomar decisiones rápidas dentro de los *agent harnesses* de los grandes modelos de lenguaje (LLM). Estos sistemas, al responder en una sola pasada, prometen reducir drásticamente el coste computacional y la latencia comparados con invocar un LLM completo. Sin embargo, la comunidad aún carece de métricas fiables que verifiquen su exactitud y estabilidad en escenarios reales.
Los autores realizaron una paired evaluation usando dos modelos de peso abierto (Laya) y uno alojado (Jev) sobre 11 puntos de decisión extraídos de 18 fuentes públicas, lo que generó 7.283 casos base más 6.640 variantes de robustez. Cada caso se probó con entradas idénticas en bytes, en hardware variado y a lo largo de varios días, garantizando reproducibilidad. Los resultados mostraron que Jev superó a Laya en 9 de los 11 puntos, con mejoras de precisión que oscilaban entre +10,8 y +46,0 puntos porcentuales. Además, ni uno de los dos modelos logró superar el nivel de azar en la tarea de routing de modelos sin supervisión, y se mantuvieron empatados en la tarea de gating de relevancia RAG.
Más allá de la precisión, el estudio evidenció vulnerabilidades críticas: Laya modificó el 30 % de sus respuestas al invertir el orden de las opciones y su rendimiento colapsó cuando el número de candidatos creció (31 % de degradación a 50 herramientas cercanas, frente al 98 % de Jev cuando la herramienta correcta era única). Estos hallazgos subrayan que la simplicidad de una pasada adelante no garantiza fiabilidad cuando el contexto es complejo o está mal estructurado.
La auditoría interna del pipeline reveló cuatro errores que distorsionaron los resultados publicados originalmente. En primer lugar, se omitió un costo de pre‑screening, lo que convertía el supuesto ahorro del 23,9 % en un real 4,3 %. En segundo lugar, la precisión del gating se reportó como calidad end‑to‑end (58 % vs. 98 %). Tercero, los umbrales fijados en muestra (5 % objetivo) ocultaron hasta un 17 % de fallos en datos retenidos. Por último, un “efecto de canal” infló falsos positivos de inyección cuando el contenido provino de canales no nativos, efecto que desapareció al usar contenido nativo. Dos sospechas de confusiones adicionales no alteraron las conclusiones principales.
Para los profesionales hispanohablantes de IA, estos hallazgos son una llamada de atención. Las promesas de reducción de costos y latencia pueden ser engañosas si no se acompañan de pruebas rigurosas bajo condiciones reales. La necesidad de validar con datos idénticos, múltiples hardware y evaluaciones a largo plazo se vuelve esencial, sobre todo cuando los decisiones de los agentes impactan la seguridad y la efectividad de aplicaciones críticas.
En conclusión, el estudio demuestra que los modelos System‑1, pese a su atractivo por su velocidad, todavía presentan limitaciones significativas que deben ser abordadas antes de ser adoptados a gran escala. La transparencia en la publicación de código, datos y métricas, como la que ofrece el repositorio GitHub del proyecto, es clave para restaurar la confianza en la comunidad. Futuras investigaciones deberán explorar mecanismos de auto‑auditoría más robustos y técnicas de entrenamiento que mitiguen la sensibilidad a la presentación de opciones y la variabilidad de los candidatos.
Este análisis refuerza la importancia de una evaluación crítica y sistemática en la era de los agentes LLM, garantizando que la promesa de decisiones rápidas no se convierta en una fuente de errores ocultos.