La evaluación automática de código generado por LLMs se ha convertido en un cuello de botella crítico para pipelines de generación de software asistida por IA. El enfoque dominante —usar un modelo fuerte como juez que compare dos soluciones— presenta un fallo silencioso: el juez emite veredictos seguros incluso cuando no tiene base para hacerlo.
Un nuevo trabajo publicado en arXiv (2609.30328v1) disecciona este problema en el marco MARCH, un sistema multi-agente que descompone el juicio en reclamaciones verificables contra evidencia. Los autores demuestran que la verificación multi-agente requiere dos condiciones en su evidencia: independencia respecto a la respuesta evaluada y diferenciación entre los candidatos comparados. Mientras que la primera se cumple diseñando bien el pipeline, la segunda se rompe sistemáticamente en juicios de código: la evidencia disponible (tests, documentación, especificaiones) suele ser idéntica para ambas soluciones candidatas.
El resultado es devastador para la ingenuidad: ejecutando MARCH sin modificaciones sobre dos benchmarks estándar, el sistema declara “empate” en el 78–95% de las comparaciones. Su precisión cae al 4,4%, frente al 43,7% que alcanza el mismo modelo juzgando directamente sin descomposición multi-agente. Ni problemas más simples ni jueces más grandes (probados hasta 70B parámetros) revierten la tendencia.
La contribución clave no es un juez mejor, sino un detector de incompetencia sin necesidad de etiquetas humanas. Analizando los logs internos del pipeline, los investigadores identifican dos métricas label-free que predicen cuándo el juez carece de fundamento. Al aplicar un umbral sobre una de ellas (la “varianza de evidencia” entre candidatos), el sistema aprende a abstenerse: rechaza el 50% de las comparaciones, pero eleva su precisión en las que responde del 20,7% al 36,9%.
Para equipos que despliegan evaluación automática en CI/CD, revisión de PRs o benchmarking interno, la lección es operativa: un juez que no sabe decir “no sé” contamina métricas y gates de calidad. Implementar una puerta de abstención basada en señales internas del pipeline —sin anotadores humanos— convierte un sistema ruidoso en uno conservador pero fiable. El paper abre la vía a jueces que cuantifican su propia incertidumbre epistémica, un requisito previo para cualquier sistema de IA que tome decisiones de alto impacto sin supervisión constante.