El campo de la inteligencia artificial aplicada a la ciencia de materiales ha experimentado un rápido crecimiento, impulsado por la necesidad de predecir y diseñar estructuras con propiedades específicas. Los modelos de lenguaje grandes (LLM) entrenados con textos técnicos y bases de datos de cristalografías están emergiendo como herramientas prometedoras para responder preguntas sobre simetría, coordinación y energía de enlace. Sin embargo, la verdadera capacidad de estos sistemas para “razonar” a partir de la estructura versus simplemente “recitar” información almacenada en sus pesos sigue sin estar clara.\n\nEl benchmark CARAT (Do Materials LLMs Reason or Recite?) propone una evaluación rigurosa que supera los límites de las pruebas tradicionales. Consiste en ocho familias de preguntas con una respuesta dorada fija, presentadas en ocho vistas estructurales distintas. Cada relación estructural se nombra explícitamente en GraphSpace, y se incorporan técnicas de afinamiento fino, enmascarado de respuestas, inyección de evidencia, inferencia emparejada y una regla que permite suspender afirmaciones no respaldadas. Esta arquitectura pretende eliminar la posibilidad de que la mera coincidencia con el texto de entrenamiento explique los resultados.\n\nLos primeros hallazgos indican que, en las familias más difíciles, la vista fundamentada aporta 17,3 puntos de precisión sobre los inputs basados en fórmulas. Además, GraphSpace supera a un grafo periódico plano en 19,3 puntos, pero este margen se descompone en dos efectos: cuando el grafo plano contiene toda la información necesaria, la mejora es de apenas 1,96 puntos; cuando omite campos críticos, la diferencia se dispara a 46,7 puntos. Esto sugiere que el benchmark mide más bien la carencia de información en la representación básica que la forma en que se presenta la evidencia.\n\nUna autocrítica profunda revela que una regla diseñada para omitir el enlace y leer directamente la lista responde correctamente a cuatro de siete familias endurecidas, alcanzando un rendimiento cercano al azar. Tras reconstruir la regla hasta identificar once atajos que funcionaban al azar, el modelo congelado repetía la relación sin utilizarla en el 95,6 % de los casos emparejados. Con supervisión emparejada, la exactitud sube a 99,8 %, mientras que la eliminación del enlace reduce la precisión a 23,4 %, por debajo del 27,0 % alcanzado por el mejor atajo. Estos números demuestran que tanto los pasos de supervisión como la ausencia del enlace son aprendibles y que el modelo tiende a reproducir la relación sin comprender su significado.\n\nEstos resultados ponen de relieve una cuestión esencial: la diferencia entre razonamiento genuino y recitación mecánica. Cuando un LLM de materiales “responde” a una pregunta sobre la estructura de una red cristalina, podría estar simplemente copiando una frase que apareció en sus datos de entrenamiento, o bien podría estar descomponiendo la pregunta, consultando la representación gráfica y aplicando reglas de inferencia. El benchmark CARAT, al fijar la pregunta y la respuesta dorada, y al proporcionar múltiples vistas estructuradas, obliga al modelo a demostrar que su respuesta proviene de un proceso interno de análisis y no de una coincidencia superficial.\n\nLa implicación práctica es clara. En la descubrimiento de nuevos materiales, la confiabilidad de los sistemas de IA depende de que sus recomendaciones se basen en razonamientos verificables, no en memorias de datos pasados. Si un modelo sólo recita, los diseñadores de materiales podrían confiar en predicciones erróneas, lo que retrasaría proyectos críticos y erosionaría la confianza en la IA. Por ello, la comunidad necesita métricas que distingan la capacidad de inferir relaciones estructurales de la mera reproducción de texto.\n\nCARAT ofrece una hoja de ruta para evaluar esa distinción. Su diseño controlado, la separación explícita de relaciones estructurales y la posibilidad de bloquear afirmaciones no sustentadas constituyen herramientas valiosas para futuros estudios. La comunidad debería adoptar y extender este benchmark, incorporando variantes de dificultad y conjuntos de datos que reflejen la complejidad real de los problemas de materiales. Solo así se garantizará que los LLM sean verdaderos razonadores, capaces de transformar la investigación en ciencia de materiales y no simples repetidores de información.\n\nEn conclusión, el trabajo CARAT demuestra que, aunque los LLM de materiales pueden alcanzar altas exactitudes en tareas de descripción estructural, su capacidad para razonar de forma autónoma sigue siendo limitada. La brecha entre recitar y comprender se hace evidente a través de los resultados de precisión, los atajos identificados y la vulnerabilidad del modelo a la omisión de enlaces críticos. Para avanzar hacia sistemas de IA confiables en la ciencia de materiales, es imprescindible diseñar evaluaciones que midan no solo la exactitud final, sino también el proceso cognitivo subyacente que lleva al modelo a su respuesta.