Anthropic ha publicado un estudio de interpretabilidad mecanística que revela cómo Claude construye representaciones internas de conceptos del mundo. Usando técnicas de sparse autoencoders a escala, los investigadores identificaron features que codifican conceptos como ciudades, relaciones causales y estados emocionales. El paper demuestra que estas representaciones son consistentes, composicionales y causalmente activas en la generación de respuestas.