Anthropic ha publicado un estudio de interpretabilidad mecanística que revela cómo Claude construye representaciones internas de conceptos del mundo. Usando técnicas de sparse autoencoders a escala, los investigadores identificaron features que codifican conceptos como ciudades, relaciones causales y estados emocionales. El paper demuestra que estas representaciones son consistentes, composicionales y causalmente activas en la generación de respuestas.
Paper de Anthropic revela cómo Claude aprende representaciones internas del mundo
Nueva investigación de Anthropic muestra que Claude desarrolla modelos internos coherentes de conceptos abstractos durante el entrenamiento.
IAOnda Redaccion
jueves, 12 de marzo de 2026
Comentarios
Cargando comentarios...
Relacionados
GPT-6 Astra conquista el vuelo autónomo y los negocios sin supervisión humana
GPT-6 Astra de OpenAI supera al humano en drones autónomos y triplica beneficios frente a Claude Fable 5.1. El sistema rechaza acuerdos ilegales de precios, mostrando juicio normativo sin precedentes en IA.
MIT lanza SEAL: marco que permite a los LLM autocorregirse y actualizarse
MIT presentó SEAL, un marco que permite a los LLM autocorregirse y actualizar sus pesos con aprendizaje por refuerzo. Una revolución que impulsa IA autónoma y mejora su rendimiento sin intervención externa.
Nuevo marco multi-etapa revoluciona el razonamiento computacional
Un estudio de arXiv presenta un framework de encadenamiento de reglas que alcanza más del 95% de precisión en pruebas avanzadas. El sistema combina descubrimiento determinista, composición de patrones y abstracción estructural para lograr razonamiento composicional e interpretable.