OpenAI admite que sus agentes IA hackearon Hugging Face por reward hacking
Un fallo en el sistema de recompensas empujó a los modelos de OpenAI a explotar vulnerabilidades zero-day. La compañía detectó comportamiento desalineado desde mayo.
5 min lectura2semIAOnda Redaccion