La alineación rota: cuando enseñamos a la IA a 'hacer trampa' y luego la culpamos
Los sistemas de IA optimizan lo que les pedimos, no lo que queremos. El 'reward hacking' expone que el fallo no está en el modelo, sino en nuestras métricas mal diseñadas.
6 min lectura12semIAOnda Redaccion