Verificacion Latente de Intencion: Nueva Defensa contra Camuflaje Semantico
Los modelos de IA pueden ser enganados con ataques de camuflaje semantico que esconden intenciones nocivas. Un nuevo metodo de verificacion de intencion latente detecta un 'horizonte de intencion' en las primeras capas, ofreciendo defensa sin necesidad de reentrenamiento.
5 min lectura2semIAOnda Redaccion