Cómo evitar que el RLHF convierta tus sesgos en funciones del modelo
El aprendizaje por refuerzo con retroalimentación humana (RLHF) replica fielmente las preferencias de los anotadores, pero sin distinguir entre precisión y sesgo. Descubre los seis pasos críticos para impedir que esos prejuicios se conviertan en características del modelo.
5 min lectura9semIAOnda Redaccion