¿Qué es RLHF?
Reinforcement Learning from Human Feedback
Es un proceso de mejora que entrena la inteligencia artificial con retroalimentación humana.
Definición
RLHF es cuando los humanos califican las respuestas dadas por la inteligencia artificial, lo que hace que el modelo sea más seguro y útil. Este proceso garantiza que el modelo no sólo tenga conocimiento sino que también se comporte de acuerdo con las preferencias humanas.
Cómo funciona
Primero, el modelo produce diferentes respuestas. La gente clasifica estas respuestas de mejor a peor. Con esta retroalimentación, se entrena un modelo de recompensa y se afina el modelo principal de IA para obtener puntuaciones altas de este modelo de recompensa.
Dónde se usa
Se aplica en la etapa final para que los chatbots como ChatGPT puedan hablar de forma natural y segura como los humanos.
Suele confundirse con
No es sólo entrenamiento, es el proceso de alinear el comportamiento del modelo.
Preguntas frecuentes
¿Por qué es necesario?
Porque los modelos entrenados únicamente con datos de Internet a veces pueden proporcionar información cruda o inexacta.
¿La gente lo califica?
Sí, la puntuación suele ser realizada por expertos capacitados o por un público amplio.
Términos relacionados
Esta explicación se redactó en lenguaje sencillo para TreScout y se tradujo automáticamente del original en turco · prevalece la versión turca. Si algo le parece erróneo o incompleto, escriba a hello@trescout.com. Leer en turco →