← Glosario
Glosario · AI

¿Qué es RLHF?

Reinforcement Learning from Human Feedback

Es un proceso de mejora que entrena la inteligencia artificial con retroalimentación humana.

Definición

RLHF es cuando los humanos califican las respuestas dadas por la inteligencia artificial, lo que hace que el modelo sea más seguro y útil. Este proceso garantiza que el modelo no sólo tenga conocimiento sino que también se comporte de acuerdo con las preferencias humanas.

Analogía: Es como enseñarle el trabajo a un pasante. El pasante prepara un informe y lo capacitas diciéndole 'esta parte es muy buena, pero cambia ese tono'. Con el tiempo, el pasante aprende lo que le gusta.

Cómo funciona

Primero, el modelo produce diferentes respuestas. La gente clasifica estas respuestas de mejor a peor. Con esta retroalimentación, se entrena un modelo de recompensa y se afina el modelo principal de IA para obtener puntuaciones altas de este modelo de recompensa.

Dónde se usa

Se aplica en la etapa final para que los chatbots como ChatGPT puedan hablar de forma natural y segura como los humanos.

Suele confundirse con

No es sólo entrenamiento, es el proceso de alinear el comportamiento del modelo.

Preguntas frecuentes

¿Por qué es necesario?

Porque los modelos entrenados únicamente con datos de Internet a veces pueden proporcionar información cruda o inexacta.

¿La gente lo califica?

Sí, la puntuación suele ser realizada por expertos capacitados o por un público amplio.

Términos relacionados

Esta explicación se redactó en lenguaje sencillo para TreScout y se tradujo automáticamente del original en turco · prevalece la versión turca. Si algo le parece erróneo o incompleto, escriba a hello@trescout.com. Leer en turco →