# ¿Qué es RLHF?

> Reinforcement Learning from Human Feedback

Es un proceso de mejora que entrena la inteligencia artificial con retroalimentación humana.

## Definición
RLHF es cuando los humanos califican las respuestas dadas por la inteligencia artificial, lo que hace que el modelo sea más seguro y útil. Este proceso garantiza que el modelo no sólo tenga conocimiento sino que también se comporte de acuerdo con las preferencias humanas.

## Cómo funciona
Primero, el modelo produce diferentes respuestas. La gente clasifica estas respuestas de mejor a peor. Con esta retroalimentación, se entrena un modelo de recompensa y se afina el modelo principal de IA para obtener puntuaciones altas de este modelo de recompensa.

## Dónde se usa
Se aplica en la etapa final para que los chatbots como ChatGPT puedan hablar de forma natural y segura como los humanos.

## Suele confundirse con
No es sólo entrenamiento, es el proceso de alinear el comportamiento del modelo.

## Preguntas frecuentes
**¿Por qué es necesario?**
Porque los modelos entrenados únicamente con datos de Internet a veces pueden proporcionar información cruda o inexacta.

**¿La gente lo califica?**
Sí, la puntuación suele ser realizada por expertos capacitados o por un público amplio.


## Términos relacionados
- [Fine-tuning](/es/dictionary/fine-tuning/)
- [LLM](/es/dictionary/llm/)
- [AI Skills](/es/dictionary/ai-skills/)
- [Hallucination](/es/dictionary/hallucination/)

---
Fuente: TreScout Glosario · https://trescout.com/es/dictionary/rlhf/
