← Glossar
Glossar · AI

Was ist RLHF?

Reinforcement Learning from Human Feedback

Es handelt sich um einen Verbesserungsprozess, der künstliche Intelligenz mit menschlichem Feedback trainiert.

Definition

Bei RLHF werden die von künstlicher Intelligenz gegebenen Antworten von Menschen bewertet, wodurch das Modell sicherer und hilfreicher wird. Dieser Prozess stellt sicher, dass das Modell nicht nur über Kenntnisse verfügt, sondern sich auch entsprechend den menschlichen Vorlieben verhält.

Analogie: Es ist, als würde man einem Praktikanten den Job beibringen. Der Praktikant bereitet einen Bericht vor, und Sie schulen ihn, indem Sie sagen: „Dieser Teil ist sehr gut, aber ändern Sie den Ton.“ Mit der Zeit lernt der Praktikant, was Ihnen gefällt.

So funktioniert es

Erstens erzeugt das Modell unterschiedliche Reaktionen. Die Leute ordnen diese Antworten vom besten zum schlechtesten. Mit diesem Feedback wird ein Belohnungsmodell trainiert und das Haupt-KI-Modell feinabgestimmt, um mit diesem Belohnungsmodell hohe Punktzahlen zu erzielen.

Wo es eingesetzt wird

Es wird im Endstadium angewendet, damit Chatbots wie ChatGPT natürlich und sicher wie Menschen sprechen können.

Häufig verwechselt mit

Dabei handelt es sich nicht nur um Training, sondern um den Prozess der Anpassung des Verhaltens des Modells.

Häufige Fragen

Warum ist es notwendig?

Denn Modelle, die nur mit Internetdaten trainiert wurden, können manchmal grobe oder ungenaue Informationen liefern.

Bewerten die Leute es?

Ja, die Bewertung erfolgt in der Regel durch geschulte Experten oder ein breites Publikum.

Verwandte Begriffe

Diese Erklärung wurde für TreScout in einfacher Sprache verfasst und maschinell übersetzt aus dem türkischen Original · maßgeblich ist die türkische Fassung. Wenn etwas falsch oder unvollständig wirkt, schreiben Sie an hello@trescout.com. Auf Türkisch lesen →