Lexikon

RLHF

Auch: Reinforcement Learning from Human Feedback, bestärkendes Lernen aus menschlichem Feedback

RLHF (Reinforcement Learning from Human Feedback) ist ein Trainingsverfahren, bei dem ein Sprachmodell anhand menschlicher Bewertungen lernt, bevorzugte Antworten zu geben.

von Benjamin Kaim Aktualisiert:

RLHF steht für Reinforcement Learning from Human Feedback. Dabei bewerten Menschen mehrere Beispielantworten eines Sprachmodells und bringen sie in eine Rangfolge. Durch bestärkendes Lernen bevorzugt das Modell anschließend Antworten, die den höher bewerteten ähneln. Laut Anthropic hilft das etwa dabei, dass ein Modell Anweisungen besser befolgt und sich eher wie ein hilfreicher Assistent verhält.

Bedeutung für KI-Sichtbarkeit

RLHF prägt, welche Art von Antworten KI-Assistenten als hilfreich einstufen: klar, ausgewogen und nachvollziehbar belegt. Inhalte, die diesen Eigenschaften entsprechen, lassen sich gut in Antworten übernehmen, siehe Zitierfähigkeit und Content für KI schreiben.

Häufige Fragen

Ist RLHF dasselbe wie Fine-Tuning?

RLHF ist eine besondere Form des Nachtrainings, bei der menschliche Bewertungen statt fester Beispieltexte die Richtung vorgeben.

Nutzen alle KI-Anbieter RLHF?

Viele Anbieter setzen RLHF oder verwandte Verfahren ein. Details zum Training sind oft nicht öffentlich.