Concept 18 of 19
debatedReinforcement learning from human feedback
Teach the model what humans prefer, then optimise for that.
Definition
A training procedure that fine tunes a language model with reinforcement learning against a reward model learned from human preference data.
Step 1