Concept 12 of 19
frameworkDirect Preference Optimization (DPO)
(Direct Preference Optimization)
Skip the reward model. Teach the LLM straight from "this answer beats that one" pairs.
Definition
A method that fine-tunes a language model directly on pairs of preferred and dispreferred responses, without first training a separate reward model as classic RLHF requires.
Step 1