Reinforcement Learning from Human Feedback (RLHF)RLHF aligns models by using human feedback to train a reward model, then fine-tuning a large language model.