AI Algorithm

PPO 完整解析:从策略梯度到 LLM RLHF 训练全流程

从 REINFORCE 的高方差问题讲起,推导 PPO 的 clipped surrogate objective 和 GAE,再落到 LLM RLHF 里 Policy/Reference/Reward/Critic 四个模型如何协同工作,以及 KL 惩罚、reward hacking 等实践问题。