AI & Mathematics

PPO 完整解析:從策略梯度到 LLM RLHF 訓練全流程

從 REINFORCE 的高變異數問題講起,推導 PPO 的 clipped surrogate objective 和 GAE,再落到 LLM RLHF 裡 Policy/Reference/Reward/Critic 四個模型如何協同工作,以及 KL 懲罰、reward hacking 等實踐問題。