AI Algorithm
PPO 完整解析:从策略梯度到 LLM RLHF 训练全流程
从 REINFORCE 的高方差问题讲起,推导 PPO 的 clipped surrogate objective 和 GAE,再落到 LLM RLHF 里 Policy/Reference/Reward/Critic 四个模型如何协同工作,以及 KL 惩罚、reward hacking 等实践问题。
AI Algorithm
World Models(Ha & Schmidhuber, 2018)完整总结
系统梳理 World Models 的 VAE、MDN-RNN 与 Controller 三个模块,以及智能体在内部世界模型中学习策略的完整流程。