AI & Mathematics
World Models(Ha & Schmidhuber, 2018)完整總結
系統梳理 World Models 的 VAE、MDN-RNN 與 Controller 三個模組,以及智慧體在內部世界模型中學習策略的完整流程。
AI & Mathematics
PPO 完整解析:從策略梯度到 LLM RLHF 訓練全流程
從 REINFORCE 的高變異數問題講起,推導 PPO 的 clipped surrogate objective 和 GAE,再落到 LLM RLHF 裡 Policy/Reference/Reward/Critic 四個模型如何協同工作,以及 KL 懲罰、reward hacking 等實踐問題。