AI & Mathematics

隨機過程 15:隨機微分方程

從確定性微分方程走向含譟動力系統,理解 drift、diffusion、Itô 積分與隨機微分方程。

AI & Mathematics

隨機過程 14:遍歷性

比較 ensemble average 與 time average,理解何時一條足夠長的樣本路徑能夠代表整體機率分佈。

AI & Mathematics

隨機過程 13:鞅

從濾過和條件期望出發,理解鞅的公平遊戲直覺、停止思想及其在機率論中的作用。

AI & Mathematics

隨機過程 12:高斯過程

通過有限維高斯分佈、平均值函數和共變異數核,理解高斯過程如何描述函數上的機率分佈。

AI & Mathematics

隨機過程 11:布朗運動

從縮放後的隨機遊走出發,理解布朗運動的獨立增量、連續路徑和高斯結構。

AI & Mathematics

隨機過程 10:更新過程

將泊松過程推廣到任意非負到達間隔,理解更新計數、更新函數和長期更新率。

AI & Mathematics

隨機過程 9:泊松過程

從計數過程、獨立增量和指數等待時間出發,理解泊松過程描述隨機事件到達的方式。

AI & Mathematics

隨機過程 7:隨機遊走

從一維簡單隨機遊走出發,理解隨機增量如何累積,以及擴散、復現性與布朗運動之間的聯繫。

AI & Mathematics

隨機過程 5:馬爾可夫過程

解釋馬爾可夫性質的條件獨立含義,以及狀態設計為什麼決定一個過程能否被視為馬爾可夫過程。

AI & Mathematics

隨機過程 3:平穩性

理解隨機過程中的嚴格平穩、弱平穩和平穩增量,以及統計規律隨時間保持不變的真正含義。

AI & Mathematics

PPO 完整解析:從策略梯度到 LLM RLHF 訓練全流程

從 REINFORCE 的高變異數問題講起,推導 PPO 的 clipped surrogate objective 和 GAE,再落到 LLM RLHF 裡 Policy/Reference/Reward/Critic 四個模型如何協同工作,以及 KL 懲罰、reward hacking 等實踐問題。