AI & Algorithms
隨機過程 15:隨機微分方程
從確定性微分方程走向含噪動力系統,理解 drift、diffusion 與 Itô 積分,並用 Ornstein–Uhlenbeck 過程與幾何布朗運動具體算出解析解。
AI & Algorithms
隨機過程 8:首次到達時間與停止時間
區分 hitting time、first passage time 與 stopping time,並用賭徒破產問題具體算出平均要玩多少局才會結束。
AI & Algorithms
機率與統計 4:卡方分佈、t 分佈與 F 分佈
從標準常態推導卡方、t 與 F 分佈,說明樣本變異數的抽樣分佈,並用 t 分佈建立平均值的信賴區間、用 F 分佈比較兩組變異數。
AI & Algorithms
機率與統計 3:統計估計、不等式與極限定理
從隨機樣本與常用統計量出發,推導矩估計、最大概似估計、偏差與均方誤差,再用 Markov 與 Chebyshev 不等式理解大數定律、中心極限定理和標準誤。
AI & Algorithms
機率與統計 2:常見分佈、多維隨機變數與相關性
比較 Bernoulli、Binomial、Poisson、Uniform、Exponential 與 Normal 分佈,並用聯合、邊緣與條件分佈建立共變異數、相關係數及共變異數矩陣。
AI & Algorithms
Attention Is All You Need:Transformer 架構完整拆解
拆解原始 Transformer 論文的 scaled dot-product attention、multi-head attention、encoder/decoder 區塊、殘差與 Layer Normalization、位置編碼與訓練方式,並區分 2017 年原始論文與現代 decoder-only LLM 在架構細節上的實際差異。
AI & Algorithms
World Models(Ha & Schmidhuber, 2018)完整總結
系統梳理 World Models 的 VAE、MDN-RNN 與 Controller 三個模組,以及智慧體在內部世界模型中學習策略的完整流程。
AI & Algorithms
PPO 完整解析:從策略梯度到 LLM RLHF 訓練全流程
從 REINFORCE 的高變異數問題講起,推導 PPO 的 clipped surrogate objective 和 GAE,再落到 LLM RLHF 裡 Policy/Reference/Reward/Critic 四個模型如何協同工作,以及 KL 懲罰、reward hacking 等實踐問題。