这是《强化学习的数学原理》的个人学习笔记仓库,内容围绕全书 10 章展开,包含章节切片、逐章讲解、补充推导和二轮复习总结。
- 全书地图与问题链:从全局问题链理解 10 章之间的关系。
- 概念对比表:集中对比容易混淆的概念、算法和符号。
- 证明推导索引:按证明、引理和关键推导查找细节。
- 易错点与统一符号表:复习符号体系和常见误区。
.
├── _tutor/
│ ├── manifest.json # 原书目录、页码和章节元数据
│ ├── sections/ # 按小节切分的原始学习材料
│ ├── notes/ # 逐章笔记与专题补充
│ ├── pages/ # 重点页或图表截图
│ └── 二轮总结/
│ ├── 00_全书地图与问题链.md
│ ├── 01_概念对比表.md
│ ├── 02_证明推导索引.md
│ ├── 03_易错点与统一符号表.md
│ ├── 04_二刷问题清单.md
│ └── 章节地图/ # 每章一张 HTML 章节地图
├── images/ # 原始图片资源
└── raw/ # 原始导入材料
- 先读 00_全书地图与问题链,建立“从 MDP 到 Actor-Critic”的主线。
- 复习某一章时,先打开
_tutor/二轮总结/章节地图/chXX.html看该章内部结构。 - 卡在概念或推导时,再进入
_tutor/notes/中对应章节笔记和 supplement 文件。
全书可以理解为在不断放松“模型已知、状态有限、完整回报可得、策略可枚举”等假设:
| 章节 | 主题 |
|---|---|
| Ch1 | 基本概念与 MDP |
| Ch2 | 状态值与贝尔曼方程 |
| Ch3 | 最优策略与贝尔曼最优方程 |
| Ch4 | 值迭代、策略迭代与动态规划 |
| Ch5 | 蒙特卡洛方法 |
| Ch6 | 随机近似与 SGD |
| Ch7 | 时序差分方法 |
| Ch8 | 值函数近似与 DQN |
| Ch9 | 策略梯度 |
| Ch10 | Actor-Critic 方法 |
这个仓库适合用 Obsidian、VS Code 或普通 Markdown 阅读器打开。部分二轮总结包含 Mermaid 图,建议使用支持 Mermaid 的 Markdown 预览工具查看。