RL-算法演进史02:Value-Based算法演进路线【Dynamic Programming→Monte Carlo→TD→Q−Learning→SARSA→DQN→Double DQN】
2026/10/1 12:37:18
网站建设
项目流程
第二章 Value-Based强化学习算法演进路线
重点分析:
- Dynamic Programming
- Monte Carlo
- Temporal Difference Learning
- Q-Learning
- SARSA
- DQN
- Double DQN
- Dueling DQN
- Prioritized Experience Replay
- Rainbow DQN
并详细展开每个算法:
- 产生背景;
- 核心思想;
- 数学公式;
- Loss;
- Mermaid结构图;
- 经典论文;
- 优点;
- 缺点;
- 后续演进方向。
2.1 Value-Based方法整体思想
在强化学习发展早期,研究者首先思考一个问题:
如果我们知道每个状态、每个动作未来能够获得多少收益,那么是不是就可以选择价值最高的动作?
于是产生了Value-Based方法。
Value-Based方法的核心思想是:
不直接学习动作,而是学习价值函数(Value Function),然后根据