☰
RL-算法演进史02:Value-Based算法演进路线【Dynamic Programming→Monte Carlo→TD→Q−Learning→SARSA→DQN→Double DQN】
2026/10/1 12:37:18 网站建设 项目流程

第二章 Value-Based强化学习算法演进路线

重点分析:

  1. Dynamic Programming
  2. Monte Carlo
  3. Temporal Difference Learning
  4. Q-Learning
  5. SARSA
  6. DQN
  7. Double DQN
  8. Dueling DQN
  9. Prioritized Experience Replay
  10. Rainbow DQN

并详细展开每个算法:

  • 产生背景;
  • 核心思想;
  • 数学公式;
  • Loss;
  • Mermaid结构图;
  • 经典论文;
  • 优点;
  • 缺点;
  • 后续演进方向。

2.1 Value-Based方法整体思想

在强化学习发展早期,研究者首先思考一个问题:

如果我们知道每个状态、每个动作未来能够获得多少收益,那么是不是就可以选择价值最高的动作?

于是产生了Value-Based方法。

Value-Based方法的核心思想是:

不直接学习动作,而是学习价值函数(Value Function),然后根据

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询