目录
1. 强化学习基本概念
1.1 Agent
1.2 Environment
1.3 State
1.4 Action
1.5 Reward
2. 强化学习的随机性来源
2.1 Policy
2.2 State transition
3. 回报与价值函数
3.1 Return(aka cumulative future reward)
3.1.1 Return(未来累计奖励)
3.1.2 Discounted Return(折扣回报)
3.2 Action-value function
3.3 State-value function
4. 强化学习目标
4.1 policy-based learning
4.2 value-based learning
1. 强化学习基本概念
1.1 Agent
执行动作、和环境交互的主体。
1.2 Environment
Agent外部世界,接收动作,返回新状态与奖励。
1.3 State![]()
环境当前观测到的信息。
1.4 Action![]()
Agent在状态下做出的动作。
1.5 Reward![]()
环境给予的反馈。
2. 强化学习的随机性来源
2.1 Policy![]()
策略函数,给定状态
,计算动作
的概率,根据概率随机抽样使Agent做动作
。具体来说,就是根据观测到的状态做出决策来控制Agent运动。
2.2 State transition![]()
环境用状态转移函数算出概率,根据概率随机抽样得到下一个状态
。
3. 回报与价值函数
3.1 Return(aka cumulative future reward)
3.1.1 Return(未来累计奖励)
t 时刻的回报,从 t 时刻的奖励开始一直加到结束。
t 时刻,我们更关注的是此刻的奖励,因此 t 时刻以后的奖励的权重应降低,由此引出Discounted Return。
3.1.2 Discounted Return(折扣回报)
t 时刻的折扣回报
:折扣率,
,超参数,人工手动调
若未来的奖励和此刻的奖励同样重要,则;若未来的奖励不重要,则
可以小些。
3.2 Action-value function
是随机变量,依赖于未来的所有动作
,以及未来的所有状态
只与当前的状态
和动作
以及policy函数
有关。
具体来说,已知policy函数,
给当前状态下所有的动作
打分,从而得知动作的好坏
3.3 State-value function
对关于动作
求期望把
消掉,得到的
只与
和状态
有关。
4. 强化学习目标
强化学习的目标就是学习到policy函数或最优动作价值函数去控制Agent,让Agent基于当前的状态
来做出相应的动作
,争取在未来得到尽量多的奖励。
4.1 policy-based learning
策略学习:利用policy函数,根据状态
,计算动作
的概率,根据概率随机抽样使Agent做动作
。
观测到一个状态,把
作为policy函数
的输入,函数输出每一个动作的概率,根据概率随机抽样得到动作
,Agent执行动作
。
4.2 value-based learning
价值学习:利用最优动作价值函数函数,根据状态
,计算
,根据
使Agent做动作
。
观测到一个状态,把
作为
的输入,函数每一个动作做评价,得到每一个动作的
值,选择让
最大化的动作
作为下一个动作
,Agent执行动作
。