强化学习基础知识
2026/8/16 8:22:25 网站建设 项目流程

目录

1. 强化学习基本概念

1.1 Agent

1.2 Environment

1.3 State

1.4 Action

1.5 Reward

2. 强化学习的随机性来源

2.1 Policy

2.2 State transition

3. 回报与价值函数

3.1 Return(aka cumulative future reward)

3.1.1 Return(未来累计奖励)

3.1.2 Discounted Return(折扣回报)

3.2 Action-value function

3.3 State-value function

4. 强化学习目标

4.1 policy-based learning

4.2 value-based learning


1. 强化学习基本概念

1.1 Agent

执行动作、和环境交互的主体。

1.2 Environment

Agent外部世界,接收动作,返回新状态与奖励。

1.3 State

环境当前观测到的信息。

1.4 Action

Agent在状态下做出的动作。

1.5 Reward

环境给予的反馈。

2. 强化学习的随机性来源

2.1 Policy

策略函数,给定状态,计算动作的概率,根据概率随机抽样使Agent做动作。具体来说,就是根据观测到的状态做出决策来控制Agent运动。

2.2 State transition

环境用状态转移函数算出概率,根据概率随机抽样得到下一个状态

3. 回报与价值函数

3.1 Return(aka cumulative future reward)

3.1.1 Return(未来累计奖励)

t 时刻的回报,从 t 时刻的奖励开始一直加到结束。

t 时刻,我们更关注的是此刻的奖励,因此 t 时刻以后的奖励的权重应降低,由此引出Discounted Return。

3.1.2 Discounted Return(折扣回报)

t 时刻的折扣回报

:折扣率,,超参数,人工手动调

若未来的奖励和此刻的奖励同样重要,则;若未来的奖励不重要,则可以小些。

3.2 Action-value function

是随机变量,依赖于未来的所有动作,以及未来的所有状态

只与当前的状态和动作以及policy函数有关。

具体来说,已知policy函数给当前状态下所有的动作打分,从而得知动作的好坏

3.3 State-value function

关于动作求期望把消掉,得到的只与和状态有关。

4. 强化学习目标

强化学习的目标就是学习到policy函数或最优动作价值函数去控制Agent,让Agent基于当前的状态来做出相应的动作,争取在未来得到尽量多的奖励。

4.1 policy-based learning

策略学习:利用policy函数,根据状态,计算动作的概率,根据概率随机抽样使Agent做动作

观测到一个状态,把作为policy函数的输入,函数输出每一个动作的概率,根据概率随机抽样得到动作,Agent执行动作

4.2 value-based learning

价值学习:利用最优动作价值函数函数,根据状态,计算,根据使Agent做动作

观测到一个状态,把作为的输入,函数每一个动作做评价,得到每一个动作的值,选择让最大化的动作作为下一个动作,Agent执行动作

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询