RL-赵-(七)-不基于模型2-时序差分/TD算法00:时序差分(Temporal Difference)算法【增量式方法(MC是非增量式方法)】【表格形式】【TD是SA/RM算法的一个特殊情况】
2026/9/24 13:33:39 网站建设 项目流程



时序差分(Temporal Difference Learning)学习,这是强化学习(RL)中最著名的方法之一。

  • 蒙特卡罗(MC)学习是第一种无模型方法,是non-incremental(非增量式)的方法
  • 时序差分学习是第二种无模型方法,是incremental(增量式)的方法。
  • 相比于蒙特卡罗,时序差分具有一些优势。

实际上Temporal-Difference Learning 是Stochastic Approximation的一个特殊情况。

一、Motivating example: stochastic algorithms

首先,考虑一个简单的mean estimation问题

基于XXX的一些 iid (独立同分布)采样{ x}\{x\}{x},计算
w=E[X]w=\mathbb{E}[X]w=E[X]

求解过程(RM算法):

  • 将上式重写为g(w)=w−E[X]g(w)=w-\mathbb{E}[X]g(w)=wE[X],我们可以将问题reformulate为一个root-finding问题
    g(w)=0 g(w)=0g(w)=0
  • 因为我们仅能获得XXX中的一些采样{ x}\{x\}{x}, 那么观察到的噪声表示为
    g~(w,η)=w−x=(w−E[X])+(E[X]−x)≐g(w)+η \tilde{g}\left(w,\eta\right)=w-x=\left(w-\mathbb{E}[X]\right)+\left(\mathbb{E}[X]-x\right)\doteq g(w)+\etag~(w,η)=wx=(wE[X])+(E[X]x)g(w)+η
  • 根据之前的RM算法求解g(w)=0g(w)=0g(w)=0, 即
    wk+1 = wk − αk g~(wk,ηk)= wk − αk(wk − xk) w_{k+1}\:=\:w_{k}\:-\:\alpha_{k}\:\tilde{g}\left(w_{k},\eta_{k}\right)=\:w_{k}\:-\:\alpha_{k}\left(w_{k}\:-\:x_{k}\right)wk+1=wkα

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询