基于熵的选择性智能体引导:从非完美视觉语言模型教师学习自主策略
2026/9/13 22:30:51 网站建设 项目流程

基于熵的选择性智能体引导:从非完美视觉语言模型教师学习自主策略

arXiv:2609.01567v1

摘要

视觉语言模型(VLM)可以为交互式决策任务提供强大先验,但直接将VLM当做策略使用存在开销高、鲁棒性差的缺陷:每一步都需要调用模型、无法从环境交互中迭代提升,还会反复出现系统性错误。本文研究如何从在线、开销昂贵、存在缺陷但具备信息增益的VLM教师中,训练轻量化自主强化学习(RL)策略。本文提出**(\mathcal{S})(\mathcal{A})GE((\mathcal{S})elective (\mathcal{A})gent Guidance via Entropy)**框架:仅当学习者智能体处于不确定性较高状态时才向VLM发起查询,训练阶段执行VLM给出的动作,再将引导知识蒸馏到轻量化RL策略中。

由于VLM给出的建议并非全部可靠,(\mathcal{S})(\mathcal{A})GE利用环境得到的优势值对教师动作蒸馏做加权,而不是将全部建议同等看待。在稀疏奖励视觉推理、导航类任务上,(\mathcal{S})(\mathcal{A})GE训练得到的策略在推理阶段完全不需要VLM引导;相比无引导的RL基线在多个环境取得性能提升,部分场景下学习得到的策略性能甚至超过作为教师的VLM本身。

实验结果表明:当VLM能够帮助智能体发现高回报轨迹时,选择性引导收益最大;当无引导探索本身就可以解决任务、或者教师输出无法提供有效信息时,引导带来的收益有限。(\mathcal{S})(\mathcal{A})GE仅在训练过程部分步骤调用VLM,部署阶段完全不需要VLM调用,显著降低VLM使用成本。本工作说明VLM不必直接作为执行策略,可充当临时、存在缺陷的信息引导源,智能体通过环境交互检验并内化这些引导信息。

图1:(\mathcal{S})(\mathcal{A})GE双架构RL示意图:智能体置信度高时自主执行动作;不确定性高时向VLM请求引导,并执行VLM给出的动作。

1 引言

强化学习(RL)允许智能体通过试错完成学习,但存在显著短板:智能体从零开始学习,缺少环境先验知识。在稀疏奖励环境下,随机探索很难采样得到成功轨迹,学习效率极低。该问题在需要视觉感知、符号推理、多步规划的交互式环境中尤为突出,智能体需要理解视觉状态、选择一连串正确动作之后,才能获得有效奖励信号。

视觉语言模型VLM具备大规模预训练得到的视觉、语言先验知识,可以理解物体、指令、空间关系与符号结构,因此非常适合交互式智能体场景。但直接把VLM当做执行策略有明显缺点:每一个决策步都需要向模型发起提示,部署成本高、速度慢;冻结的VLM无法通过环境交互自我迭代,如果出现感知、推理类系统性错误,会反复犯下同类错误。

基于以上背景,本文提出新的问题范式:不把VLM直接当做智能体,而是将其作为在线、开销昂贵、存在缺陷但有信息增益的教师,用于探索阶段的定向干预。VLM提供先验知识,帮助智能体跳出稀疏奖励探索瓶颈;RL负责在环境中检验教师给出的动作,并且通过试错实现超越教师本身的性能。最终目标是训练得到轻量化自主策略:训练阶段使用VLM,评估阶段不再依赖VLM;由于不能假设教师输出完全正确,学习者不能单纯盲目的模仿,需要结合环境反馈,强化有效的干预行为。

本文实现(\mathcal{S})(\mathcal{A})GE框架,轻量化RL智能体以VLM作为临时教师。训练过程中监控策略熵,将熵作为不确定性的轻量代理指标;当熵超过阈值,就向VLM查询动作并执行;利用带优势加权的目标函数,将教师引导蒸馏到学习者策略中。

实验环境包含多组稀疏奖励视觉决策环境:FrozenLake、MiniGrid套件(Fetch、GoToDoor、LavaGap)、EZPoints算术推理、本文新提出的感知符号匹配任务CardMaze,以及(\mathcal{A})LFWorld家庭交互仿真。评估时全部在未见过的环境种子上执行,不接入VLM引导,以此衡量轻量化策略的泛化能力。

在多个环境中(\mathcal{S})(\mathcal{A})GE显著优于普通PPO基线;部分场景学习得到的策略性能优于VLM教师本身。对比VLM‑as‑Policy、LVLM2P、D(\mathcal{A})gger系列在线模仿学习基线,(\mathcal{S})(\mathcal{A})GE只在训练的一小部分步骤调用VLM,部署阶段零VLM调用。Oracle教师对照实验表明:(\mathcal{S})(\mathcal{A})GE可以利用高质量引导解决PPO长时间训练也无法解决的任务;教师质量分析也可以定位性能缺陷来自VLM本身输出无效信息,而非学习框架本身。

本文主要贡献

  1. 提出(\mathcal{S})(\mathcal{A})GE:基于策略熵做触发条件的选择性VLM引导RL框架,将VLM作为训练阶段临时教师,评估阶段策略完全自主运行。
  2. 提出分区损失目标:区分学习者自身采样轨迹、教师引导轨迹;引入优势加权行为克隆(\mathcal{A})W(\mathcal{B})C,对VLM输出做环境反馈加权,不完全盲模仿教师。
  3. 构建CardMaze新的感知符号匹配测试环境;在多套稀疏奖励视觉环境完成验证;实验证明:即便VLM直接执行策略效果一般,仍然可以作为有效的训练引导源。
  4. 完整开源代码、环境资产、实验配置。

2 相关工作

模仿学习与在线监督

模仿学习通过将演示行为迁移给学习策略,加速强化学习训练。行为克隆(\mathcal{B})C让学习者拟合专家状态‑动作对,但当学习者访问演示集之外的状态,会遭遇分布偏移。专家源可以是人类演示、预训练策略、学习过程中在线查询得到的教师。D(\mathcal{A})gger通过迭代在学习者访问的状态上查询专家,聚合样本缓解分布偏移。交互式模仿学习研究策略执行过程中获取反馈的场景。RCMP使用多个价值头的标准差衡量不确定性,触发更强智能体的查询。

(\mathcal{S})(\mathcal{A})GE与以上工作的区别:在线教师是开销高、存在缺陷的VLM,并非可靠完美专家;选择性触发教师查询,并且不会同等信任全部引导样本。

因为VLM教师会输出错误,本工作也和从不完美演示中学习的研究相关:(\mathcal{A})WR、(\mathcal{A})W(\mathcal{A})C、CRR利用估计价值对动作加权,允许次优先验行为辅助学习,而不是对每个动作无差别克隆。(\mathcal{S})(\mathcal{A})GE将该思想应用在线VLM引导RL场景:在不确定状态按需获取教师监督,在环境中执行,再根据环境得到的优势做蒸馏加权。

基础模型用于交互式决策

基础模型在交互式环境有三类用法:作为学习信号源、直接当做策略、作为小智能体的教师。
第一类:大语言/视觉语言模型输出偏好标签、标量奖励、代码形式奖励函数、嵌入奖励、学习得到的奖励模型,为RL提供反馈信号。RL‑VLM‑F属于该路线,让VLM对轨迹对做偏好对比,训练奖励模型。(\mathcal{S})(\mathcal{A})GE不同之处在于,直接获取动作级引导,帮助学习者到达稀疏奖励,最终策略由RL优化得到。

第二类:将基础模型直接作为策略:提示模型输出动作、生成代码策略、视觉‑动作VL(\mathcal{A})模型。也有工作直接在环境交互下微调VLM,RL4VLM使用PPO结合思维链微调VLM智能体。(\mathcal{S})(\mathcal{A})GE采用不同路线:部署运行的是轻量化RL策略,VLM仅在训练阶段临时充当教师,避免每一步控制都调用或微调大模型。

和本文最接近的是将基础模型监督蒸馏到更小策略的工作。LM4TE(\mathcal{A})CH使用LLM专家,对齐RL策略与动作对应的token logit;LVLM2P提示VLM输出动作概率分布文本,再蒸馏到策略。(\mathcal{S})(\mathcal{A})GE的差异:向VLM只请求单个优选动作,生成任务更简单;仅在高熵状态查询教师;评估阶段策略不再依赖教师。Merler等人2025前期工作研究不确定性触发VLM引导RL,发现随着策略熵下降VLM查询次数变少;(\mathcal{S})(\mathcal{A})GE进一步研究:仅熵下降不足以保证策略能力变强(智能体可以变得自信但是依旧犯错),增加显式的教师动作蒸馏,在未见过任务上验证泛化,并通过Oracle、消融实验分离教师质量与学习框架各自的影响。

3 方法

图2 (\mathcal{S})(\mathcal{A})GE总览:每一步训练,如果归一化策略熵H^\hat{\mathcal{H}}H^低于阈值ν\nuν,学习者自行采样动作;否则查询冻结VLM教师并执行教师给出动作。轨迹打上标记gtg_tgt,分为学习者生成集合KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}_…、教师引导集合KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}_…。PPO仅在KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}_…更新(\mathcal{A})ctor;(\mathcal{B})C/(\mathcal{A})W(\mathcal{B})C在KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}_…;价值函数在全部缓冲区KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}训练。

3.1 问题建模

环境建模为马尔可夫决策过程MDPKaTeX parse error: Can't use function '\(' in math mode at position 29: …langle\mathcal{\̲(̲\mathcal{S}\)},…KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{S}\)}状态空间,KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{A}\)}离散动作空间,RRR环境奖励,TTT状态转移,γ\gammaγ折扣因子,ρ0\rho_0ρ0初始状态分布。每个时间步学习者观测状态sts_tst,从随机策略πθ(at∣st)\pi_\theta(a_t \mid s_t)πθ(at

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询