孤本网
/ 0 阅读
0

记忆状态批判器革新非对称 actor-critic 算法,视觉追逃任务中性能超越历史状态基线

一句话结论

研究提出记忆状态批判器,通过直接利用策略内部记忆实现无偏策略梯度,在视觉追逃任务中实现比历史状态批判器更快的收敛与更高性能。

关键要点

  • 该批判器基于策略自身的内部记忆条件化,无需额外的历史递归近似器即可保证策略梯度的无偏性
  • 在四旋翼视觉追逃环境中,记忆状态批判器在两种竞技场类型中均优于历史状态批判器
  • 即使记忆是历史的有损编码,基于策略记忆的批判器也无需将其损失反向传播至该记忆中
  • 在墙壁竞技场中,由于演员历史携带特权状态无法涵盖的信息,记忆状态批判器仍保持微弱优势
  • 研究提交于 2026 年 10 月 2 日,发表于 arXiv 机器学习领域,实验涉及四旋翼飞行器之间的视觉追踪与规避

背景与事实

部分可观测马尔可夫决策过程(partially observable Markov decision processes, POMDPs)中,最优策略通常依赖于观测历史和过往行动。当训练期间可获取额外信息(如环境真实状态)时,非对称 actor-critic 方法已成为学习此类策略的主流路径。传统做法中,执行阶段不需要的批判器(critic)可访问完整状态;但仅以状态为条件的批判器通常定义不良,会产生有偏的策略梯度。此前的解决方案是状态 - 历史批判器(history-state critic),即同时以状态和完整历史为条件,从而恢复定义的良定性并保证梯度无偏。然而,这种方法要求维护第二个递归近似器来编码历史,增加了计算与实现复杂度。

本研究发现,若批判器以策略自身的内部记忆为条件——即策略通过内部表示处理历史并据此选择行动的方式——则该批判器已具备良定性并能提供无偏策略梯度,从根本上免除第二个历史递归近似器的需求。研究者将其命名为记忆状态批判器(memory-state critic)。一个关键推论是,即使策略记忆是对历史的有损编码,基于该记忆的批判器也无需将损失反向传播到记忆模块中,这一特性显著降低了优化路径的复杂度。

实验在四旋翼飞行器之间的视觉追逃环境中进行,涵盖两种竞技场类型。追踪者(pursuer)是学习智能体,逃逸者(evader)在每个回合(episode)开始时从固定的启发式行为池中随机采样。结果表明,记忆状态批判器在两种竞技场中均优于历史状态批判器,且收敛速度更快。在墙壁竞技场中,由于追踪者的历史携带了特权状态本身无法涵盖的信息,记忆状态批判器相较于状态 - 仅批判器仍保持微弱但一致的优势,验证了其在信息不对称场景下的鲁棒性。

影响分析

对于中文机器人控制与强化学习开发者而言,该研究提供了降低 POMDP 算法实现复杂度的实用路径。传统非对称 actor-critic 架构中维护独立历史近似器的额外开销(参数量、内存占用与训练稳定性风险)可被直接消除,这对资源受限的边缘部署场景具有实际意义。分析判断认为,该方案尤其适合视觉 - 导航类任务,其中智能体需从图像流中提取历史信息,而记忆状态批判器允许直接复用 actor 中已存在的递归状态,避免重复编码。

需要强调的是,此结论基于特定实验设置:四旋翼追逃任务、固定启发式对手池、两种竞技场类型。若对手行为分布发生显著偏移,或任务观测维度大幅增加,记忆状态批判器相对历史状态批判器的优势幅度可能变化。此外,"无需反向传播损失至记忆"这一特性依赖策略内部记忆的结构设计,若 actor 使用非递归架构或显式记忆模块,该简化可能不适用。

适用边界

该结论不适用于以下场景:一是策略本身不使用内部记忆处理历史(如完全基于当前观测的架构),此时不存在可条件化的记忆状态;二是任务中特权状态本身已完全可观测历史相关信息时,记忆状态批判器相对历史状态批判器的优势将缩小甚至消失;三是当记忆模块本身存在严重信息瓶颈或设计缺陷时,"有损编码"可能导致无偏性保证在极端条件下失效。此外,实验仅涉及四旋翼追踪单一对手且对手从固定池采样,未验证多智能体对抗、对手在线学习或动态对手分布下的表现。

孤本观察

本研究将"策略记忆"从 actor 的中间产物提升为 critic 的一等条件输入,这一视角转换具有方法论意义。编辑判断认为,其核心价值不在于性能数字本身,而在于揭示了非对称 critic 设计中一个此前被忽视的充分条件:只要 critic 条件化的信息足以重构策略决策所需的完整信息,无偏性即可保证,而无需显式历史。

记忆状态批判器革新非对称 actor-critic 算法,视觉追逃任务中性能超越历史状态基线

记忆状态批判器革新非对称 actor-critic 算法,视觉追逃任务中性能超越历史状态基线

记忆状态批判器革新非对称 actor-critic 算法,视觉追逃任务中性能超越历史状态基线

记忆状态批判器革新非对称 actor-critic 算法,视觉追逃任务中性能超越历史状态基线

记忆状态批判器革新非对称 actor-critic 算法,视觉追逃任务中性能超越历史状态基线

记忆状态批判器革新非对称 actor-critic 算法,视觉追逃任务中性能超越历史状态基线

常见问题

记忆状态批判器如何保证策略梯度的无偏性?

通过以策略自身的内部记忆为条件,该批判器具备良定性,无需额外的历史递归近似器即可保证策略梯度无偏。

在四旋翼视觉追逃实验中,记忆状态批判器表现如何?

在两种竞技场类型中,记忆状态批判器均优于历史状态批判器,且收敛速度更快。

记忆状态批判器是否需将损失反向传播至策略记忆?

无需反向传播。即使记忆是历史的有损编码,基于该记忆的批判器也无需将损失反向传播至记忆模块中。

该研究提交于何时及发表于哪个领域?

研究提交于2026年10月2日,发表于arXiv机器学习领域。

记忆状态批判器在何种情况下优势会消失?

当任务中特权状态本身已完全可观测历史相关信息时,记忆状态批判器相对历史状态批判器的优势将缩小甚至消失。

来源:arXiv cs.LG