REVERSAL-BENCH:可逆性轴与重置预言机,衡量无重置 RL 的悬崖

论文提出了 REVERSAL-BENCH,一个专门用来衡量“无重置强化学习”在不可逆环境中失效问题的基准。核心背景很直接:真正的自主强化学习应该能持续训练、不需要外部重置,但现实中的操作任务往往天然不可逆,比如把物体推下桌、撒了颗粒物,这些事无法一键撤销。现有研究大多默认环境具备某种可逆性,这跟现实脱节。

REVERSAL-BENCH 的核心设计有两个:一是用连续参数 ρ∈[0,1] 控制环境的可逆程度,二是提供一个“reset oracle”(重置预言机),作为地面真值验证机制,检查状态是否可恢复。基准覆盖了五个物理引擎、八种操作场景。作者在多种策略架构上做了评测,包括标准 actor-critic 算法、安全 RL,以及专门的无重置框架。结果出现了一个很陡的“reversibility cliff”(可逆性悬崖):随着 ρ 增大,无重置智能体会持续被吸入不可恢复状态,而普通的 episodic(分幕式)智能体还能稳定学习。这个失败模式在无重置基线和受约束 RL 中都存在。

为什么会这样?作者给出的解释很清晰:无重置智能体没有外部重置能力,一旦进入不可恢复状态,就永久卡住,后续学习完全停滞。而且这个吸收现象在完整物理仿真中、使用学习到的操作策略时依然存在。为了排除干扰因素,他们还对比了几何结构完全相同但可逆的任务版本,确认这种崩溃是由不可逆性因果驱动的,而不是障碍物复杂度的锅。

另一个有价值的尝试是安全盾(safety shield):在不可逆失败发生前介入。结果显示,可恢复性本身可以被准确预测,但主动恢复策略只在智能体物理上能避开陷阱时才有用,真到了不可逆状态,基本救不回来。作者公开了整套基准、一个跨仿真器的大规模可恢复性标注数据集,以及 reset oracle。

这篇工作的意义在于,它把“无重置 RL 在不可逆现实任务中系统性失效”这一现象做成了可重复测量的基准,而不是停留在定性描述。对做机器人操作或真实世界持续学习的人来说,它提示了一个关键边界:仅靠算法层面的应对不够,物理上能否避开不可逆状态才是真正的分水岭。

REVERSAL-BENCH: A Reversibility Axis and Reset Oracle for Measuring the Reset-Free RL Cliff

查看原文