
RL 该在哪一层介入
一句话判断
RL 该在哪一层介入
论文解决什么问题
离线模仿学习已能把复杂行为学得很像,但强预训练不消除在线改进的需求——策略真到部署环境里会碰上离线数据没覆盖的状态,而"再去收更多人类数据"是条更贵的路。
问题是 RL 怎么用到现代模仿策略上。全参微调随模型变大越来越贵,对生成式策略还常和特定优化设计纠缠;于是有了冻结基座、只学修正策略的轻量路线——但修正加在动作空间时探索停在低层,动作容易抖。作者由此把设计空间画成一条谱:关键不只是"改多少",还有"在哪里改"。
核心方法
离线给基座挂一个变分信息瓶颈模块,抽出紧凑的任务相关潜变量;在线冻结基座,RL 只学作用在该潜变量上的残差扰动,经冻结解码器变成新条件,再由冻结策略生成动作。
还有个易忽略的设计:critic 定义在扰动后的潜变量上而非残差本身——同一残差加到不同潜变量会诱导不同动作分布,脱离基底无法定价。
实验结果
真机四任务,数小时在线交互后平均成功率提升 33.7%,插纸币从 20% 提到 77.5%。副产物是在线探索期间动作仍平滑,动作残差法则越训越震荡。
这篇论文不是什么
性能被基座支撑域限制——离线演示从 100 条减到 25 条,在线表现明显退化。鲁棒性只在中等扰动下成立,均值 69%,可变形的纸币任务受扰后更差,每个用例只有 10 次试验。成本也不低:真机在线交互时间是离线采集的三到四倍,扰动尺度还得按任务人工标定(0.1 到 1.5)。
对机器人 / 世界模型 / VLA 的启发
这篇和另一条判断收敛了:辅助信号不能不受约束地接进主干,得给它一个结构受限的位置。此前的手法是残差项、预测目标、专用通路、注意力掩码,这次是"在压缩的任务潜空间里加扰动"。增量在于三组交叉证据,把"不是降维""不是任意特征""必须局部"分别隔离了出来。
还有一处新鲜的分歧。前几天那篇双臂双手工作的结论是:仿真只能引导基础技能,灵巧必须靠真机,纯仿真在灵巧任务上接近于零。而这篇在 Adroit 灵巧手上纯仿真里 RL 微调就拿到强性能。差别可能在于有没有好基座打底——一个从头学灵巧,一个在已有先验上引导。
论文关键页

