
PRISM:规模能否替代显式建模?
一句话判断
PRISM:规模能否替代显式建模?
论文解决什么问题
接触密集的工业操作(装配插拔、卡尺包装、传送带分拣,"差1毫米就算失败"那种),数据该怎么采、采多深,此前很少有工作把"架构设计"和"数据规模/采集方式"这两个变量拆开单独验证过。
核心方法
↳ ① 铺硬件多样性把量堆上去:3机器人平台(Franka/Realman/LEJU)×3种夹爪×3种遥操作接口(外骨骼/Tracker/VR),5000+条轨迹、45+小时;视触觉只在Tracker平台选装末端时才录,不是标配
↳ ② 押的是"规模换隐式接触建模":数据规模与硬件多样性够了,视觉策略不用专门给力/触觉设计架构,也能隐式学会紧公差装配所需的接触动力学
实验结果
· 全量5000条预训练后再微调,持续跑赢从零训练,失败也更"体面"——误对准会自己重新靠近,不是直接懵掉
· 100→200条演示,对插拔/卡尺两个静态任务收益明确,对传送带动态分拣收益小得多——时序耦合问题堆演示解决不了
· 同任务同条数,VR采集训出的策略全面输给外骨骼采集:π0插拔任务外骨骼20%→VR仅5%,卡尺80%→35%
这篇论文不是什么
不代表规模已解决接触密集精密操作——最强基线π0(全量预训练+外骨骼数据)在插拔任务上封顶也只有20%;也不代表跨平台迁移已被验证——真机评测只在一个双臂workcell上做,要验证跨本体部署得在Franka或LEJU上补一轮真机测试
对机器人 / 世界模型 / VLA 的启发
PRISM押的是"规模优先、架构从简",这和不少专门给触觉信号设计独立通路、残差学习、预测式表征的思路,是明显不同的路法——不是谁对谁错,是两种赌法。但耐人寻味的是,PRISM自己摆出来的结果反倒更像是在替对面递证据:最强基线封顶才20%,说明单靠视觉隐式学,目前还扛不住高精度接触任务。另外VR拖累策略这条也印证了一个业内常提的经验——采集硬件本身要为AI训练设计,不能简单套用人体工学接口。半年后如果有人在多平台上补出PRISM的跨本体真机数据,"规模优先"这条路走不走得通,就有得看了。
论文关键页

