
FLEX-π:更全面的联合表征
一句话判断
FLEX-π:更全面的联合表征
论文解决什么问题
直接学策略、只看RGB,都不够
直接学策略a_t=π(o≤t)只根据当前观测出动作,缺对未来的显式建模;视觉通常只有RGB,深度、结构这些三维信息不好从2D图像读出来;预测未来画面时,视频生成模型追求的是像素好看,不是操作信息对不对。FLEX-π认为该同时建模RGB外观、3D几何、语义、动作。
核心方法
更全面的表征,才是效果的根本来源
↳ ① 把RGB、3D几何、物体语义联合编码进同一表征,比只靠RGB更能捕捉空间位置、物体边界、接触关系——这是它更强、更省数据的根本原因,不是工程技巧堆出来的
↳ ② 几乎零成本实现:frozen视频VAE从没训练过点云,直接编码却重建几乎无损(PSNR 31.1dB)——3D信息不用额外训练编码器就能"搭便车"接入
↳ ③ 训练时视觉流随机丢弃+输出侧强制重建(cross-modality forcing),让表征在部署时可按需精简,速度精度不必二选一,单消融③就带来47%相对提升
实验结果
· 真机双臂五任务,难度越高优势越大:自修夹爪+42.7分,软袋拉链+27.2分,平均成功率是π0.5的3.5倍、ManiFlow的2.3倍
· 纯动作模式60ms一次调用已比每个基线都快、都强,说明收益在训练阶段就已沉淀
· 半量数据效果仍超基线满量数据;点云是模态消融里贡献最大的单一模态
这篇论文不是什么
不代表没代价:全联合模式比纯动作慢3倍左右;也不代表数据需求已经很低——作者自称依然"很吃数据";预训练3D监督是伪标注,非传感器真值
对机器人 / 世界模型 / VLA 的启发
"WAM真机上明显优于同参数量VLA、差距随难度扩大"不是孤证——JWAM、TacWAM、JoyAI、Omega-0、Dyna-2,五篇机制不同的论文各自独立验证了同一方向。但"联合表征值多少钱"判断并不统一:FLEX-π自认增益"温和",和EVA、JWAM站同一边;这反对了Dyna-2更激进的判断——世界建模本身才是让跨具身迁移涌现的因。FLEX-π证明了WAM有用,却没证明"世界建模是核心因果机制"这个更大的主张。
论文关键页

