
潜在动作:光流是负资产
一句话判断
潜在动作:光流是负资产
论文解决什么问题
潜在动作模型(LAM)这几年冒出一堆变体——建模范式选像素差分还是光流,正则化选VAE还是VQ,潜在动作要不要归一化、维度定多少——每篇论文各报最优配置,却没人把这些设计选择放进同一套受控实验比过,业内缺一份"哪个选择真正重要"的清单。
核心方法
↳ 41种设计选择跑了个遍,七种建模范式里最简单的LAPO(不做任何预处理,直接训练在原始数据上)综合得分最高(0.7327);光流方法持续垫底,连像素差分基线都打不过,给LAPO加光流约束效果反而更差
↳ 原因:光流把画面变化转成显式像素位移,这种"以运动为中心"的归纳偏置丢了接触、遮挡、局部形变这些和转移动力学相关的线索,还把估计误差带进表示——更结构化的先验不等于更好的表示
↳ 用预训练DINO特征做语义差分,效果逼近甚至反超LAPO:一个强的语义先验本身就是有效归纳偏置,不需要额外的运动结构
实验结果
· 正则化方法类型影响有限,强度才关键:VAE推荐10⁻⁷、Sparsity推荐10⁻⁵、SIGReg推荐10⁻³、VQ-VAE取1
· 潜在动作维度32是单臂/双臂通用最佳点;正则化选对后,不做归一化反而更好(28/33组合更优)
· 真机验证:潜在动作微调过的VLM骨干在Franka Panda上成功率从64.75%到79.25%,收敛快4倍
这篇论文不是什么
不代表这些排名是实际部署最优——评测只用前视角、不给关节状态和数据增强,是排除混杂因素的洁净室设置;双臂14自由度的发现(如维度32)只在仿真验证过,没有真机数据支撑;潜在动作目前还只是微调阶段的任务特定信号,没被提升成基础级表示
对机器人 / 世界模型 / VLA 的启发
这篇最锋利的判断是:所有代理指标都只能做粗筛,排不出精细名次,不能替代真实下游评测。这条判断和之前解读过的两篇论文遥相呼应——Omega-0发现离线重建质量更高的模型,换到真机反而执行更迟滞;CDLAM也得出过同样结论,像素级重建指标排不出潜在动作空间的优劣。但耐人寻味的是,这条判断和刚解读过的PointWorld直接顶牛:PointWorld特意放弃任务成功率、改用逐点L2误差当核心指标,理由正是"成功率会掩盖系统性差异"——一个说再精细的代理指标也靠不住,一个说换个更精细的指标就能看清差距,两边答案正相反,谁更站得住,还得看更多证据。