
HyperWorld:拆开,泛化掉31分
一句话判断
HyperWorld:拆开,泛化掉31分
论文解决什么问题
文本世界模型要学会预测动作效果,得先把当前状态"翻译"成文字喂给模型。常见做法要么是扁平的自然语言句子,要么是知识图谱惯用的二元组(头实体,关系,尾实体)。但很多动作的前置条件天然是高阶的——开一个箱子,同时牵扯玩家位置、钥匙在不在手上、箱子锁没锁、钥匙和锁匹不匹配这四个条件,二元组把它们拆成互不相连的碎片,模型每次预测都要自己从碎片里重新拼出上下文。
核心方法
把和同一个实体相关的事实打包成一个联合单元,而不是拆成互相独立的成对关系
↳ 固定信息量完全一致,只比较组织结构:原始文本、独立句子、二元组、超边(本文提出,把一个实体的位置/状态/内容物/绑定关系全部渲染在同一行)——四种表示携带的信息完全相同,差异只在于事实怎么分组
↳ 小语言模型(0.5B-3B)做LoRA微调,学习从序列化状态+动作预测符号化效果,四种表示用同一套训练目标、超参数、数据
实验结果
· 超边表示在0.5B-1.5B和多数分布外指标上最强:1.5B规模下分布外精确匹配达0.914,比二元组高7.6个百分点,比原始文本高31个百分点,三个随机种子结果稳定
· 但不是全面碾压——3B规模、分布内测试下,二元组的精确匹配反而略高(0.956对0.952);单独看动作可行性判定,原始文本最强,超边排第二但明显优于二元组/句子
· 接入一个简单贪心规划器实测:超边世界模型规划成功率76.7%,远超二元组(56.7%)和句子(53.3%)——单步预测更准,确实能转化成下游任务完成率
· 意外发现:去掉规划打分公式里的置信度加权项,成功率从76.7%进一步提升到93.3%,说明默认的置信度校准其实是帮倒忙
这篇论文不是什么
· 只在410个受控参数的TextWorld小游戏和0.5B-3B小模型上验证过,扩展到更丰富环境和具身机器人操作是未来工作
· 不是任何数据量下都有用——训练数据只有10%时,四种表示方式在分布外表现都差不多,结构优势要等数据积累到一定量才显现
· 超边的分组规则是研究者手工设计的确定性规则,不是模型学出来的,没验证模型能否自主发现类似的好分组
对机器人 / 世界模型 / VLA 的启发
"结构/方法的优势需要一个数据量门槛才会显现"这条判断,这次在HyperWorld身上又被验证了一遍——和之前解读过的几篇工作方向一致:Skild自己承认ICL在小数据量区间反而不如传统微调;FLEX-π自称依然"很吃数据";PRISM的预训练收益要在全量数据上才明显。语言模型、机器人操作、文本世界模型,三个差异很大的领域,反复得出同一个模式:不是"结构好就一定赢",是"数据攒够之后,结构好的方案才能把优势兑现出来"。另外这篇有个值得记的态度——作者没有把超边包装成全面最优,老老实实报告了它在3B分布内、单纯可行性判定上都不是最强,这种克制比很多"全胜叙事"的论文更值得信任。
论文关键页

