当生成式AI的视觉幻象褪去,研究者们清醒地认识到:缺乏物理动作锚点的想象,终究无法操控冰冷的机械臂。WAM流派的强势崛起,正是向着极值控制力的再一次冲锋。
纵观ICML上的WAM论文,其共同的趋势在于:利用明确的动作指令作为“锚点”,在长序列几何一致性、无限视距规划以及反事实推理上取得了惊人的突破。WAM不仅是连接虚拟与现实的桥梁,更是让世界模型真正走向实体交互的执行中枢。 ▎WorldPlay:双动作表征搭配记忆重构蒸馏,兼顾实时交互与长时几何一致性
WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
论文点评:WorldPlay是由香港科技大学团队推出的一款流式视频扩散模型,旨在解决交互式世界模型中速度与内存之间的权衡难题。该模型靠三套核心方案破解痛点:双动作表示(键盘+摄像机位姿)精准承接用户操控,重构式上下文记忆调取历史画面缓解遗忘,上下文强制蒸馏抑制画面漂移。该工作首次让世界模型同时具备流畅实时交互(24 FPS)与长效3D记忆能力。
论文链接:https://arxiv.org/abs/2512.14614 ▎WorldCompass:长时序世界模型强化学习框架,提升长时间交互探索与画面质量
WorldCompass: Reinforcement Learning for Long-Horizon World Models
论文点评:当下视频交互世界模型做长期任务时,容易出现探索效率低、动作不准、奖励作弊等短板。本文打造的 WorldCompass 强化学习优化框架,利用显式动作针对性解决上述痛点。框架包含剪辑级展开策略、互补奖励函数等设计,在长周期任务中明显改善了交互准确度与视频视觉效果,给高效世界模型的研发提供了全新思路。
论文链接:https://arxiv.org/abs/2602.09022v1 ▎Mind Dreamer:隐空间主动反事实推理,打破历史束缚加速稀疏奖励任务学习
Mind Dreamer: Untethering Imagination via Active Counterfactual Reasoning on Latent Manifolds