2026/08/17

HiDream-O1-World:世界模型开始学习记住一张地图

HiDream-O1-World 以空间记忆、3D 先验和测试时训练改善交互式世界模型的长时一致性。

世界模型生成式 AI多模态AI 视频
HiDream-O1-World:世界模型开始学习记住一张地图

世界模型真正难的地方,不是生成一段看起来逼真的画面,而是让画面在用户走远、回头、转身、碰撞和修改环境之后,仍然像同一个世界。HiDream-O1-World 最近受到关注,核心原因也不只是登顶榜单,而是它把空间记忆、交互和持续编辑放在了同一套系统里讨论。

先把证据边界说清楚:目前公开信息主要来自项目方介绍、官方 Demo 和 WBench 评测页面,HiDream-O1-World 尚未提供面向公众的完整体验。下面分析的是公开技术路线和评测结果,不能把精选演示直接等同于稳定可用的产品能力。

WBench 交互式世界模型评测榜单
WBench 按质量、场景、交互、一致性和物理等维度比较交互式世界模型。

为什么世界模型会“走着走着换地图”

普通视频生成模型只需要让相邻帧看起来连贯。交互式世界模型面对的要求更高:用户的动作会改变下一帧,镜头可以回到几秒前的位置,物体可能挡住另一个物体,角色还需要绕开障碍物继续前进。只要模型每一步都从局部画面重新猜测,误差就会逐渐累积,最终表现为建筑消失、物体漂移、道路变形,或者回头时发现身后的世界已经被重写。

空间记忆加测试时训练

公开介绍将 HiDream-O1-World 放在原生全模态 UiT 架构上,并强调图像、文本、动作和空间信息在统一表征中处理。更关键的是带有 3D 先验的 Memory 上下文和 TTT(Test-Time Training,测试时训练)。Memory 像一份随探索更新的空间档案,记录几何结构、物体位置和遮挡关系;TTT 则根据当前轨迹和新观察到的内容在线调整内部表征,减少长时间运行中的漂移。

WBench 第一名说明了什么

WBench 是美团 LongCat 与复旦大学团队推出的交互式世界模型评测基准,公开页面把能力拆成质量、场景设定、交互、一致性和物理等维度。榜单中 HiDream-O1-World 综合分 80.9,一致性 88.0,物理 73.3,综合排名第一。

最值得看的不是第一两个字,而是分项结构。一致性较高,与空间记忆路线相互呼应;物理分虽然领先,但还不能让人得出碰撞和长时交互已经解决的结论。评测结果只能说明它在该基准覆盖的任务上表现突出。

Demo 里更有价值的测试动作

官方案例分为漫游和编辑。漫游展示前进、回退、转身和穿过遮挡区域后的空间保持;编辑则通过文字指令改变物体、角色动作或天气,同时保持原有视角和路线连续。把天气从晴天改成雷雨、太阳雨再恢复晴天,考验的是环境变化是否发生在同一条轨迹上,而不是重新生成一段新视频。

Demo 仍然是精选案例。真正需要验证的还有长时间运行失败率、复杂遮挡、多个物体同时运动、指令冲突、推理延迟和显存成本。没有这些数据,最好把它称为展示出较强潜力,而不是已经达到游戏引擎级别的可靠性。

结论

HiDream-O1-World 的价值,在于它把世界模型从生成下一帧进一步推向维护一个可以继续探索的空间状态。WBench 高分和官方 Demo 说明这条路线已经取得进展,但距离开放环境下可验证、可部署、可维护的通用世界模型,还有工程距离。

参考:WBenchWBench 论文