Infinite Worlds with Versatile Interactions
arXiv · HuggingFace · ▲32
摘要(原文)
We present LingBot-World 2.0 (also known as LingBot-World-Infinity), an advanced iteration of LingBot-World featuring four distinct upgrades. (1) Our model achieves an unbounded interaction horizon while maintaining consistent output quality, benefiting from a carefully crafted causal pretraining paradigm. (2) Through distilling a real-time variant from the base model, our system guarantees rapid response time, sufficient to drive 720p video streams at 60 fps. (3) Compared to the previous version, this update introduces highly diverse interactive elements, comprising a broader spectrum of actions (e.g., attacking, archery, spell-casting, and shooting) alongside a richer variety of text-driven events. (4) We pioneer the integration of an agentic harness within the domain of world modeling, wherein a pilot agent is tasked with planning and executing character behaviors, while a director agent is responsible for synthesizing novel environmental elements as the scene progresses. Additionally, to facilitate a shared experience, we develop an interface that permits multiple players to simultaneously immerse themselves in this vivid world simulator. We pair our primary 14B model with a lightweight 1.3B counterpart, which supports effortless deployment on a single GPU.
摘要(中译)
我们推出了LingBot-World 2.0(也称为LingBot-World-Infinity),这是LingBot-World的一个高级迭代版本,具有四个不同的升级。(1) 我们的模型在保持一致输出质量的同时实现了无界交互范围,这得益于精心设计的因果预训练范式。(2) 通过从基础模型中提炼实时变体,我们的系统保证了快速响应时间,足以驱动每秒60帧的720p视频流。(3) 与前一个版本相比,这次更新引入了高度多样化的交互元素,包括更广泛的行为(例如攻击、射箭、施法和射击)以及更丰富的文本驱动事件。(4) 我们在世界建模领域率先集成了一个代理控制装置,其中一个飞行员代理负责规划和执行角色行为,而导演代理负责在场景进展时合成新的环境元素。此外,为了促进共享体验,我们开发了一个接口,允许多个玩家同时沉浸在这个生动的世界模拟器中。我们将主要的14B模型与轻量级的1.3B对应模型配对,后者支持在单个GPU上轻松部署。
背景剖析
背景剖析
技术背景
交互式世界模型是一种能根据用户或智能体动作实时生成环境画面的技术,主要用于游戏开发、虚拟仿真等场景。例如,它可以创建一个玩家能自由探索、与环境互动的虚拟世界,或模拟现实中的物理规则(如重力、碰撞)来训练机器人。这类技术的核心需求是让虚拟世界“活起来”——既要有真实的视觉表现,又能对用户操作做出即时反馈,从而提供沉浸式体验。
之前的问题
尽管这类技术潜力巨大,但过去的方法存在两个关键缺陷:
1. 长期稳定性不足:由于每一帧画面都依赖前一轮的输出,错误会逐渐累积,导致画面失真(如纹理模糊、物体变形),通常只能维持几秒到几分钟的稳定,无法构建一个持久的世界。
2. 高保真交互性差:实时渲染细节丰富的画面并响应用户输入需要大量计算资源,因此早期系统往往牺牲分辨率或流畅度,导致交互体验粗糙(如仅支持缓慢的镜头移动)。
本文的解法
针对这些问题,本文提出了四项创新:
1. 稳定的因果生成模型:通过改进训练方法,让模型在长时间生成中保持画面质量,避免错误累积。
2. 实时蒸馏技术:将大模型压缩为轻量版本,以720p分辨率和60帧/秒的速度渲染动态场景,同时保证响应速度。
3. 丰富的交互动作:扩展了用户可执行的操作(如攻击、施法、射击),并支持动态环境变化(如天气调整)。
4. 智能体协作框架:引入“领航员”和“导演”两个智能体,前者控制角色行为,后者生成新内容,使世界能自主演化,而非预先脚本化。
切入角度
与以往工作不同,本文的关键突破在于将“稳定性”和“交互性”结合:通过因果生成模型解决长期漂移问题,再通过蒸馏技术实现实时性能。此外,智能体框架的引入让世界具备自主性,而非依赖人工设计剧情,这是其与前人研究的核心差异。




