ABot-N1: Toward a General Visual Language Navigation Foundation Model
arXiv · HuggingFace · ▲101
摘要(原文)
Visual Language Navigation foundation models aim to unify deep reasoning for grounded spatial decisions with broad versatility for diverse embodied tasks. Current approaches typically achieve this integration via monolithic policies that map observations directly to actions, yet they often suffer from coordinate drift and poor handling of long-tail semantics. Furthermore, these black-box mappings lack interpretability, hindering the simultaneous achievement of generality, robustness, and transparency. We present ABot-N1, a step toward a general Visual Language Navigation foundation model, that addresses these challenges by decoupling cognition from control via a slow-fast architecture guided by dual visual-language signals. More specifically, a slow vision-language reasoner performs explicit Chain-of-Thought reasoning while producing a pixel goal. This compact set of image-space anchor points serves as a universal interface for diverse tasks, including point-goal, object-goal, poi-goal, instruction-following, and person-following. Subsequently, a fast action expert leverages both the textual cues and the pixel guidance to generate continuous waypoints at the native control frequency. By bridging high-level intents and low-level control through pixel-grounded anchors paired with explicit linguistic traces, our approach ensures robust, generalizable, and interpretable navigation across simulation and real-world benchmarks. ABot-N1 establishes new state-of-the-art records, delivering massive gains specifically in urban-scale navigation: boosting POI arrival by 35.0% (to 77.3%) and achieving 95.4%/92.9% SR in complex indoor and outdoor scenes. It also maintains superior robustness across object-reaching, person-following, and instruction-following tasks. New Point-Goal/POI-Goal benchmarks are released as open source to advance the field of urban-scale navigation.
摘要(中译)
视觉语言导航基础模型旨在将用于基于场景的空间决策的深度推理与适用于多样化具身任务的广泛通用性相统一。当前的方法通常通过整体式策略来实现这种集成,这些策略将观测直接映射到动作,但它们常常遭受坐标漂移和长尾语义处理不佳的问题。此外,这些黑箱映射缺乏可解释性,阻碍了同时实现通用性、鲁棒性和透明性。我们提出了ABot - N1,它是迈向通用视觉语言导航基础模型的一步,通过由双重视觉 - 语言信号引导的慢 - 快架构将认知与控制解耦来解决这些挑战。更具体地说,一个慢速视觉 - 语言推理器执行显式的思维链推理,同时生成一个像素目标。这组紧凑的图像空间锚点作为多种任务的通用接口,包括点目标、对象目标、兴趣点目标、指令遵循和人员跟随。随后,一个快速动作专家利用文本线索和像素引导,在原生控制频率下生成连续的路径点。通过将与显式语言痕迹配对的基于像素的锚点连接高级意图和低级控制,我们的方法确保了在模拟和真实世界基准测试中稳健、可推广且可解释的导航。ABot - N1创造了新的最先进记录,在城市规模导航方面尤其取得了巨大提升:将兴趣点到达率提高了35.0%(达到77.3%),并在复杂的室内和室外场景中实现了95.4%/92.9%的成功率。它在到达对象、人员跟随和指令遵循任务中保持了卓越的鲁棒性。新的点目标/兴趣点目标基准已作为开源发布,以推进城市规模导航领域的发展。
背景剖析
背景剖析
1. 技术背景
视觉语言导航(VLN)技术旨在让机器人或智能体通过结合视觉观察和语言指令,在复杂环境中自主完成导航任务。这类技术的核心需求来自现实场景中的多样化挑战:例如,机器人在城市中需要根据自然语言指令找到特定地点(如“咖啡馆”),在室内环境中遵循精确坐标到达目标点,或跟踪移动的人。这些任务要求智能体不仅具备空间定位能力,还要理解开放词汇的语义(如识别未见过的物体)、处理动态环境变化(如人群移动),并确保行为的安全性和可解释性。
2. 之前的问题
传统方法通常采用“一体化策略”,直接将视觉输入映射到动作输出。这种方法存在三个关键缺陷:
- 坐标漂移与语义处理不足:依赖局部坐标的目标(如“向前5米”)在地图或定位误差下可能指向不可行区域(如车道或花坛),而端到端训练会破坏预训练的语义知识(如识别新物体)。
- 缺乏可解释性:黑箱模型无法提供决策的中间步骤,导致故障分析困难(例如无法区分是感知错误还是推理错误)。
- 任务碎片化:不同导航任务(如点目标、对象搜索、指令跟随)使用独立的架构和数据,难以统一到一个系统中,限制了跨任务迁移能力。
3. 本文的解法
论文提出了ABot-N1模型,通过慢-快架构和像素目标接口解决上述问题:
- 慢系统(认知模块):一个4B参数的多模态模型(VLM)负责高层次推理,生成自然语言解释(Chain-of-Thought)和一个“像素目标”(如图像中的锚点区域)。这一步将语言指令接地到视觉实体,并确保语义合理性。
- 快系统(控制模块):一个2B参数的专家模型根据慢系统的输出和实时视觉输入,生成连续的运动路径。这种分离确保语义推理(慢)和反应控制(快)独立优化,避免相互干扰。
- 统一接口:所有任务(如点目标、对象搜索)被分解为“跟踪由语言解释的像素目标”,从而实现跨任务通用性。
4. 切入角度
与前人工作相比,ABot-N1的关键创新在于:
- 解耦认知与控制:通过慢-快架构分离语义推理和运动控制,解决了传统方法中动态不匹配的问题。
- 显式可解释性:像素目标和自然语言解释提供了每一步决策的透明性,便于故障诊断和安全验证。
- 数据驱动的扩展:通过引入像素级监督和强化学习,提升了模型在开放世界中的鲁棒性,而非依赖静态标记数据。
这一设计使ABot-N1在复杂城市导航任务中实现了新的最佳性能,同时为未来研究提供了一个可扩展的框架。













