Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
arXiv · HuggingFace · ▲88
摘要(原文)
We introduce Agents-A1, a 35B Mixture-of-Experts Agentic Model that reaches trillion-parameter-level performance by scaling the agent horizon. We investigate agent-horizon scaling from two perspectives: scaling long-horizon trajectories and scaling heterogeneous agent abilities. To support this goal, we build a long-horizon knowledge-action infrastructure that connects external knowledge, actions, observations, and verifier outcomes, producing agentic trajectories with an average length of 45K tokens. Based on this, we train Agents-A1 with a three-stage recipe. First, we perform full-domain supervised fine-tuning to align the base model with broad agentic behaviors. Second, we train domain-level teacher models to capture specialized expertise in each domain. Third, we propose a multi-teacher domain-routed on-policy distillation with salient vocabulary alignment to improve knowledge transfer efficiency across different domains, unifying six heterogeneous domains into one deployable student model. Agents-A1 achieves strong and broad performance for long-horizon agent benchmarks. Compared with 1T-parameter model such as Kimi-K2.6 and DeepSeek-V4-pro, Agents-A1 achieves leading results on SEAL-0 (56.4), IFBench (80.6), HiPhO (46.4), FrontierScience-Olympiad (79.0), and MolBench-Bind (56.8), and remains highly competitive on SciCode (44.3), HLE (47.6) and BrowseComp (75.5). We hope this work provides the community with a practical path for scaling the horizon using a 35B agent that can reach or match the performance of 1T models on long-horizon tasks.
摘要(中译)
我们介绍了Agents - A1,这是一个350亿参数的混合专家智能体模型,通过扩展智能体视野(agent horizon)达到了万亿参数级别的性能。我们从两个方面研究智能体视野扩展:扩展长视野轨迹和扩展异构智能体能力。为了支持这一目标,我们构建了一个长视野知识 - 行动基础设施,它连接外部知识、行动、观察和验证器结果,生成平均长度为45000个token的智能体轨迹。基于此,我们通过一个三阶段方案训练Agents - A1。首先,我们进行全领域监督微调,使基础模型与广泛的智能体行为保持一致。其次,我们训练领域级教师模型,以捕捉每个领域的专业专业知识。第三,我们提出了一种多教师领域路由的策略梯度蒸馏(on - policy distillation),并带有显著词汇对齐,以提高不同领域之间的知识转移效率,将六个异构领域统一为一个可部署的学生模型。Agents - A1在长视野智能体基准测试中取得了强大而广泛的表现。与如Kimi - K2.6和DeepSeek - V4 - pro这样的1万亿参数模型相比,Agents - A1在SEAL - 0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience - Olympiad(79.0)和MolBench - Bind(56.8)上取得了领先的结果,并且在SciCode(44.3)、HLE(47.6)和BrowseComp(75.5)上仍然具有很强的竞争力。我们希望这项工作为社区提供一种实用的路径,即使用一个350亿参数的智能体来扩展视野,使其在长视野任务上能够达到或匹配1万亿参数模型的性能。
背景剖析
背景剖析
1. 技术背景与真实需求
近年来,大语言模型(LLM)的发展推动AI从被动响应转向主动决策,例如在软件工程、科学研究和复杂决策场景中,AI需要像人类一样执行“长程任务”——比如规划步骤、调用工具、验证结果并动态调整策略。这类任务的核心需求是让AI具备持续解决问题的能力,而非仅回答单轮问题。例如,科学家可能需要AI协助设计实验、分析数据并修正错误,而软件工程师需要AI编写代码、调试并优化程序。这些场景要求AI不仅理解语言,还要在多轮交互中保持逻辑连贯性,并从反馈中学习。
2. 之前的问题与瓶颈
现有方法主要依赖两种路径提升长程任务能力:一是扩大模型参数(如万亿参数模型),但这种方法需要巨大的计算资源和数据,且难以复制;二是显式扩展任务规划能力,但面临两个关键挑战:
- 知识基础设施不足:长程任务需要模型与环境(如工具、数据库)动态交互,但缺乏统一的训练环境,导致模型难以从实际反馈中学习(例如,无法验证中间结果或从错误中恢复)。
- 异构能力整合困难:不同领域(如科学、编程)需要不同的技能(如信息检索、约束跟踪),这些技能往往难以统一到一个模型中,容易产生冲突。
3. 本文的解法
论文提出了Agents-A1模型,通过“扩展任务边界而非参数”来突破瓶颈:
- 构建知识-行动基础设施:创建一个连接外部知识、工具、观察和验证信号的统一环境,生成平均长度为45K token的长程任务轨迹,让模型从实际交互中学习规划、工具调用和错误恢复。
- 三阶段训练策略:
1. 全领域监督微调:训练一个具备广泛长程能力的基础模型。
2. 领域专家模型训练:针对特定领域(如科学计算)优化专业技能。
3. 跨领域蒸馏:通过“多教师领域路由蒸馏”将不同领域的技能统一到一个35B参数的模型中,避免能力冲突。
4. 与前人的关键差异
与依赖参数扩展的方法不同,Agents-A1的核心创新在于:
- 显式解决长程任务的基础设施问题:通过动态环境支持模型从反馈中学习,而非仅依赖文本训练。
- 高效整合异构能力:通过蒸馏技术将六个领域的技能(如工具使用、结果验证)统一到一个模型中,而非独立训练。
- 性能对标万亿模型:仅用35B参数就达到了万亿参数模型的长程任务表现(如在SEAL-0、IFBench等基准上超越Kimi-K2.6和DeepSeek-V4)。
这一工作为社区提供了一条可行的路径:通过优化任务边界和技能整合,而非盲目扩大参数,实现长程智能的高效扩展。


