Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
arXiv · HuggingFace · ▲85
摘要(原文)
Visual generators excel at rendering, but they confidently fabricate what they do not know. User requests are unbounded, evolving, and deeply long-tailed: new characters, trending entities, post-cutoff events, and more. This world-knowledge bottleneck is structural: generators are trained on fixed corpora, but the visual world is open-ended. We construct SearchGen-20K and SearchGen-Bench, with 20,839 prompts spanning twelve failure categories and twenty-two domains, paired with a pre-executed multimodal SearchGen-Corpus-1M to support offline, reproducible research. On SearchGen-Bench, frontier open generators score only 21 to 28 out of 100, a 40-point collapse invisible to existing benchmarks. The natural remedy is to employ search tools, enabling agentic visual generation. However, we find that naive search fails: it retrieves indiscriminately, injecting noise into prompts the generator already handles. We trace the root cause to a generator-specific, evolving knowledge boundary: the divide between what a generator can internalize through training and what must remain in external context. Although this boundary is hard to specify in advance, we show that it is discoverable through a teach-then-search co-training framework. Even a minimal version of this co-training recipe produces monotonic improvement, laying the foundation for recursive self-improvement in visual generation that can meet world-knowledge-grounded requests. We release the full dataset, co-training corpus, and search corpus as a replayable harness for tool-augmented, world-knowledge-grounded visual generation.
摘要(中译)
视觉生成器擅长渲染,但它们会自信地编造它们不知道的东西。用户请求是无界的、不断演变的,并且深度长尾分布:新角色、流行实体、截止后事件等等。这种世界知识瓶颈是结构性的:生成器是在固定语料库上训练的,但视觉世界是开放式的。我们构建了SearchGen - 20K和SearchGen - Bench,其中有20,839个提示,涵盖十二种失败类别和二十二个领域,并与预先执行的多模态SearchGen - Corpus - 1M配对,以支持离线的、可重复的研究。在SearchGen - Bench上,前沿的开放生成器仅得21到28分(满分100分),这是一个现有基准测试无法察觉的40分下降。自然的补救方法是使用搜索工具,实现代理视觉生成。然而,我们发现简单的搜索会失败:它会不加区分地检索,将噪声注入生成器已经能处理的提示中。我们将根本原因追溯到一个特定于生成器、不断演变的知识边界:生成器可以通过训练内化的内容与必须保留在外部上下文中的内容之间的分界。尽管这个边界很难提前指定,但我们表明,它可以通过“先教学后搜索”的协同训练框架来发现。即使是最小版本的这个协同训练配方也能产生单调的改进,为视觉生成中的递归自我改进奠定基础,以满足基于世界知识的请求。我们发布了完整的数据集、协同训练语料库和搜索语料库,作为一个可重放的套件,用于工具增强、基于世界知识的视觉生成。
背景剖析
背景剖析
1. 技术背景与真实需求
视觉生成技术(如文本到图像模型)已能创作高质量的静态画面,但其核心瓶颈在于世界知识的局限性。现实中,用户需求是动态且长尾的(例如2025年大阪世博会吉祥物、历史准确的斯巴达方阵等),而模型训练数据是静态的、有截止日期的。这种矛盾导致模型在面对未知实体(如新兴文化符号、实时事件)时,会“自信地编造错误内容”。技术需要解决的问题是:如何让生成模型在保持创作能力的同时,动态获取并整合外部知识,以满足真实世界的开放性需求。
2. 之前的问题与不足
现有方法的两大缺陷:
- 评估缺口:传统基准测试(如MS-COCO)无法暴露“世界知识失败”问题,因为它们仅覆盖标准化场景。例如,前沿模型在SearchGen-Bench上的得分比商业API低40分,但这一差距被现有基准忽略。
- 搜索的盲目性:直接为模型配备搜索工具(如检索增强生成)会引入噪声。模型无法区分有用信息和干扰内容,导致生成结果出现概念混淆或风格污染。根本原因在于生成模型与搜索工具的协调问题——模型需要知道“何时搜索”“搜索什么”,而现有方法缺乏这种动态判断能力。
3. 本文的解法
论文提出“协同训练框架”,通过两个核心创新解决问题:
- 噪声抵抗的代理推理器:设计一个三阶段流程(判断是否搜索→过滤噪声→整合有效信息),确保搜索结果不破坏生成质量。
- 生成与搜索的联合训练:通过迭代优化,让模型学会“内化可训练的知识”(如固定符号的外观),同时让推理器学会“只在模型无法处理时搜索”(如长尾实体或实时事件)。这种方法形成了一个“自我改进循环”:模型能力提升后,推理器的搜索范围会自动调整,从而持续适应新需求。
4. 与前人工作的关键差异
- 聚焦动态知识边界:前人工作要么假设知识完全可内化,要么无差别使用搜索,而本文首次明确“生成模型与外部知识的边界是动态变化的”,并提出协同训练来处理这一边界。
- 强调噪声控制:不同于传统方法直接将搜索结果输入模型,本文引入噪声过滤机制,避免模型被无关信息误导。
- 实用导向的基准测试:通过SearchGen-20K和SearchGen-Bench,首次系统量化了“世界知识失败”问题,并提供了可复现的工具链,推动该领域从“封闭场景优化”转向“开放世界适配”。
这一研究为未来视觉生成技术指明了方向:通过动态协调内部知识与外部搜索,模型可以逐步扩展其能力边界,真正满足用户的长尾需求。












