Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
arXiv · HuggingFace · ▲2
摘要(原文)
The fast growth of open-source AI infrastructure, from model serving engines and agent platforms to the Model Context Protocol (MCP) ecosystem and the language models themselves, has outpaced the security tooling available to defend it. We present AI-Infra-Guard, an open-source framework that organizes AI red teaming around a single observation: the attack surface of an AI agent is stratified across layers (infrastructure, protocol/tool, agent behavior, and model), and no single detection paradigm fits all of them. The framework therefore matches a paradigm to each layer, from deterministic rule matching over 75+ AI components and 1{,}400+ vulnerability rules, through LLM-driven agentic auditing of MCP servers and agent-skill packages and multi-turn black-box agent red teaming, to a jailbreak harness with 26+ attack operators over sixteen datasets. To our knowledge it is the only open-source framework to span all of these, including supply-chain auditing of the agent skills that increasingly extend AI agents. We release AI-Infra-Guard as open source so that layer-paradigm matching can serve as a practical foundation for agent security and a shared base for the community to build on.
摘要(中译)
开源人工智能基础设施的快速发展,从模型服务引擎和代理平台到模型上下文协议(Model Context Protocol,MCP)生态系统以及语言模型本身,其速度已经超过了可用于保护它的安全工具的发展速度。我们提出了AI - Infra - Guard,这是一个开源框架,它围绕一个单一的观察结果来组织人工智能红队(red teaming)工作:人工智能代理的攻击面是分层分布的(基础设施层、协议/工具层、代理行为层和模型层),并且没有一种单一的检测范式适用于所有这些层。因此,该框架为每一层匹配一种范式,从对75多个人工智能组件和1400多个漏洞规则的确定性规则匹配,到MCP服务器和代理技能包的由大型语言模型(LLM)驱动的代理审计以及多轮黑盒代理红队测试,再到一个在十六个数据集上具有26多个攻击操作器的越狱测试框架。据我们所知,它是唯一一个涵盖所有这些方面的开源框架,包括对越来越多地扩展人工智能代理的代理技能的供应链审计。我们将AI - Infra - Guard作为开源项目发布,以便层 - 范式匹配能够作为代理安全的一个实用基础以及社区在此基础上构建的一个共享基础。
背景剖析
背景剖析
1. 技术背景
近年来,开源AI基础设施(如模型服务器、智能体平台、Model Context Protocol生态等)的快速发展催生了一类新型网络暴露软件。这些系统被个人或小团队部署在不受信任的网络中,用于构建对话机器人、自动化工作流甚至工具调用能力。然而,它们的安全需求与传统软件截然不同:需要防范未授权访问昂贵算力、API凭证泄露、提示注入劫持目标、工具滥用导致“困惑代理人”攻击,以及模型对齐性被对抗性提示破坏等问题。
2. 之前的问题
传统安全工具无法应对这些挑战,主要因为三个核心缺陷:首先,AI组件太新,现有漏洞数据库(如CVE)缺乏相关签名;其次,AI软件的版本管理不规范(如滚动更新、开发标签),导致依赖语义化版本比较的工具失效;最后,也是最关键的,AI的威胁模型已发生转变——高风险漏洞不再是传统的注入或脚本缺陷,而是需要多层级的检测方法(如基础设施暴露、协议漏洞、行为逻辑缺陷、模型对齐问题),而单一技术无法覆盖所有场景。
3. 本文的解法
论文提出“AI-Infra-Guard”框架,其核心思想是分层匹配检测范式:针对不同层级的攻击面(基础设施、协议/工具、智能体行为、模型),使用不同的检测方法。例如,基础设施层用规则匹配和版本归一化;协议层用LLM驱动的动态审计;行为层用对话式红队测试;模型层用多轮越狱评估。这种方法确保每个层级都能获得最适合的检测手段,而非强行套用单一技术。
4. 切入角度
与前人工作的关键差异在于,AI-Infra-Guard首次将AI安全评估视为一个跨层级的统一问题,并通过开源框架实现分层检测的标准化。它不仅覆盖从底层基础设施到高层模型对齐的全栈,还引入了“Prompt-as-Rule”等创新范式,允许社区扩展规则库和攻击算子,以适应快速演变的AI生态。这种设计既解决了当前工具的局限性,也为未来的AI安全研究提供了可扩展的基础。



