腾讯朱雀实验室AI红队演练平台AI-Infra-Guard:一站式AI安全扫描与越狱评估实战指南
大模型、AI Agent、MCP 服务器正在快速进入企业生产环境,随之而来的安全风险也成倍放大:组件漏洞、技能投毒、提示词越狱、工具劫持……传统安全工具很难覆盖这些新型攻击面。**AI-Infra-Guard(简称 AIG)是腾讯朱雀实验室开源的一款 AI 红队演练平台,把 AI 安全扫描、漏洞检测、越狱评估** 等能力整合到同一个平台中,帮助开发者在上线前完成一次完整的 AI 安全风险自检。
本文围绕 AI-Infra-Guard 的功能特性、部署方式与典型应用场景做一次完整梳理,方便想上手这款 AI 安全工具的同学快速落地。

产品介绍:腾讯开源的AI红队演练平台
AI-Infra-Guard 的目标是成为业界领先的 AI 红队演练平台,为用户提供全面、智能、易用的 AI 安全风险自检方案。平台采用可扩展的插件化架构,社区可以通过提交指纹规则、漏洞规则、MCP 扫描规则和越狱评估数据集持续扩充检测能力。
项目近期迭代节奏相当密集,几个重要版本值得留意:
- v4.6.1(2026-09-10):API 检查器扩展模型指纹覆盖范围(Gemini 2.5/3.1、Gemma 2/3/4、GLM-5.3 与 GLM-5.3-Flash);MCP 扫描可靠性增强,可标记空/不完整扫描、在上下文压缩期间保留安全发现、显示底层连接错误;修正了错误标记的 CVE 产品名称。
- v4.6.0(2026-08-26):新增 LLM API 投毒检测(多探测黑盒审计,识别模型替换与后门风险);Agent-Scan v5.0.0 变异引擎重构;漏洞库扩展至 146 个 AI 组件、2000 多条 CVE 规则。
- v4.5.2(2026-08-17):Skill-Scan 增加 .pyc 字节码绕过检测与字符集走私防御;MCP-Scan 在动态模式下通过工具白名单阻断远程代码执行。
- v4.5.1(2026-07-30):越狱评估引入 4 种多回合攻击方法(Many-Shot、PAIR、GOAT、ActorAttack);代理扫描新增 5 项 OWASP 技能与网络数据窃取检测。
- v4.5.0(2026-07-27):AI 安全技能市场上线,前端完全开源,技能扫描引擎升级至 9 个风险类别,SkillTrustBench 最高分 0.9848。
核心功能:六大AI安全扫描能力
AI-Infra-Guard 把 AI 系统常见的安全检测场景拆分为六个模块,基本可以覆盖从基础设施到应用层的完整链路。
| 功能模块 | 能力说明 |
|---|---|
| ClawScan(OpenClaw 安全扫描) | 一键评估 OpenClaw 的安全风险,可检测不安全配置、Skill 风险、CVE 漏洞和隐私泄露 |
| 代理扫描(Agent Scan) | 独立的多智能体自动化扫描框架,评估 AI Agent 工作流安全性,支持 Dify、Coze 等平台上运行的代理 |
| MCP 服务器与代理技能扫描 | 覆盖 14 类主要安全风险,支持从源代码或远程 URL 扫描 MCP 服务器与代理技能 |
| AI 基础设施漏洞扫描 | 精准识别 100 多种 AI 框架组件,匹配 2000 多个已知 CVE,覆盖 Ollama、ComfyUI、vLLM、n8n、Triton Inference Server 等 |
| 越狱评估 | 基于精选数据集评估提示词安全风险,应用多种攻击方法测试模型稳健性,并支持跨模型对比 |
| 模型与 API 中继检查器 | 模型指纹识别、Claude Signature 验证、中继黑盒审计、PAMELA 与 Ventor QTest |

技术优势:aig-skill-scan的检测性能与风险覆盖
技能(Skill)安全是 AI Agent 生态里最容易被忽视的一环。AIG 内置的 aig-skill-scan 在 SkillTrustBench 基准上使用不同大模型驱动的实测表现如下:
| # | 模型 | F1 | 精确率 | 召回率 | FPR |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | 0.9848 | 0.9725 | 0.9974 | 0.0663 |
| 2 | GLM 5.1 | 0.9836 | 0.9701 | 0.9974 | 0.0723 |
| 3 | Gemini 3.5 Flash | 0.9792 | 0.9947 | 0.9641 | 0.0120 |
| 4 | Kimi 2.6 | 0.9780 | 0.9895 | 0.9667 | 0.0241 |
| 5 | DeepSeek V4 Flash | 0.9740 | 0.9868 | 0.9615 | 0.0301 |
扫描覆盖 9 大类技能安全风险(SkillTrustBench T01–T09),分层归类如下:
| 层 | 风险类别 |
|---|---|
| A · 指令与记忆 | T01 技能指令劫持、T02 记忆投毒 |
| B · 代码执行 | T03 远程载荷下载与执行、T04 嵌入式恶意代码 |
| C · 系统权限 | T05 权限提升与未授权访问、T06 系统持久化 |
| D · 工具链与依赖 | T07 工具劫持与欺骗、T08 不安全依赖项 |
| E · 技能代码质量 | T09 不安全编码实践 |
完整排行榜与评测细节可查阅 SkillTrustBench 页面。

部署教程:三种方式快速上手AI-Infra-Guard
方式一:Docker 一键部署(推荐)
环境要求:Docker 20.10 及以上、内存 4GB+、磁盘空间 10GB+。直接使用预构建镜像启动:
# 该方式直接从 Docker Hub 拉取预构建镜像,启动更快
git clone https://github.com/Tencent/AI-Infra-Guard.git
cd AI-Infra-Guard
# Docker Compose V2+ 用户请将 docker-compose 替换为 docker compose
docker-compose -f docker-compose.images.yml up -d
服务启动后,在浏览器打开 http://localhost:8088 即可访问 AIG 的 Web 界面。
方式二:pip 安装 aig-skill-scan 命令行工具
如果只需要审计 Agent Skill 安全,可以单独安装轻量 CLI,适合嵌入企业 CI/CD 流水线,漏洞分类对齐 SkillTrustBench T01–T09 标准:
pip install aig-skill-scan
# 通过环境变量配置 API Key
export LLM_API_KEY="your-api-key"
# 扫描本地 Skill 项目目录
aig-skill-scan --repo /path/to/your/skill \
-m deepseek-v4-flash \
--language en \
-o result.json
方式三:从源码运行模型与 API 中继检查器
检查器前端需单独部署。Docker 部署后,检查器 API 可通过 GET /api/v1/relay/models 和 POST /api/v1/relay/check/stream 访问,API 文档位于 http://127.0.0.1:8088/api-checker/docs。从源码运行的方式如下:
python3 -m venv services/api_checker/.venv
services/api_checker/.venv/bin/pip install -r services/api_checker/requirements.txt
go build -o ai-infra-guard ./cmd/cli/main.go
export AIG_API_CHECKER_PYTHON="$PWD/services/api_checker/.venv/bin/python"
./ai-infra-guard api-checker list
./ai-infra-guard api-checker audit
另外,OpenClaw 用户还可以在对话中直接调用 aig-scanner 技能发起扫描:
clawhub install aig-scanner
安装后将 AIG_BASE_URL 配置为正在运行的 AIG 服务地址即可,细节见 aig-scanner 的 README。
想体验更完整的能力,也可以申请在线专业版(https://aigsec.ai/ ),专业版采用邀请码机制,优先发放给提交过 Issue、PR 或积极参与社区讨论的贡献者。
使用指南:三类典型扫描任务怎么配置
AI 基础设施漏洞扫描:目标该填什么
这里的目标是指**正在运行的 AI 服务的网络地址**,而不是 GitHub 仓库地址或源码路径——AIG 会连接在线服务做指纹识别,再与已知 CVE 库比对。
| 场景 | 示例目标 |
|---|---|
| 本地运行的 vLLM 实例 | http://127.0.0.1:8000 |
| 局域网内的 Ollama 服务器 | http://192.168.1.100:11434 |
| 内网暴露的 ComfyUI 实例 | http://10.0.0.5:8188 |
| 多台主机批量扫描(每行一个) | 192.168.1.0/24(CIDR)、10.0.0.1-10.0.0.20(范围) |
以扫描本地 vLLM 为例,完整流程是:
- 正常启动 vLLM(例如
python -m vllm.entrypoints.api_server --model meta-llama/...); - 在 AIG Web UI 中点击「AI 基础设施安全扫描 / AI Infra Scan」;
- 填入 http://127.0.0.1:8000(或 vLLM 实际监听的 IP 与端口);
- 点击「开始扫描」,AIG 会对服务做指纹识别并与 2000 多个已知 CVE 比对;
- 查看报告:组件版本、命中的漏洞、严重级别与修复链接。
想专门检测 vLLM 每日构建版本,只需运行对应 nightly 构建并把 AIG 指向它的地址,扫描器会自动识别版本。

MCP 服务器与代理技能扫描
支持两种输入方式:直接粘贴远程 URL(例如 https://github.com/user/mcp-server ),或上传本地源码压缩包,无需目标处于运行状态。

越狱评估
在「设置 → 模型配置」中填入目标大模型的 API 端点(Base URL + API Key),然后选择数据集即可发起评估,评估报告支持跨模型横向对比。

应用场景:哪些团队适合用AI-Infra-Guard
- AI 基础设施运维团队:定期扫描内网中的 Ollama、vLLM、ComfyUI 等组件,及时发现已知 CVE 与不安全配置。
- AI Agent 开发者:上线前对 Dify、Coze 等平台搭建的 Agent 工作流做安全评估,防范技能投毒与工具劫持。
- MCP 生态开发者与安全研究人员:对 MCP 服务器和代理技能做源码级审计,14 类风险规则开箱即用。
- 模型采购与合规团队:用模型指纹识别与中继黑盒审计验证第三方 API 中转是否替换了模型、植入了后门。
- CI/CD 安全卡点:通过 aig-skill-scan 等独立 CLI 把 Skill 安全审计接入流水线,实现自动化拦截。
参与贡献:插件化的规则生态
AIG 的可扩展插件框架是整个架构的基石,社区贡献规则的路径非常清晰:
- 指纹规则:向
data/fingerprints/目录提交新的 YAML 指纹文件; - 漏洞规则:向
data/vuln/目录提交新的漏洞扫描规则; - MCP 插件:向
data/mcp/目录提交新的 MCP 安全扫描规则; - 越狱评估数据集:向
data/eval目录提交新的评估数据集。
参考现有规则格式新建文件,通过 Pull Request 提交即可。
总结
面对 AI 基础设施漏洞、Agent 技能投毒、MCP 安全缺陷和提示词越狱这些新型风险,AI-Infra-Guard 用一个平台把检测、评估、审计串了起来,而且完全开源、支持 Docker 一键部署。无论是个人开发者做安全自检,还是企业团队搭建 AI 安全基线,这款腾讯朱雀实验室出品的 AI 红队演练平台都值得放进工具箱。