首页 渗透工具 正文

腾讯朱雀实验室AI红队演练平台AI-Infra-Guard:一站式AI安全扫描与越狱评估实战指南

摘要

大模型、AI Agent、MCP 服务器正在快速进入企业生产环境,随之而来的安全风险也成倍放大:组件漏洞、技能投毒、提示词越狱、工具劫持……传统安全工具很难覆盖这些新型攻击面。AI-Infra-Guard(简称 AIG)是腾讯朱雀实验室开源的一款 AI 红队演练平台,把 AI 安全扫描、漏洞检测、越狱评估 等能力整合到同一个平台中,帮助开发者在上线前...

大模型、AI Agent、MCP 服务器正在快速进入企业生产环境,随之而来的安全风险也成倍放大:组件漏洞、技能投毒、提示词越狱、工具劫持……传统安全工具很难覆盖这些新型攻击面。**AI-Infra-Guard(简称 AIG)是腾讯朱雀实验室开源的一款 AI 红队演练平台,把 AI 安全扫描、漏洞检测、越狱评估** 等能力整合到同一个平台中,帮助开发者在上线前完成一次完整的 AI 安全风险自检。

本文围绕 AI-Infra-Guard 的功能特性、部署方式与典型应用场景做一次完整梳理,方便想上手这款 AI 安全工具的同学快速落地。

AI-Infra-Guard主界面功能演示

产品介绍:腾讯开源的AI红队演练平台

AI-Infra-Guard 的目标是成为业界领先的 AI 红队演练平台,为用户提供全面、智能、易用的 AI 安全风险自检方案。平台采用可扩展的插件化架构,社区可以通过提交指纹规则、漏洞规则、MCP 扫描规则和越狱评估数据集持续扩充检测能力。

项目近期迭代节奏相当密集,几个重要版本值得留意:

  • v4.6.1(2026-09-10):API 检查器扩展模型指纹覆盖范围(Gemini 2.5/3.1、Gemma 2/3/4、GLM-5.3 与 GLM-5.3-Flash);MCP 扫描可靠性增强,可标记空/不完整扫描、在上下文压缩期间保留安全发现、显示底层连接错误;修正了错误标记的 CVE 产品名称。
  • v4.6.0(2026-08-26):新增 LLM API 投毒检测(多探测黑盒审计,识别模型替换与后门风险);Agent-Scan v5.0.0 变异引擎重构;漏洞库扩展至 146 个 AI 组件、2000 多条 CVE 规则。
  • v4.5.2(2026-08-17):Skill-Scan 增加 .pyc 字节码绕过检测与字符集走私防御;MCP-Scan 在动态模式下通过工具白名单阻断远程代码执行。
  • v4.5.1(2026-07-30):越狱评估引入 4 种多回合攻击方法(Many-Shot、PAIR、GOAT、ActorAttack);代理扫描新增 5 项 OWASP 技能与网络数据窃取检测。
  • v4.5.0(2026-07-27):AI 安全技能市场上线,前端完全开源,技能扫描引擎升级至 9 个风险类别,SkillTrustBench 最高分 0.9848。

核心功能:六大AI安全扫描能力

AI-Infra-Guard 把 AI 系统常见的安全检测场景拆分为六个模块,基本可以覆盖从基础设施到应用层的完整链路。

功能模块 能力说明
ClawScan(OpenClaw 安全扫描) 一键评估 OpenClaw 的安全风险,可检测不安全配置、Skill 风险、CVE 漏洞和隐私泄露
代理扫描(Agent Scan) 独立的多智能体自动化扫描框架,评估 AI Agent 工作流安全性,支持 Dify、Coze 等平台上运行的代理
MCP 服务器与代理技能扫描 覆盖 14 类主要安全风险,支持从源代码或远程 URL 扫描 MCP 服务器与代理技能
AI 基础设施漏洞扫描 精准识别 100 多种 AI 框架组件,匹配 2000 多个已知 CVE,覆盖 Ollama、ComfyUI、vLLM、n8n、Triton Inference Server 等
越狱评估 基于精选数据集评估提示词安全风险,应用多种攻击方法测试模型稳健性,并支持跨模型对比
模型与 API 中继检查器 模型指纹识别、Claude Signature 验证、中继黑盒审计、PAMELA 与 Ventor QTest

AI-Infra-Guard插件管理界面

技术优势:aig-skill-scan的检测性能与风险覆盖

技能(Skill)安全是 AI Agent 生态里最容易被忽视的一环。AIG 内置的 aig-skill-scan 在 SkillTrustBench 基准上使用不同大模型驱动的实测表现如下:

# 模型 F1 精确率 召回率 FPR
1 Claude Opus 4.6 0.9848 0.9725 0.9974 0.0663
2 GLM 5.1 0.9836 0.9701 0.9974 0.0723
3 Gemini 3.5 Flash 0.9792 0.9947 0.9641 0.0120
4 Kimi 2.6 0.9780 0.9895 0.9667 0.0241
5 DeepSeek V4 Flash 0.9740 0.9868 0.9615 0.0301

扫描覆盖 9 大类技能安全风险(SkillTrustBench T01–T09),分层归类如下:

风险类别
A · 指令与记忆 T01 技能指令劫持、T02 记忆投毒
B · 代码执行 T03 远程载荷下载与执行、T04 嵌入式恶意代码
C · 系统权限 T05 权限提升与未授权访问、T06 系统持久化
D · 工具链与依赖 T07 工具劫持与欺骗、T08 不安全依赖项
E · 技能代码质量 T09 不安全编码实践

完整排行榜与评测细节可查阅 SkillTrustBench 页面。

AI基础设施漏洞扫描结果展示

部署教程:三种方式快速上手AI-Infra-Guard

方式一:Docker 一键部署(推荐)

环境要求:Docker 20.10 及以上、内存 4GB+、磁盘空间 10GB+。直接使用预构建镜像启动:

# 该方式直接从 Docker Hub 拉取预构建镜像,启动更快
git clone https://github.com/Tencent/AI-Infra-Guard.git
cd AI-Infra-Guard
# Docker Compose V2+ 用户请将 docker-compose 替换为 docker compose
docker-compose -f docker-compose.images.yml up -d

服务启动后,在浏览器打开 http://localhost:8088 即可访问 AIG 的 Web 界面。

方式二:pip 安装 aig-skill-scan 命令行工具

如果只需要审计 Agent Skill 安全,可以单独安装轻量 CLI,适合嵌入企业 CI/CD 流水线,漏洞分类对齐 SkillTrustBench T01–T09 标准:

pip install aig-skill-scan

# 通过环境变量配置 API Key
export LLM_API_KEY="your-api-key"

# 扫描本地 Skill 项目目录
aig-skill-scan --repo /path/to/your/skill \
           -m deepseek-v4-flash \
           --language en \
           -o result.json

方式三:从源码运行模型与 API 中继检查器

检查器前端需单独部署。Docker 部署后,检查器 API 可通过 GET /api/v1/relay/modelsPOST /api/v1/relay/check/stream 访问,API 文档位于 http://127.0.0.1:8088/api-checker/docs。从源码运行的方式如下:

python3 -m venv services/api_checker/.venv
services/api_checker/.venv/bin/pip install -r services/api_checker/requirements.txt
go build -o ai-infra-guard ./cmd/cli/main.go

export AIG_API_CHECKER_PYTHON="$PWD/services/api_checker/.venv/bin/python"
./ai-infra-guard api-checker list
./ai-infra-guard api-checker audit

另外,OpenClaw 用户还可以在对话中直接调用 aig-scanner 技能发起扫描:

clawhub install aig-scanner

安装后将 AIG_BASE_URL 配置为正在运行的 AIG 服务地址即可,细节见 aig-scanner 的 README。

想体验更完整的能力,也可以申请在线专业版(https://aigsec.ai/ ),专业版采用邀请码机制,优先发放给提交过 Issue、PR 或积极参与社区讨论的贡献者。

使用指南:三类典型扫描任务怎么配置

AI 基础设施漏洞扫描:目标该填什么

这里的目标是指**正在运行的 AI 服务的网络地址**,而不是 GitHub 仓库地址或源码路径——AIG 会连接在线服务做指纹识别,再与已知 CVE 库比对。

场景 示例目标
本地运行的 vLLM 实例 http://127.0.0.1:8000
局域网内的 Ollama 服务器 http://192.168.1.100:11434
内网暴露的 ComfyUI 实例 http://10.0.0.5:8188
多台主机批量扫描(每行一个) 192.168.1.0/24(CIDR)、10.0.0.1-10.0.0.20(范围)

以扫描本地 vLLM 为例,完整流程是:

  1. 正常启动 vLLM(例如 python -m vllm.entrypoints.api_server --model meta-llama/...);
  2. 在 AIG Web UI 中点击「AI 基础设施安全扫描 / AI Infra Scan」;
  3. 填入 http://127.0.0.1:8000(或 vLLM 实际监听的 IP 与端口);
  4. 点击「开始扫描」,AIG 会对服务做指纹识别并与 2000 多个已知 CVE 比对;
  5. 查看报告:组件版本、命中的漏洞、严重级别与修复链接。

想专门检测 vLLM 每日构建版本,只需运行对应 nightly 构建并把 AIG 指向它的地址,扫描器会自动识别版本。

AI基础设施安全扫描任务配置

MCP 服务器与代理技能扫描

支持两种输入方式:直接粘贴远程 URL(例如 https://github.com/user/mcp-server ),或上传本地源码压缩包,无需目标处于运行状态

MCP服务器安全扫描报告

越狱评估

在「设置 → 模型配置」中填入目标大模型的 API 端点(Base URL + API Key),然后选择数据集即可发起评估,评估报告支持跨模型横向对比。

越狱评估与模型安全对比

应用场景:哪些团队适合用AI-Infra-Guard

  • AI 基础设施运维团队:定期扫描内网中的 Ollama、vLLM、ComfyUI 等组件,及时发现已知 CVE 与不安全配置。
  • AI Agent 开发者:上线前对 Dify、Coze 等平台搭建的 Agent 工作流做安全评估,防范技能投毒与工具劫持。
  • MCP 生态开发者与安全研究人员:对 MCP 服务器和代理技能做源码级审计,14 类风险规则开箱即用。
  • 模型采购与合规团队:用模型指纹识别与中继黑盒审计验证第三方 API 中转是否替换了模型、植入了后门。
  • CI/CD 安全卡点:通过 aig-skill-scan 等独立 CLI 把 Skill 安全审计接入流水线,实现自动化拦截。

参与贡献:插件化的规则生态

AIG 的可扩展插件框架是整个架构的基石,社区贡献规则的路径非常清晰:

  • 指纹规则:向 data/fingerprints/ 目录提交新的 YAML 指纹文件;
  • 漏洞规则:向 data/vuln/ 目录提交新的漏洞扫描规则;
  • MCP 插件:向 data/mcp/ 目录提交新的 MCP 安全扫描规则;
  • 越狱评估数据集:向 data/eval 目录提交新的评估数据集。

参考现有规则格式新建文件,通过 Pull Request 提交即可。

总结

面对 AI 基础设施漏洞、Agent 技能投毒、MCP 安全缺陷和提示词越狱这些新型风险,AI-Infra-Guard 用一个平台把检测、评估、审计串了起来,而且完全开源、支持 Docker 一键部署。无论是个人开发者做安全自检,还是企业团队搭建 AI 安全基线,这款腾讯朱雀实验室出品的 AI 红队演练平台都值得放进工具箱。

收藏 0
评论
博主关闭了评论
友情链接