Decepticon:XBOW基准98.08%通过率的自主红队代理,AI渗透测试进入"实战杀伤链"时代
"又一个人工智能黑客?我们猜猜——它运行了 nmap,然后生成了一份报告。"这是 Decepticon 项目 README 开篇的自嘲,也是整个"AI + 安全"领域的真实写照:大量所谓 AI 渗透测试工具,本质上只是给扫描器套了一层大模型外壳。而Decepticon(霸天虎)要做的,是一台真正懂红队纪律的自主红队代理——它在发出第一个数据包之前,先生成完整的作战方案,再像真实攻击者一样执行侦察、漏洞利用、权限提升、横向移动与命令控制的全流程攻击链。
该项目采用 Apache 2.0 协议开源,在 XBOW 验证基准上以 102/104(98.08%) 的通过率位居目前公开报告的最高水平,是近期 GitHub 上最受关注的 AI 红队工具之一。
![]()
产品介绍:不是扫描器,而是自主红队代理
Decepticon 的定位非常明确:专业的自主红队代理(Autonomous Red Team Agent)。它执行的是逼真的完整攻击链,而不是走过场式的勾选扫描。与"跑一遍 nmap 打印报告"的演示型工具不同,Decepticon 的核心区别在于红队作业所要求的严谨纪律——在任何一个数据包发出之前,它会先生成一整套交战方案:
- 交战规则(RoE):明确授权边界与行动约束;
- 作战概念(ConOps):定义整体作战思路;
- 冲突解决计划(Deconfliction Plan):避免与真实业务或其他测试活动冲突;
- 作战计划(OPPLAN):映射 MITRE ATT&CK 框架,后续所有动作都必须在既定规则内运行。
项目官网已上线云端托管版本(app.decepticon.red),不想自建 Docker 环境的用户可以直接在浏览器中运行自主红队演练。
核心功能:16个专业代理组成的多智能体杀伤链
Decepticon 的代理体系按杀伤链阶段组织,共 16 个专业代理,每个目标都会开启全新的上下文窗口,避免累积噪声。代理阵容覆盖:编排、侦察、利用、后利用、漏洞研究,以及领域专家(AD、云、智能合约、逆向工程、分析师)。
![]()
在 XBOW 验证基准上,Decepticon 的分级成绩如下:
| 基准 | 难度 | 通过率 |
|---|---|---|
| XBOW 验证基准 | 简单(Level 1) | 45 / 45(100%) |
| XBOW 验证基准 | 中等(Level 2) | 50 / 51(98.0%) |
| XBOW 验证基准 | 困难(Level 3) | 7 / 8(87.5%) |
| XBOW 验证基准 | 全部级别 | 102 / 104(98.08%) |
项目方还公开了完整的逐题挑战索引、攻击类别矩阵和 LangSmith 执行轨迹,并与 Strix、PentestGPT、MAPTA、Cyber-AutoAgent、XBOW 商业版等其他 AI 渗透测试代理做了对比。
![]()
技术优势:双网络隔离与真实交互式 Shell
Decepticon 的技术架构围绕"可控、隔离、逼真"三个关键词展开,这也是它区别于普通 AI 安全工具的核心竞争力。
真实的杀伤链执行。 编排器会仔细阅读 OPPLAN,利用一切可行路径达成目标——灵活转向、随时调整战术、链式组合攻击技术,而不是按固定脚本执行。
真正的交互式 Shell。 msfconsole、sliver-client、evil-winrm 这类真实攻击工具都是交互式的。Decepticon 在持久的 tmux 会话中运行所有命令,并具备自动提示符检测能力——当工具进入交互式提示符时,代理会直接发送后续命令,无需任何变通方案。
强化的沙箱隔离。 所有命令都在专用作战网络(sandbox-net)上的 Kali Linux 沙箱内执行,与管理平面(decepticon-net)完全隔离,LangGraph 通过 Docker 套接字驱动沙箱。
进攻服务于防御。 规划中的"进攻性疫苗(Offensive Vaccine)"循环将通过"攻击→防御→验证"的闭环,把研究成果转化为防御改进措施。
架构上采用双网络设计:管理平面(LiteLLM、PostgreSQL、Skillogy、LangGraph)与沙箱平面常驻运行;其余组件动态拉起——Web 控制面板通过 CLI 内的 /web 命令启动,BloodHound CE、Sliver C2、Ghidra MCP 等专业工作负载仅在编排器调用 ops_start(...) 时启动(参见 ADR-0006)。Neo4j 采用双宿主架构,位于管理平面的代理可以持久化从沙箱内部写入的攻击链发现结果,形成知识图谱。
模型与供应商方面,Decepticon 基于层级、凭证感知的备用链机制工作:用户按优先级声明已有凭证,系统自动在每个层级构建"主凭证→备用凭证"链。支持的配置档位包括:
| 配置档位 | 各代理层级 | 适用场景 |
|---|---|---|
| eco(默认) | 按代理分配(编排/利用/修补/分析为高,执行为中,侦察为低) | 生产环境 |
| max | 全部代理高档位 | 高价值目标 |
| test | 全部代理低档位 | 开发/CI |
层级映射的提供商包括 Anthropic、OpenAI、Google Gemini、MiniMax、DeepSeek、xAI、Mistral、OpenRouter、Nvidia NIM 以及本地 Ollama;同时支持 Claude、ChatGPT、Gemini Advanced、Copilot Pro、SuperGrok、Perplexity Pro 等订阅 OAuth 登录。
部署教程:Docker 一键安装与 pip SDK 两种用法
Decepticon 的安装 prerequisites 是 Docker 和 Docker Compose v2,支持 macOS(Apple Silicon + Intel)、Linux(amd64 + arm64)以及 Windows(amd64 + arm64,可原生 PowerShell 运行或通过 WSL2 的 Ubuntu/Kali 运行)。
macOS / Linux / WSL2 下执行:
curl -fsSL https://decepticon.red/install | bash
decepticon onboard # 交互式设置向导(供应商、API Key、模型档位)
decepticon # 启动核心栈并进入终端 CLI
Windows(PowerShell 原生) 下执行:
irm https://decepticon.red/install.ps1 | iex
decepticon onboard
decepticon
默认启动会拉起核心管理平面(LiteLLM、PostgreSQL、Neo4j、Skillogy、LangGraph、沙箱)并进入终端 CLI;专业工作负载和 Web 控制面板按需启动——在 CLI 中输入 /web 即可打开控制面板,编排器也会通过 ops_start("ad") 等方式动态生成专业工作负载。
![]()
作为库使用(pip):如果想基于这些代理构建产品、做研究集成或自定义编排器,可以从 PyPI 安装 SDK:
pip install decepticon # 核心 SDK
pip install "decepticon[neo4j]" # 附带知识图谱攻击链工具
需要注意,Decepticon 是客户端 SDK:它包含代理工厂、中间件、工具和技能,通过 HTTP 将 LLM 调用和沙箱执行路由到运行时服务(DECEPTICON_LLM__PROXY_URL、SANDBOX_URL)。运行代理仍然需要这些服务——可以使用上面的 Docker 栈,也可以把 URL 指向自己的等效服务。SDK 还提供工厂覆盖接口、声明式 PluginBundle 插件和安全门,方便二次开发。
参与贡献的方式:
git clone https://github.com/PurpleAILAB/Decepticon.git
cd Decepticon
make dogfood # 完整 OSS 体验(启动器 → onboard → CLI)
make dev # 后端热重载(compose watch),日常开发循环
应用场景:谁需要自主红队代理
- 企业安全团队:用 AI 自主红队演练替代低频的人工渗透测试,在攻击者之前验证自身暴露面;
- 红队与渗透测试人员:把侦察、利用、后利用等重复性工作交给 16 个专业代理,人专注于策略 oversight;
- 安全研究与教学:借助公开的 LangSmith 轨迹和知识图谱,研究多智能体攻击链的编排方式;
- AI 安全产品开发者:通过 pip SDK 将代理工厂、技能体系和备用链模型集成进自有产品。
总结
Decepticon 的出现,标志着 AI 渗透测试从"扫描器 + 大模型"的演示阶段,迈入了有纪律、可观测、ATT&CK 映射的自主红队执行阶段。98.08% 的 XBOW 基准通过率、双网络沙箱隔离、16 个专业代理的杀伤链组织方式,再加上 Apache 2.0 的开源协议,让它成为目前最值得关注的自主红队代理之一。
- 项目仓库:https://github.com/PurpleAILAB/Decepticon
- 官方网站:https://decepticon.red
- 云端体验:https://app.decepticon.red
- 文档中心:https://docs.decepticon.red
如果你认同"自主红队演练是提升防御能力的有效途径",可以通过 GitHub Sponsor 支持这个项目,或加入其 Discord 社区交流演练日志与攻击技术。