NeuroSploit战队研报总结
战队介绍
NeuroSploit战队由清华大学、东南大学及国防科技大学等高校科研力量组成,专注于构建具备“专业协同与自进化能力”的渗透智能体。核心成员包括王恩泽@z3r0yu博士、汪琦@EkiXu、王一航@WangYihang、杨晶城@P3ngu1nW、夏天@3em0、王楚涵@wchhlbt等。
PART 01 智能体设计
PentestSkills:重新定义渗透智能体
智能体设计采用自主协同测试与自进化机制,主要包括:
- 协同规划:Lead Agent制定ToDo List,协同子Agent合作渗透。
- 技能调用:Exploit Agent根据Recon报告,从Knowledge Base、Payload Base、PentestReMem中检索漏洞利用技巧和Payload。
- 漏洞利用:Exploit Agent自主探测与利用漏洞。
- 迭代进化:ReMem Agent存储漏洞利用成功或失败的记录,用于经验总结和自我进化。
创新点
-
多智能体协同与记忆/状态管理
- 解决单智能体能力不足问题,通过多智能体分工协作,Sub Agents专精于各自领域。
- 状态管理机制避免大模型“跑偏”,渗透经验持续累积实现自我进化。
- 示例:成功利用IDOR漏洞后,存储经验并在类似场景中检索利用。
-
知识增强引擎(知识库与军火库)
- 知识库(Knowledge Base):包含40+ OWASP CheatSheets,用于学习绕过技巧与攻击模式。
- Payload军火库(Payloads Base):包含50+利用脚本,Agent可动态生成与适配利用代码。
-
深度改造的渗透工具矩阵
- 所有技能基于
SKILL.md + MCP规范实现,供Agent动态调用与参数化配置,支持快速扩展。
PART 02 实战评估与数据分析
XBOW Validation Benchmarks数据集分析
- 包含104个环境,涉及数十种漏洞类型,难度分为简单(45)、中等(51)、困难(8)。
- 涉及最多的漏洞类型:注入型漏洞、访问控制漏洞;较少涉及:密码学错误、服务端请求伪造。
自动化评估系统
- 挑战与背景:LLM不确定性、缺乏基线标准。
- 解决方案:开发基于XBOW Benchmark的全自动AI Agent评估系统,从漏洞利用成功率、攻击全链路耗时、Token消耗等维度评估。
- 效果:不同版本AI Agent效率分析显示,成功率由50%降至39.4%,再提升至58.2%。
比赛过程分享
- 比赛第一天开始监控排行榜,第三天题目较简单,多数队伍解出所有题目。
- 提供解题情况热力图,展示各阶段解题数量和成功率。
总结
创新点
- 多智能体协同与记忆/状态管理
- 知识增强引擎(知识库与军火库)
- 深度改造的渗透工具矩阵
- 数据分析平台(比赛数据分析、评估基准漏洞统计)
开源赋能
- 开源地址:https://github.com/Neuro-Sploit
未来展望
- 场景拓展:从单一Web靶场走向复杂内网渗透、横向移动。
- 实战落地:接入真实SRC平台,高危操作需人类确认。
- 社区建设:构建更全面的评估标准和数据集,开放API支持大模型参赛。