开发者 3 秒速决决策指标
随着大模型智能体深度接入生产级操作系统、数据库与云原生工具,智能体安全问题迎来了更为隐蔽的维度:很多看似完全合法的无害操作(如执行一条简单的文本写入或删除命令),在结合了早期历史操作对系统状态(如文件权限被篡改、配置项被污染)的修改后,会突然转变为灾难性的恶意破坏。佐治亚理工等机构研究团队提出首个基于状态视角(State-Based)的工具调用智能体安全攻防统一框架 SEAD。攻击端 DART 通过将恶意目标拆解为局部看似合理的执行步骤,并利用真实工具执行反馈引导轨迹搜索,在四种主流模型上将攻击成功率提升 18.8~35.9 个百分点;而防御端 SAGE 在每个工具动作执行前,主动发起安全的只读探针(Read-Only Queries)审查底层系统关键状态,在保留 95.79% 无害正常工作流的同时,成功拦截了 92.73% 的恶意破坏路径,在在线实战对抗中将实际可执行攻击成功率由 48.0% 彻底压制至 4.0%,开源代码已全面上线。
核心要点速览 (Key Takeaways)
- ✓首创状态控制视角(State-Based Perspective):指出智能体安全不仅取决于单步提示词或动作名称,更取决于前期工具执行对系统底层状态的潜移默化变更。
- ✓DART 红队攻击搜索与真实反馈:将恶意攻击目标离散化为局部合规步骤,结合终端真实返回信息进行路径演化,在四大主流模型上提升攻击穿透力达 18.8~35.9%。
- ✓SAGE 只读探针防御与 4% 极低攻击率:在关键动作执行前自动派发安全只读查询校验状态边界,在保护 95.79% 正常业务流畅运行的同时,将真实可执行攻击成功率从 48.0% 暴降至 4.0%。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察