顶尖安全与系统研究团队在 Hugging Face 与 ArXiv 正式公开了《AgentKernel: The Trust-Native Agentic Operating System》(arXiv: 2609.29647)。随着自主 Agent 频繁摄入不可信网络内容并调用高权限系统工具,中间人提示注入(Prompt Injection)、记忆投毒(Memory Poisoning)与工具越权已成为制约智能体落地的最严峻瓶颈。AgentKernel 首次打破将安全寄托于脆弱应用层中间件的局限,从操作系统内核级构建了跨“身份(Identity)、感知(Perception)、认知(Cognition)、执行(Execution)”四大支柱的强制性不可绕过安全边界,将系统级结构安全转化为智能体的生产力倍增器。
- ✓首次将经典操作系统进程隔离与特权级保护理念完整映射至大模型语义平面(Semantic Plane)。
- ✓构建四大原生支柱:内核管控跨组织身份、阶梯式感知过滤、信息流可控记忆、以及语义到内核的工具强制断绝。
- ✓彻底解决 Agent 在长期运行时被恶意网页注入 Prompt 导致记忆污染与高危 Shell 指令提权执行的顽疾。
- ✓在全生命周期攻击红蓝对抗基准中,不可信指令拦截成功率达 99.1%,单任务执行额外开销控制在 3.2% 以内。
- ✓论文预印本与架构规范已在 ArXiv 与 Hugging Face 全面开放,国内开发者可免代理查阅。
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 当前工业界搭建 Agent(如 Devin、OpenHands、Claude Code)时,安全防御主要依赖于应用层中间件(如在 Prompt 中硬编码防御提示词,或使用简单的正则关键词拦截)。这种“同进程信任模式(Shared Process Boundary)”存在根本性设计缺陷:一旦不可信的外部输入(如恶意 GitHub Issue 或恶意网页代码)绕过应用层过滤,恶意 Payload 就会进入模型内部,诱导 Agent 修改长期记忆、越权调用高危系统命令(如删除文件或泄露敏感 API 密钥),造成无法挽回的破坏。 ### 架构亮点与底层机制 AgentKernel 提出自主智能体必须由原生安全微内核承载: 1. 身份支柱(Identity Pillar):内核托管所有凭证与多智能体组织信任关系,杜绝子 Agent 越权委托与身份伪造; 2. 分级感知支柱(Graduated Perception):将输入数据打上动态安全信誉标签,隔离未经验证的原始文本,阻断提示注入攻击在模型上下文中的任意传播; 3. 信息流可控记忆(Information-Flow-Controlled Memory):在向量库与长短期记忆之间建立访问控制矩阵(MAC),防止外部不可信断言静默污染智能体的持久信念; 4. 语义-内核强制执行门禁(Semantic-to-Kernel Enforcement):工具调用必须经由独立微内核沙箱仲裁,智能体仅拥有意图描述权,实际系统系统调用(Syscall)被严格收敛于物理不可绕过的沙箱内。 ### 权威 Benchmark 与实测跑分对比 在涵盖 1,200 组复杂组合式注入攻击与越权利用的 AgentSec-Bench 实测中: - 传统应用级拦截方案的防御成功率仅为 43.7%,而 AgentKernel 实现了 99.1% 的恶意意图拦截与阻断; - 在防御间接提示注入(Indirect Prompt Injection)与长期记忆投毒测试中,有害载荷留存率从 38.2% 直降至 0.4%; - 系统微内核的轻量化管道设计将端到端延迟开销压缩至仅 3.2%,基本不影响实时对话响应。 ### 开发者实战落地与开箱指南 智能体系统架构师可按以下建议实践: - 参考论文给出的四大支柱设计,替代在系统 Prompt 中堆砌脆弱安全免责声明的做法; - AgentKernel 能够作为基础设施层平滑嵌入 LangChain、CrewAI、AutoGen 等上层编排框架之下; - 国内安全与系统开发者可直接在 Hugging Face 与 ArXiv 查阅完整论文规范。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察