授权智能体的工作流步骤,而非仅仅其身份
2026 年 7 月的一篇论文指出:认证智能体的身份,并不等于授权它执行的那一步——身份合法的智能体仍可能被劫持去执行违背意图的动作。对策是在智能体与特权工具之间设置治理平面。
这是什么?
2026 年 7 月 20 日,一组研究者在 arXiv(cs.CR 密码学与安全类别)发布了一篇论文,重新界定了大多数智能体架构处理不当的一个问题。作者指出,随着企业与政府系统演变为”以语言为基础、会调用工具、且日益自主的基础设施”,沿袭自经典密钥管理的安全模型已不再适用。传统的密钥管理服务认证的是谁有权调用某个密码学原语:它校验身份,然后交出能力。它不做的,是在运行时判定一个已认证的调用方被授权执行哪一个工作流步骤。危险恰恰出在这里:一个通过了所有身份校验的智能体,仍可能通过直接或间接的提示注入被引导去执行某个对其身份完全合法、却违背用户真实意图的动作。论文的贡献是一种意图弥合该缺口的设计——在模型与它可触及的特权工具之间放置一层治理。
工作原理
核心观察是一个在智能体设计中很容易被模糊的区分:认证不等于授权,而按智能体的授权也不等于按步骤的授权。
大多数已部署的智能体把权限绑定到身份。智能体(或其服务账户)持有令牌、API 密钥或签名能力;一旦智能体通过认证,它发出的任何动作都继承该权限。是模型本身根据它读取的自然语言上下文——用户消息、检索到的文档、工具输出、智能体间消息——来决定调用哪个工具、传入什么参数。由于该上下文正是攻击者在提示注入攻击中所控制的通道,行动的决策可能被污染,而用于行动的凭据却依然完全合法。身份校验通过了,意图却被背叛。任何”你是谁”式的校验都无法区分二者。
论文提出的答案称为 Neural Cryptographic Services(NCS)——被描述为一个主动的安全治理平面,采用神经-符号(neural-symbolic)设计,插入在 LLM 智能体与它们调用的特权工具之间。抛开具体实现,值得记住的思路是架构性的:权限应绑定到步骤——某个具体动作、处于某个具体工作流中、且与用户所表达的意图一致——而不是绑定到智能体的持久身份。一个对每次特权调用进行中介的控制点,可以评估此刻是否授权这一动作,而不是假定”已认证的智能体就是可信的智能体”。这里不复现任何漏洞利用;价值在于对问题的建模以及防御的放置位置。
为何重要
这与智能体安全研究中反复以不同名称出现的失效模式如出一辙:数据流被当作权限;来自文档或工具输出的一条指令被当作用户亲手输入来执行;持有宽泛令牌的编码或浏览智能体做了越界却”符合策略”的事。论文的贡献在于清晰地命名了根因——认证层对工作流意图是无感知的——并主张修复应归属于一个专门的授权平面,而不是模型自身的判断。
它在影响半径最大的地方最为要紧:接入密钥管理、支付、云控制平面,或企业与政府后端的智能体——在这些场景中,单个”身份合法但违背意图”的动作就可能转移资金、轮换密钥或篡改记录。对这些系统而言,“智能体认证成功”并不是一条安全性质。提示注入之所以仍是 OWASP 大模型应用指南中排名最高的风险,正是因为它能在不破坏任何凭据的情况下,把一个可信、已认证的智能体变成受攻击者操控的智能体。
防御
务实的教训是:不要再把智能体的身份当作它有权行动的替代凭证。在模型与任何特权工具之间放置一个确定性的控制点,让它以工作流步骤的粒度来授权动作——而不是仅在登录时授权一次。具体而言,就是把每次特权调用绑定到一个以用户为锚点的显式意图、以及它所属的计划步骤上,并拒绝那些满足身份却不满足意图的调用——这一思路与关于动作前确定性授权和经认证的智能体工作流的并行工作相呼应。把策略执行放在模型之外:一条可以被 LLM 说服而绕过的策略不是控制。把凭据收窄到该步骤所需的最小能力与最短有效期,这样即便是”被劫持但已认证”的动作,其触及范围也很小。把检索到的文档、工具输出与智能体间消息都视为不可信输入:它们可以提议动作,但绝不能悄然授权动作。并且要记录授权决策,而不仅是工具调用,以便事后审计声明意图与实际执行动作之间的偏差。这些控制是与输入过滤、反越狱防御相组合,而非相替代:要点在于,当注入得逞时,授权平面正是横亘在被污染的决策与特权动作之间的那道屏障。
状态
| 项目 | 详情 |
|---|---|
| 贡献 | 问题界定 + 面向按步骤授权的治理平面提案 |
| 核心论断 | 认证(“谁”)不等于授权工作流步骤(“此刻做哪个动作”) |
| 威胁 | 直接/间接提示注入产生”身份合法但违背意图”的动作 |
| 提出的设计 | Neural Cryptographic Services(NCS)——介于智能体与特权工具之间的神经-符号治理平面 |
| 放置位置 | 插入在每次特权工具调用上的确定性控制点 |
| 关键日期 | 论文于 2026 年 7 月 20 日发布于 arXiv |
关键日期:论文于 2026 年 7 月 20 日在 arXiv 公布。它是一项研究提案,而非成品;持久的启示是架构性的——授权那一步,而不是那个身份。