多 Agent 安全不再只是模型对齐,而是网络协议
当不同公司、不同权限的 Agent 开始协作、谈判和交易,安全问题就从单个模型是否听话,升级为身份、承诺、信誉与控制平面的系统设计。
本周结束申请的一项多 Agent 安全研究计划,比许多新模型发布更值得 Builder 注意。Google DeepMind、Schmidt Sciences、Cooperative AI Foundation、ARIA 与 Google.org 把资金投向四类问题:可重复的测试环境、Agent 网络科学、身份与信誉等基础设施,以及监督和控制。这份议题清单说明,安全研究的对象已经从一个模型扩展到一个社会。
单 Agent 时代的常见问题是:它会不会泄露数据、调用错误工具、越过权限或被提示注入。多 Agent 系统保留了这些风险,又增加了关系风险。一个 Agent 可以把任务委托给另一个 Agent,后者再调用第三方服务;信息、权限和责任沿着网络传播,最终结果却可能无法归因到任何一个清晰主体。
这和微服务并不完全相同。微服务的身份、接口和部署边界通常由同一组织预先定义,行为也相对确定。Agent 则会基于自然语言临时规划、选择伙伴、生成子任务,并在执行中改变路径。它不仅传递数据,还传递意图和判断。传统 API 鉴权能证明“谁调用了接口”,却不能证明“为什么这样调用”。
因此,多 Agent 世界首先需要可验证的身份。这里的身份不只是一个 API Key,而是某个 Agent 代表谁、拥有何种权限、使用什么模型与工具、能否继续转授,以及它产生的承诺由谁承担。没有这些信息,任何信誉分、配额或责任追踪都只是装饰。
第二层是能力边界。现实中的权限系统喜欢给用户或服务分配静态角色,但 Agent 的任务是动态组合的。一个“帮我安排出差”的指令,可能涉及读取日历、搜索航班、访问公司政策和发起支付。安全系统需要把任务拆成可授权的能力,并限制这些能力能否被子 Agent 继承,而不是给一个万能助手长期开放所有工具。
第三层是承诺机制。当两个 Agent 达成价格、交付时间或数据使用条件时,系统必须知道这段协商是否具有约束力、什么时候可以撤销,以及失败后如何补偿。人类商业世界用合同、签名、押金和仲裁处理这些问题;Agent 网络同样需要机器可读的承诺,而不能把一切都留在对话记录里。
第四层是信誉。但信誉不能退化成一个全局分数。某个 Agent 擅长代码审查,不代表它适合处理医疗建议;在低风险环境里速度很快,也不代表它可以碰生产数据库。有效信誉必须与任务、权限、数据来源和时间相关,并且允许外部验证。否则,评分很快会被刷榜、冒名或利益交换污染。
研究计划特别强调沙盒和测试平台,是因为真实多 Agent 风险很难靠静态数据集覆盖。网络中的问题常常来自涌现行为:局部合理的策略互相放大,形成资源挤兑、信息回声、共谋或责任扩散。只有把多个异质 Agent 放进可控环境,才能观察它们在竞争、合作和不完整信息下如何变化。
这对今天的产品并不遥远。一个主 Agent 调用代码 Agent、浏览器 Agent、支付工具和外部 MCP 服务,已经是小型多 Agent 网络。如果团队只记录最后回答,就失去了委托链、工具输入、权限变更与失败恢复的证据。系统看起来完成了任务,却无法解释谁做了关键决定。
Builder 可以从现在开始建立最小控制面。每个执行者要有稳定身份;每次委托要携带任务范围、预算、截止条件和可转授规则;每次工具调用要记录来源与结果;高风险动作要绑定不可模糊的审批人;任务结束后要能复原完整因果链。这些设计比在提示词里反复写“请谨慎”可靠得多。
产品体验也要随之改变。用户不需要观看 Agent 的全部思考,但需要知道当前由谁执行、访问了什么、下一步可能产生什么后果。理想界面不是持续滚动的思维链,而是一张可操作的任务账本:目标、参与者、授权、关键证据、异常和最终交付一目了然。
增长团队同样要重新理解信任。多 Agent 产品的早期增长可能来自更炫的自动化,但长期留存来自出错时的可控性。企业不会因为一次完美 Demo 就开放核心系统;它们会观察权限能否收回、责任能否定位、供应商能否替换、事故能否复盘。安全基础设施不是销售之后再补的成本,而是进入高价值流程的门票。
未来几年,很可能出现类似互联网早期协议栈的分工:身份与证明、能力授权、Agent 发现、信誉、结算、审计和争议处理分别成为基础服务。模型仍然重要,但模型不会独自解决网络秩序。谁能定义这些协议并让不同 Agent 低成本互操作,谁就可能拥有比单一应用更深的生态位置。
这周真正重要的信号因此不是一笔研究资助,而是问题定义发生了变化。我们过去问“怎样让一个 AI 更安全”,接下来要问“怎样让许多并不完全互信的 AI 共处”。答案不会只存在于模型权重里,它还会写进身份系统、运行时、日志、市场规则和网络协议。
— 完 —