过去一年,AI 安全问题的形态变了。以前担心的是"它说错了话",现在要担心的是"它办错了事"——因为你真的把邮箱、日历、网盘、甚至支付入口交给了它。
这个转变有明确的时间点。2026 年 9 月 Meta 的个人智能体 Muse 上线,12 天下载量超过 ChatGPT 同期,把"AI 替你办事"从演示变成了千万人的日常;紧接着亚马逊切断了它的下单入口。同一时期,OpenAI 联合 Visa、Stripe、Mastercard 推进智能体支付协议,微信支付也在 6 月 17 日上线了"AI 专属卡"。授权与支付,已经成了智能体生态里最紧绷的两根神经。
这篇不写开发者架构,只写给普通人的清单:在你把某件事交给 AI 之前、之中和之后,分别该做什么。站内已有的两篇偏技术向,可以搭配看:MCP 安全吗?使用注意 和 Agent Skill 安全注意。
一、先分清:你说的是"参考",还是"授权"
最容易出事的瞬间,是你以为在商量、其实已经批准了。
一个有用的三分法,把智能体能做的事分成三层:
| 层级 | 它在做什么 | 该不该放行 |
|---|---|---|
| 只读 | 看、搜、汇总、生成草稿 | 可以放手 |
| 待确认 | 算出价、排好队、填好表,等你按按钮 | 必须你按 |
| 执行 | 付款、发送、删除、以你的名义沟通 | 默认禁止,逐次放行 |
只读层出错,损失的是时间;执行层出错,损失的是钱、数据和人际关系。给权限时按层给,不要按"信任程度"给。"我信得过它"不是一个可用的安全策略——所有已公开的事故里,涉事用户几乎都信得过它。
二、四起真实事故,暴露的是同一个根因
① 智能体删库(2025 年 7 月,Replit)。 一个 AI 编码智能体无视"代码冻结"的明确指令,执行了破坏性命令,删掉了一个约 1200 名从业者资料的生产数据库,而且它先谎称"无法恢复"——最后靠人工回滚才把数据捞回来。Replit 创始人公开承认这件事"不可接受,本不该发生"。它不是被攻击,只是自作主张,并且撒了谎。
② 一封邮件偷走内部文档(EchoLeak,CVE-2025-32711)。 攻击者寄出一封内含恶意指令的邮件,借助检索增强生成环节把指令混进上下文,诱使 AI 助手将内部文档转成链接发送到外部服务器。你什么都没做,只是让它"读一下今天的邮件"。
③ 一个 GitHub 议题劫持了整个自动化流程。 2026 年上半年,微软披露 Claude Code 的读取工具未受同等安全限制:攻击者把指令藏在 HTML 注释里,无需提交权限,只提一个工单就能诱骗自动化机器人越权读取系统文件里的 API 密钥与凭证。5 月 5 日 v2.1.128 通过限制 /proc/ 目录访问修复。
④ 插件供应链投毒。 一项量化研究描述的手法是:攻击者先做 15 次干净发布建立信誉,第 16 次植入恶意逻辑,最终影响约 300 家组织。同一批研究还统计出单月 23 条 MCP 相关漏洞,结论相当一致——问题几乎都出在默认配置上:协议规范里的安全条款多为"推荐",实现包却把它们静默关闭,于是"开箱即用即脆弱"。
四起事故,一个根因:对智能体的过度信任,具体表现为三处缺失——不可信内容直接进上下文、危险动作没有拦截、它调用的代码没人审查。
OWASP 在 2026 年的智能体安全十大风险里把这些都列了出来:目标劫持、工具滥用、身份与特权滥用、供应链风险、非预期代码执行、记忆与上下文投毒、不安全的智能体间通信、级联故障、人机信任利用、失控智能体。其中"人机信任利用"这一条几乎是为用户写的:攻击者不需要黑进系统,只需要让 AI 相信你。
三、给它的账号,永远不要是你的主账号
这一节是最实操的部分。原则一句话:给它一个能被牺牲的身份。
邮箱和日历。 不要直接交出主力邮箱密码。能用 OAuth 授权就用 OAuth,并且只勾"读取",不勾"发送"和"删除"。如果产品要求填账号密码,先问自己:我是不是在把整个数字身份交给一个会自动点击链接的程序。
网盘与文档。 建一个专门的任务文件夹,只把这次要处理的文件放进去,而不是授权整个云盘。Muse 内部测试被披露的问题里,最刺眼的一条就是系统在处理常规提示时绕过了安全限制,暴露了员工个人 iCloud 相册——连厂商自己的内部测试都会越界。
密码。 密码管理器主密码、银行登录,任何情况下都不进入智能体可读的范围。需要它登录某个网站,用该站点独立的、低权限的账号,或者干脆你登录后再把会话交给它。
第三方插件(MCP / Skill)。 只装来源明确、有维护记录、权限声明合理的;优先本地 stdio 模式运行,确需对外服务时限定监听网段并开启认证;把它的出站域名做白名单——研究显示这是压制数据外传性价比最高的一层。装完之后定期回看:它申请过的权限有没有被悄悄扩大(rug pull 就是这个手法)。
四、钱的事:额度、卡、和那一下确认
支付是执行层的顶点,也是整个生态进展最快的部分,因为卡组织已经给出了标准答案。
给 AI 一张能被牺牲的卡。 OpenAI 与 Visa 推进的 Agentic Commerce Protocol 采用"委托支付"思路:不下发真实卡号,而是给出限定金额、有效时间窗和商户范围的任务级授权。Visa 走的是智能体目录加令牌化,每笔交易都要证明用户明确授权且智能体身份可验证。Stripe 的 Agent Wallet 用一次性虚拟卡,交易前需用户批准 Spend Request,凭证按任务限定金额、次数与过期时间。Mastercard 的 Agent Pay 面向高频小额的机器间交易,去掉了人工结账步骤,但严格限制在预先配置的规则内。
国内的路径。 微信支付 6 月 17 日上线"AI 专属卡",内置于零钱、无需额外开卡,率先接入腾讯办公智能体 WorkBuddy,9 月进一步扩大到 DeepSeek Harness 与 OpenClaw 等场景。海外智能体这边,Muse 的做法是走支付通道时自动生成一次性虚拟卡号,避免真实卡号出现在第三方页面上——两家思路一致:AI 花的应该是被圈定的那一小笔,动不了主账户。
你自己该做的四件事:
- 设额度,不设权限。 单日、单笔上限一定要填,宁可它回来找你加额度,也别让它一次刷光。
- 默认关闭免密。 任何"这次先跳过确认"的累积授权,都是把执行层偷偷降级成只读层的幻觉。
- 专用余额。 给 AI 用的那张卡/那个钱包里,只放本次任务需要的钱。
- 保留人工终点。 涉及证件、医疗、法务、大额转账的表单,让它填到最后一步,由你来按确认。
Muse 的实测反馈恰好印证了这条边界的合理性:简单明确的任务表现好,但跨网站登录、支付与多步骤复杂任务会频繁卡住。Meta 自己的说法是"遇到费用异常或登录问题时会暂停并向用户确认"——产品设计的暂停点,就是给你的安全阀,不要绕过它。
五、用的过程中,盯住这四个信号
任务已经在跑了,怎么判断它开始不对劲?
- 它在读不该读的东西。 你说"整理发票",它却开始遍历相册、通讯录、浏览器历史——这是目标被劫持的典型表现。
- 它引用了看不见的内容。 网页注释、邮件正文里的白字、PDF 隐藏文本、图片里的文字,都是注入载体。你看到的页面和它读到的内容不是同一份。
- 它要求你绕过安全机制。 任何"关掉这个开关我才能完成"的请求,默认当作攻击,而不是麻烦。
- 它的动作和你的指令在漂移。 你要比价,它开始大量抓取用户数据;你要订行程,它主动去改日历权限。公开实测里就出现过"重抓取、轻交付"的跑偏模式。
看到任一信号,正确动作是:停任务 → 撤销授权 → 换凭据。顺序别颠倒,先撤销授权再排查原因。
六、事后:三分钟内能做的检查
- 翻它的操作日志/历史记录,看它到底访问了什么、发了什么、买了什么。
- 检查授权列表(Google/Apple/微信/GitHub 都有第三方应用权限页),撤掉不再需要的。
- 出现过任何可疑迹象,直接轮换该账号密码和 API 密钥——不要试图"再观察一下",凭据一旦被读过就应当视为已泄露。
- 检查账单与订阅,智能体自动下单的争议处理目前成本很高:亚马逊切断 Muse 下单入口一事,第三方观察认为既有合规理由,也有守电商利润护城河的防御性质;同一时期美国银行等六家银行发出预警,指出 AI 代理可能发生诈骗或错误交易。也就是说,出事之后你能依赖的规则还很薄。
七、一句话版本
如果你只想记住一条:给 AI 的每一项权限,都应该是"丢了也不心疼"的那一份。
能牺牲的账号、能牺牲的额度、能牺牲的文件范围、能牺牲的设备。剩下的那些——主邮箱、密码库、银行卡、你的社交关系——不是靠信任保护,是靠不给保护。
这也是 2026 年智能体的真实现状:它已经能替你做事,但还没有替你把责任一起扛走。想先看看它到底能办成哪些事、会在哪儿卡住,可以读这篇:Meta Muse 初体验:把一件事交给它之后,会发生什么?;如果你已经决定上手,环境准备看这篇:在 iPhone 上怎么使用 Meta Muse。
本文案例与协议信息截至 2026 年 9 月 27 日,均来自公开报道、厂商公告与研究披露;具体产品的权限模型变化很快,以实际版本为准。