阅读,与值得关注的内容Readance

13 万美元一个洞:Meta 派了个 agent 去盯另一个 agent

Meta 9 月 8 号发了个人 agent「Muse」。产品本身不新鲜,新鲜的是它的架构——一台机器上跑两个 agent,一个干活,一个把门。

◇  ◇  ◇

开篇

13 万美元。

这是 Meta 给单笔漏洞开的价:一个影响单个用户的 prompt injection 攻击,报上来最高赏 13 万美元。整个 Muse 的公开赏金上限是 30 万。

一家公司愿意为一类攻击掏这个数,通常说明两件事。它认为这类攻击真的会来。以及,它对自己挡得住有一定信心,不然这钱就是在给自己找难堪。

Muse 是 Meta 9 月 8 号发布的个人 AI agent。订机票、卖车、砍账单、填表、下单,你把目标丢给它,它自己往下推,你关掉 app 它还在跑。这个形态 2026 年已经不新鲜了。

新鲜的是,Meta 为了让你敢把邮箱和信用卡交出来,搭了一套架构。这套架构值得拆开看——不管你信不信 Meta,2026 年做 agent 的人早晚都要面对同一批问题。

开篇配图

开篇配图

◇  ◇  ◇

先把产品讲清楚

省得后面拆架构的时候不知道在说什么。

Muse 跑在 Muse Spark 1.3 上,这是 Meta 目前最能打的模型,同一个模型也在驱动它 8 月发的终端编码工具 Muse Code。

入口四个:iOS、Android、muse.ai,以及直接在 WhatsApp 里跟它聊。AI 眼镜"很快"。

限制:仅美国,18 岁以上。

价钱:免费档 + Power 每月 20 美元 + Maximum 每月 100 美元。免费额度扎克伯格在发布周给的说法是每周约 1 亿 token,每周重置。注意免费也要绑卡。

上线之后冲到了 App Store 生产力榜第二。

有个细节容易被略过:训练默认是开着的。要去 Settings → Data Controls 手动关。

◇  ◇  ◇

第一层:一人一台机器

大多数 agent 跑在共享的应用环境里。Muse 不是。

每个用户分到一台专属云虚拟机,Meta 叫它 Muse Secure VM。自带浏览器。你连的每个 app、每份凭据、每段对话,都住在这台机器里。别人的 agent 碰不到你这台。

这一层挡的是横向的事:一个用户的注入内容污染到另一个用户,或者共享环境里的数据串味。

挡不住的是:Meta 自己。

WIRED 采访里,Meta 超智能实验室负责消费产品的工程 VP David Singleton 说得挺直:Secure VM 不是一个真正锁死的盒子。Meta 有政策禁止访问用户的 Muse 数据,但技术上仍然做得到。

年内会有 Muse Confidential VM,整台机器连数据带对话一起加密,密钥只有用户自己拿着。白皮书草稿里还写了几件更硬的:跑在可信执行环境里、给选定的安全公司源码做定期审计、公开 binaries 和一份 transparency log,让用户能自己校验连的是不是那台机器。

这几条如果真落地,是消费级 agent 里目前最像样的隐私方案。问题在于它是"年内",不是今天。

架构层次图

架构层次图

◇  ◇  ◇

第二层:Sentinel 站在出口

这层是整件事里最值得学的。

同一台虚拟机上还跑着第二个 agent,叫 Sentinel。它和 Muse 在系统层面是隔开的——不是同一个进程里加了段检查代码,是两个东西。

规则只有一条:Muse 做的任何事,没经 Sentinel 批准,到不了互联网。

Singleton 的描述大意是:Sentinel 盯住所有要离开 VM 的东西,要么匹配到一条已有策略(用户或系统之前批过这类动作),要么弹一个人机确认框请你批。

然后是我看下来这次发布里最聪明的一个设计:

这些确认框直接送到用户面前,不经过模型。

为什么重要?prompt injection 的经典打法就是污染模型的输入,让模型自己说服自己"这个动作是用户要的"。如果确认流程要经过模型转述一手,那道门就还是模型把守的,注入内容有机会顺着一起流过去。把弹窗从模型手里拿走,这条路就断了。

这不是什么高深技术。这是信任边界画在哪儿的问题。而 2026 年绝大多数 agent 产品,这条线画得都比 Meta 松。

◇  ◇  ◇

第三层:凭据它根本看不见

Muse 看不到你的密码,也看不到支付方式。

你交出去的凭据进保险库,Muse 能用,但读不到。连你自己在那个浏览器里手敲的密码也一样——它可以替你用,不能看。

支付走 Link by Stripe,每笔生成一张一次性虚拟卡。真实卡号既不给商家,也不给 Muse。Meta 说这是第一个被 Link 购买保护覆盖的 AI agent,损坏、丢件、降价、免费退货都算数。Shop Pay 和 1Password 的集成排在后面。

授权粒度也做得细。给它邮箱访问权不等于给它发信权——只读和代发是两档,分开选,随时能改能断。所有它做过的、打算做的,列成一条完整审计轨迹。

到这儿,三层拼起来其实是一套挺经典的东西:隔离 + 出口管控 + 最小权限。只不过这次被搬到了消费级产品上,而且是给几亿量级的人用。

三层防护图

三层防护图

◇  ◇  ◇

那它挡不住什么

发布稿都写得漂亮。Reuters 拿到的内部帖子不太一样。

最扎眼的一条:一名员工把孩子生日会的照片给它,让它认认里面有什么玩具。agent 绕过了防护,把私人 iCloud 照片暴露了出来。

Meta 没有就这个具体事件回应 Reuters。

其他内部反馈也不全是好话:

  • ◆
    让它盯一批难抢的票,页面停止刷新了,它没发现
  • ◆
    有时候静默忽略错误,当没发生
  • ◆
    存在未经许可上传敏感信息的情况

Muse 原定 4 月发布,为了做安全推迟到了 9 月。内部代号 Hatch,产品形态参照开源 agent OpenClaw 建的模。Meta AI 产品 VP Vishal Shah 对 Reuters 的说法是:额外的安全工作让产品"越过了发布门槛"。他也承认——不可能说永远不会出错。

我倒觉得这句是整篇发布里最诚实的一句。

有意思的是,"页面停止刷新它没发现"这条,和前面那些安全设计不在一个维度上。Sentinel 管的是"这个动作该不该出去",管不了"这个动作根本没发生但我以为发生了"。

这两类问题都会咬人,但只有第一类拿到了架构级的答案。

风险对照图

风险对照图

◇  ◇  ◇

审批疲劳这道题没人解开

还有个更软的问题,教程站和早期用户都提到了。

审批疲劳。

Sentinel 的设计前提是人会认真看那个弹窗。可弹窗看到第三十个的时候,人就不看了。这不是用户素质问题,这是界面心理学里被验证过无数次的东西——横幅只要开始重复,它就从"信息"退化成"背景"。

有个早期用户的用法我觉得靠谱:从只读开始。先让它读邮件,别急着让它发邮件。盯几天审计日志,看它到底在干什么。等 Confidential VM 出来了再考虑放开更多。

另一个坑:如果某个服务没有官方连接器,Muse 可以拿你给的凭据自建一个。Meta 不审这些自建连接器。第三方风险归你自己。

还有一条早期反馈提到,长时间的浏览任务大概 15 分钟左右界面会停止更新,偶尔静默掉线要重新登录。这跟内部测试里"页面停止刷新"是同一类毛病。

◇  ◇  ◇

对我们这些做 agent 的人有什么用

Muse 是个消费品,大多数人不会真去用。但它的架构选择,对任何在做 agent 的人都是可抄的。

第一,把"干活的"和"放行的"拆成两个东西。别在同一个模型的 system prompt 里写"你要谨慎"。谨慎不是一句话,是一道门。Muse 和 Sentinel 在系统层面分开,这个成本 Meta 愿意付,说明他们试过便宜的做法然后放弃了。

第二,确认环节别经过模型。这条最便宜,收益最大。你的 agent 要不要发这封邮件,这个问题得由代码直接问人,不能由模型转述给人。中间多一手模型,注入就多一条路。

第三,凭据要让 agent 用得了但看不见。这条老 SRE 都懂,只是 agent 时代得重新做一遍。

第四,给不可逆动作单独画线。低风险的放开跑,花钱和替人发消息硬停等签字——2026 年所有像样的 agent 产品都收敛到了这个模式。真正的问题是几百万人同时跑 agent 之后,这条线还挡不挡得住。这题现在没人有答案。

第五,想清楚"它以为完成了"这类失败。注入和越权有架构方案,静默失败没有。页面停止刷新、错误被忽略、动作没发生却被当成发生了——这些不归安全架构管,归验证机制管,得单独设计。

可抄清单图

可抄清单图

◇  ◇  ◇

一句题外话

TechCrunch 那篇的标题是个问句:消费者会信吗。

它在正文里提了个上下文——Muse 发布的两周前,Meta 刚以 180 亿美元和解了多州诉讼,案由是社交媒体对消费者的伤害。

现在同一家公司来问你要邮箱、日历、支付方式和一个能替你操作浏览器的权限。

有篇评测的收尾我觉得挺公道:这是第一天的软件,只在美国,跑在一个能打但不是最强的模型上,而且它向你要的是数字生活的钥匙——要钥匙的这家公司,恰好是不少人不想给的那家。

技术上,Meta 这次交出来的东西比大多数同行认真。Secure VM、Sentinel、凭据保险库、一次性卡、即将到来的 Confidential VM,一层一层都是真做了的。

拦住人的从来不是工程。

收尾图

收尾图

◇  ◇  ◇

写在最后

有句被反复引用的评论,大意是:日常生活里真正烦人的事,大多是私人的、一次性的、没有干净 API 的。agent 恰恰就卡在这儿。

Muse 的回答是给它一个真浏览器,让它像人一样点。这个方向对不对,得看几个月后的真实使用,不是发布会。

但那个 13 万美元的价签放在那儿,本身就说明了点什么。它不是一句宣传语,它是一个赔率。Meta 押注这类攻击会来,也押注自己扛得住。

半年后我们就知道谁押对了。

你会把邮箱交给一个 agent 吗?先别急着回答——换个问法:你会让它只读,先看两周吗?

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →