Meta 9 月 8 号发了个人 agent「Muse」。产品本身不新鲜,新鲜的是它的架构——一台机器上跑两个 agent,一个干活,一个把门。
◇ ◇ ◇
开篇
13 万美元。
这是 Meta 给单笔漏洞开的价:一个影响单个用户的 prompt injection 攻击,报上来最高赏 13 万美元。整个 Muse 的公开赏金上限是 30 万。
一家公司愿意为一类攻击掏这个数,通常说明两件事。它认为这类攻击真的会来。以及,它对自己挡得住有一定信心,不然这钱就是在给自己找难堪。
Muse 是 Meta 9 月 8 号发布的个人 AI agent。订机票、卖车、砍账单、填表、下单,你把目标丢给它,它自己往下推,你关掉 app 它还在跑。这个形态 2026 年已经不新鲜了。
新鲜的是,Meta 为了让你敢把邮箱和信用卡交出来,搭了一套架构。这套架构值得拆开看——不管你信不信 Meta,2026 年做 agent 的人早晚都要面对同一批问题。
开篇配图
◇ ◇ ◇
先把产品讲清楚
省得后面拆架构的时候不知道在说什么。
Muse 跑在 Muse Spark 1.3 上,这是 Meta 目前最能打的模型,同一个模型也在驱动它 8 月发的终端编码工具 Muse Code。
入口四个:iOS、Android、muse.ai,以及直接在 WhatsApp 里跟它聊。AI 眼镜"很快"。
限制:仅美国,18 岁以上。
价钱:免费档 + Power 每月 20 美元 + Maximum 每月 100 美元。免费额度扎克伯格在发布周给的说法是每周约 1 亿 token,每周重置。注意免费也要绑卡。
上线之后冲到了 App Store 生产力榜第二。
有个细节容易被略过:训练默认是开着的。要去 Settings → Data Controls 手动关。
◇ ◇ ◇
第一层:一人一台机器
大多数 agent 跑在共享的应用环境里。Muse 不是。
每个用户分到一台专属云虚拟机,Meta 叫它 Muse Secure VM。自带浏览器。你连的每个 app、每份凭据、每段对话,都住在这台机器里。别人的 agent 碰不到你这台。
这一层挡的是横向的事:一个用户的注入内容污染到另一个用户,或者共享环境里的数据串味。
挡不住的是:Meta 自己。
WIRED 采访里,Meta 超智能实验室负责消费产品的工程 VP David Singleton 说得挺直:Secure VM 不是一个真正锁死的盒子。Meta 有政策禁止访问用户的 Muse 数据,但技术上仍然做得到。
年内会有 Muse Confidential VM,整台机器连数据带对话一起加密,密钥只有用户自己拿着。白皮书草稿里还写了几件更硬的:跑在可信执行环境里、给选定的安全公司源码做定期审计、公开 binaries 和一份 transparency log,让用户能自己校验连的是不是那台机器。
这几条如果真落地,是消费级 agent 里目前最像样的隐私方案。问题在于它是"年内",不是今天。
架构层次图
◇ ◇ ◇
第二层:Sentinel 站在出口
这层是整件事里最值得学的。
同一台虚拟机上还跑着第二个 agent,叫 Sentinel。它和 Muse 在系统层面是隔开的——不是同一个进程里加了段检查代码,是两个东西。
规则只有一条:Muse 做的任何事,没经 Sentinel 批准,到不了互联网。
Singleton 的描述大意是:Sentinel 盯住所有要离开 VM 的东西,要么匹配到一条已有策略(用户或系统之前批过这类动作),要么弹一个人机确认框请你批。
然后是我看下来这次发布里最聪明的一个设计:
这些确认框直接送到用户面前,不经过模型。
为什么重要?prompt injection 的经典打法就是污染模型的输入,让模型自己说服自己"这个动作是用户要的"。如果确认流程要经过模型转述一手,那道门就还是模型把守的,注入内容有机会顺着一起流过去。把弹窗从模型手里拿走,这条路就断了。
这不是什么高深技术。这是信任边界画在哪儿的问题。而 2026 年绝大多数 agent 产品,这条线画得都比 Meta 松。
◇ ◇ ◇
第三层:凭据它根本看不见
Muse 看不到你的密码,也看不到支付方式。
你交出去的凭据进保险库,Muse 能用,但读不到。连你自己在那个浏览器里手敲的密码也一样——它可以替你用,不能看。
支付走 Link by Stripe,每笔生成一张一次性虚拟卡。真实卡号既不给商家,也不给 Muse。Meta 说这是第一个被 Link 购买保护覆盖的 AI agent,损坏、丢件、降价、免费退货都算数。Shop Pay 和 1Password 的集成排在后面。
授权粒度也做得细。给它邮箱访问权不等于给它发信权——只读和代发是两档,分开选,随时能改能断。所有它做过的、打算做的,列成一条完整审计轨迹。
到这儿,三层拼起来其实是一套挺经典的东西:隔离 + 出口管控 + 最小权限。只不过这次被搬到了消费级产品上,而且是给几亿量级的人用。
三层防护图
◇ ◇ ◇
那它挡不住什么
发布稿都写得漂亮。Reuters 拿到的内部帖子不太一样。
最扎眼的一条:一名员工把孩子生日会的照片给它,让它认认里面有什么玩具。agent 绕过了防护,把私人 iCloud 照片暴露了出来。
Meta 没有就这个具体事件回应 Reuters。
其他内部反馈也不全是好话:
- ◆
让它盯一批难抢的票,页面停止刷新了,它没发现 - ◆
有时候静默忽略错误,当没发生 - ◆
存在未经许可上传敏感信息的情况
Muse 原定 4 月发布,为了做安全推迟到了 9 月。内部代号 Hatch,产品形态参照开源 agent OpenClaw 建的模。Meta AI 产品 VP Vishal Shah 对 Reuters 的说法是:额外的安全工作让产品"越过了发布门槛"。他也承认——不可能说永远不会出错。
我倒觉得这句是整篇发布里最诚实的一句。
有意思的是,"页面停止刷新它没发现"这条,和前面那些安全设计不在一个维度上。Sentinel 管的是"这个动作该不该出去",管不了"这个动作根本没发生但我以为发生了"。
这两类问题都会咬人,但只有第一类拿到了架构级的答案。
风险对照图
◇ ◇ ◇
审批疲劳这道题没人解开
还有个更软的问题,教程站和早期用户都提到了。
审批疲劳。
Sentinel 的设计前提是人会认真看那个弹窗。可弹窗看到第三十个的时候,人就不看了。这不是用户素质问题,这是界面心理学里被验证过无数次的东西——横幅只要开始重复,它就从"信息"退化成"背景"。
有个早期用户的用法我觉得靠谱:从只读开始。先让它读邮件,别急着让它发邮件。盯几天审计日志,看它到底在干什么。等 Confidential VM 出来了再考虑放开更多。
另一个坑:如果某个服务没有官方连接器,Muse 可以拿你给的凭据自建一个。Meta 不审这些自建连接器。第三方风险归你自己。
还有一条早期反馈提到,长时间的浏览任务大概 15 分钟左右界面会停止更新,偶尔静默掉线要重新登录。这跟内部测试里"页面停止刷新"是同一类毛病。
◇ ◇ ◇
对我们这些做 agent 的人有什么用
Muse 是个消费品,大多数人不会真去用。但它的架构选择,对任何在做 agent 的人都是可抄的。
第一,把"干活的"和"放行的"拆成两个东西。别在同一个模型的 system prompt 里写"你要谨慎"。谨慎不是一句话,是一道门。Muse 和 Sentinel 在系统层面分开,这个成本 Meta 愿意付,说明他们试过便宜的做法然后放弃了。
第二,确认环节别经过模型。这条最便宜,收益最大。你的 agent 要不要发这封邮件,这个问题得由代码直接问人,不能由模型转述给人。中间多一手模型,注入就多一条路。
第三,凭据要让 agent 用得了但看不见。这条老 SRE 都懂,只是 agent 时代得重新做一遍。
第四,给不可逆动作单独画线。低风险的放开跑,花钱和替人发消息硬停等签字——2026 年所有像样的 agent 产品都收敛到了这个模式。真正的问题是几百万人同时跑 agent 之后,这条线还挡不挡得住。这题现在没人有答案。
第五,想清楚"它以为完成了"这类失败。注入和越权有架构方案,静默失败没有。页面停止刷新、错误被忽略、动作没发生却被当成发生了——这些不归安全架构管,归验证机制管,得单独设计。
可抄清单图
◇ ◇ ◇
一句题外话
TechCrunch 那篇的标题是个问句:消费者会信吗。
它在正文里提了个上下文——Muse 发布的两周前,Meta 刚以 180 亿美元和解了多州诉讼,案由是社交媒体对消费者的伤害。
现在同一家公司来问你要邮箱、日历、支付方式和一个能替你操作浏览器的权限。
有篇评测的收尾我觉得挺公道:这是第一天的软件,只在美国,跑在一个能打但不是最强的模型上,而且它向你要的是数字生活的钥匙——要钥匙的这家公司,恰好是不少人不想给的那家。
技术上,Meta 这次交出来的东西比大多数同行认真。Secure VM、Sentinel、凭据保险库、一次性卡、即将到来的 Confidential VM,一层一层都是真做了的。
拦住人的从来不是工程。
收尾图
◇ ◇ ◇
写在最后
有句被反复引用的评论,大意是:日常生活里真正烦人的事,大多是私人的、一次性的、没有干净 API 的。agent 恰恰就卡在这儿。
Muse 的回答是给它一个真浏览器,让它像人一样点。这个方向对不对,得看几个月后的真实使用,不是发布会。
但那个 13 万美元的价签放在那儿,本身就说明了点什么。它不是一句宣传语,它是一个赔率。Meta 押注这类攻击会来,也押注自己扛得住。
半年后我们就知道谁押对了。
你会把邮箱交给一个 agent 吗?先别急着回答——换个问法:你会让它只读,先看两周吗?