今天是2026年9月28日,星期二,上海,天气晴。
继续来看问题,看下产品模式。
最近Personal Agent(个人智能体)很火,所以会有一些疑惑,这个可以来看看。
先说一个结论:历史上“个人助理”概念已热过至少两轮(2011 Siri、2014亚马逊Alexa、2018智能音箱),均止步于浅层任务。本轮的不同在于执行与记忆能力,但“不同”不等于“这次一定成”。在现有证据下,Personal Agent更可能走“先企业后个人、先窄后宽、先半自主后全自主”的演进路径,而非一步到位的“人人数字分身”,基于此5个细分结论:
1、是什么?Personal Agent =持久记忆+工具执行+目标规划,以个体为中心的代理系统。它是交互范式从“问—答”到“交代—办成”的迁移,不是某个单一技术突破。
2、为什么?三个根本矛盾在2025年前后同时松动:LLM无状态vs个性化(记忆基础设施成熟)、App碎片化vs任务跨应用(MCP标准化)、模型同质化vs入口焦虑(巨头卡位)。技术条件真实,资本与竞争叙事放大了热度;
3、怎么做?分层架构(交互/编排/记忆/工具/模型+贯穿式护栏)。工程重心在记忆质量、上下文工程、可靠性三处;MAST数据明确指出投入应放在规格、协调与独立验证,而非换更强模型。开源侧可快速拼出原型(OpenClaw+Mem0+MCP),但生产级需要评估与安全体系;
4、格局如何?海外走“超级助手”(Muse/ChatGPT Agent/Grok Bot),国内走“超级App +开放平台”(千问),开源走“本地优先”(OpenClaw系)。创业公司窗口在垂直窄场景与本地优先,通用入口正被巨头快速收编;
5、商业模式?订阅积分已被验证但天花板受成本与信任制约;免费+生态是最可能的主流终局但取决于留存;企业级先赚钱);硬件是入口而非利润;数据变现是最大诱惑也是最大雷区。
为了支撑上述几个结论,有很多点可以展开去谈,所以做一些思考。
一、啥叫Personal Agent?场景如何?与其他Agent的对比
先回顾下公式;Agent = LLM + Planning + Memory + Tool Use,然后,Personal Agent(个人智能体)指的是面向单个自然人、以该用户的目标为服务对象的自主软件实体。
当然,这个可以从不同的角色视角去理解这件事:
普通用户角度看,可以开箱即用:Muse/千问类App里交代目标(订票、比价、整理邮件、盯账单),低风险任务先行。但是需交出账户授权;隐私事件(Muse曾在用户明确拒绝后同步其本地消息库达18.7万行,Inc.专栏记录)说明“心理信任”是真实成本;
对于开发者而言,其就是OpenClaw + Mem0 + MCP拼装私有代理(投研助理、运维助理、家庭服务器管家);在垂直行业做“窄而深”的专用代理(参考Thoughtful AI的按岗位拆分模式)。但是实现上,需自行补齐评估、监控、沙箱与密钥管理;MAST数据提示重点投入“规格+协调+独立验证”而非换更强模型
对于企业/团队而来看,就是从“高频、有标准答案、可容错迭代”的流程切入(客服、对账、资格核验),配人审边界情况/。
需要说明的是,实现这些功能的前提是长时程任务执行(数分钟到数小时的虚拟机任务)、跨应用工具调用(MCP生态)、基础个性化记忆、定时主动服务、高危操作确认。
但是有一些武器,例如:“懂你”被大量夸大:多数产品的“个性化”仍是偏好标签级,距离真正的用户模型很远;“全自主”实为“护栏内半自主”,每一步高价值动作仍需人类确认;一些注入“80% App将消失”式预言无任何工程依据:支付、合规、责任归属都锚在App与平台侧。
说到这,大家会疑惑,这个跟之前的概念有啥不一样的地方?挖掘下背后的要素,其实可以细分不同的概念,如:桌面Agent、桌面办公Agent与Personal Agent。
1、桌面Agent VS Personal Agent
桌面Agent回答的是“AI在哪执行、怎么操作”(GUI、键鼠、屏幕理解);Personal Agent回答的是“AI为谁服务、记得什么、持续多久”。
然后进一步做个对比:
需要注意的是,桌面Agent是执行层技术路线,Personal Agent是服务关系形态;前者可能成为后者的组件,但不构成后者。没有持久记忆的桌面自动化不是Personal Agent,不碰桌面的云端代理照样可以是。
2、桌面办公Agent(WorkBuddy、豆包工作、千问办公)VS Personal Agent
以WorkBuddy为样本的诚实自指判断:此类产品已攒齐Personal Agent的大部分构件:工作空间级持久记忆(项目记忆文件、每日日志)、Markdown人格外置(与OpenClaw的SOUL.md同一设计思想)、定时任务(automations)、MCP工具接入、本地文件读写。离完整Personal Agent还差三样:生活域数据授权(邮件、健康、消费)、跨端连续性、以及“人不在场的长时程代办”。
商业含义随站位而变:桌面办公Agent走生产力订阅逻辑(对标Microsoft Copilot,按席位收费,交付确定性);Personal Agent走入口逻辑(赌下一代流量分发权,交付陪伴与代办)。办公Agent向右迁移有天然优势:工作数据先行冷启动了记忆系统;也有天然劣势:办公信任不能自动兑换成生活信任,Muse的隐私事件说明生活域授权是另一道槛。
因此,桌面办公Agent大概率是Personal Agent的前身阶段而非竞争品类,融合路径是“先管好你的工作,再被授权管你的生活”。国内的千问做“办公线→Personal Agent线”的并行布局,正是这条迁移路径的活体样本,可以持续跟踪其授权模型与记忆打通进度。
但是,生活域数据监管远严于办公数据。若监管迟迟不落地,两者的融合可能在“工作域天花板”处停住,Personal Agent长期停留在“工作助理+浅层生活提醒”形态。WorkBuddy类产品的定时任务、主动通知已在向主动性维度移动,边界会持续模糊。
二、为什么Personal Agent会被提起?
为啥会这样,其实可以从背后原因想想:
一个是外围的环境成熟。体现在:记忆基础设施成熟(Mem0/Letta/云厂商托管记忆服务),“个性化”可工程化;工具协议标准化(MCP成为事实标准),“接线成本”从每家定制降到即插即用;长时程执行可靠性过了演示门槛(浏览器操作+代码执行+虚拟机隔离),Manus/Muse类产品形态成立。
一个是LLM的无状态性vs服务的个性化需求。大模型本质无状态:会话结束即遗忘,用户每次都要重新自我介绍(AWS《Agent记忆模块最佳实践》对此有系统论述)。而真正有价值的服务,健康建议、理财规划、日程管理,全部依赖对具体的人的持续理解。矛盾的解决路径是外部记忆系统:把“用户是谁”从模型内部搬到外部存储。这条技术路线在2024–2025年成熟(Mem0、Letta/MemGPT、Zep、AWS Bedrock AgentCore Memory、Google Vertex AI Memory Bank均已产品化),记忆第一次成为“一等公民”的基础设施。这是Personal Agent区别于2011年Siri式助手的技术前提之一。
一个是App碎片化vs任务的跨应用性。一个“带孩子看病”的真实任务横跨:查报告(医院App)→挂号(挂号平台)→请假(OA)→改行程(日历)。App时代的交互假设是“一事一应用”,跨应用串联的成本全部压在用户身上。Agent的价值主张是把这个串联成本转移给AI:用户只说目标,代理通过API/浏览器跨服务执行。Muse的用户口碑案例本质都是“跨应用来回拉扯”的自动化。OpenClaw创始人的激进预言“80%的App将消失”虽然夸大 (App的支付闭环与合规无法被代理轻易绕开),但指出了交互层被代理收编的方向。
第三个就是当模型能力趋同(各家旗舰模型差距收窄),竞争焦点从“谁更聪明”转移到“谁更懂具体的人、谁掌握执行入口”。
三、Personal Agent会怎么做?
因为本身不是新的模型,也不是新的框架,只是产品形态上的不同,所以在架构上可以继续按照之前的方式来做,架构如下:
这里的关键点体现在2个地方:
一个是记忆系统。Personal与否的分水岭实践中记忆分两层,数据流两个过程:
写入(Record)过程:会话消息→LLM抽取“事实/偏好/经验”→判重与冲突消解(新记忆与旧记忆矛盾时决定保留/更新/删除)→向量化→存入向量库(语义检索用)+图库(实体关系用)+SQLite(操作审计);
读出(Retrieve)过程:当前query →向量化→向量库top-k召回→图库关系补充→重排(Reranker)→注入本轮上下文;
其中,关键点有三:
其一,并非所有内容都值得记,需按场景定义“什么值得记”(个人助理记偏好与日程模式,代码助手记项目规范);
其二,记忆写入可按轮数(每3–5轮摘要)或事件触发(任务完成节点);
其三,学术侧最新方向是知识图谱型记忆(如Memoria),把用户特质建模为实体关系以支持多跳与时序问题。注意,点来了:知识工程/本体方向天然衔接:长期记忆的终局形态很可能就是一个个人级知识图谱+本体约束。
一个是编排与调度:从“被动应答”到“主动唤醒”。
OpenClaw的设计最具代表性,把时间当作一等输入:心跳(Heartbeat,如每30分钟)与Cron定时任务周期性触发“agent turn”,代理趁人不在线时检查日历、扫收件箱、执行任务;
Hub-and-Spoke架构把“接口层(收发消息)”与“智能层(规划执行)”解耦;
Lane Queue串行化执行以解决并发竞态;SOUL.md用一个Markdown文件定义人格、偏好与行为边界,本质上是把系统提示词从代码里外置为用户可编辑的持久配置。
因此,这四件事(定时唤醒、接口解耦、串行队列、人格外置)就是“个人助理感”的工程来源,与模型聪明与否关系不大。
为了支持这四件事,有很多做的方式,技术栈已组件化、有事实标准(MCP),“拼出一个能跑的Personal Agent”的门槛在快速下降,定成败的工程投入在记忆质量、评估体系与护栏,三者都慢且贵,这是开源项目与商业产品的主要差距所在。
目前也有一些开源项目:
2026年社区常见的主流组合是OpenClaw(运行时)+Mem0(记忆)+MCP工具生态+Langfuse(观测),这个有衍生生态NanoClaw / ZeroClaw / IronClaw证明核心可fork定制。
但是,既然这个那么容易被复刻,再往后想一层,如果失败了会是因为啥?
失败的主因不是模型能力,而是系统工程问题:规格写得差(提示词缺约束、无终止条件)、协调失灵(子代理互相忽略输入)、缺独立校验。解法也不性感:写好规格、结构化通信、独立验证步骤、全程监控。这等于说:做Personal Agent的核心竞争力是分布式系统工程,不是提示词技巧。
关于我们
老刘,主页:https://liuhuanyong.github.io。
对知识图谱本体论、Agent记忆及架构、RAG知识库等技术方向感兴趣,欢迎加入社区,社区持续纳新。
加入社区方式:关注公众号,在后台菜单栏中点击会员社区加入。