每天挑选一期硅谷AI科技值得关注的播客,让你与前沿同频。如果你现在没空可以收藏进 晚点再听LaterCast,在通勤、走路或做家务时一篇篇轻松听完
"能帮上忙时就帮忙,不要造成伤害或打扰。"
"最主要的工作,是弄清楚用户到底想从这个功能中得到什么。"
"一次实验的成本,在于你花了多长时间才学到东西。"
Wispr用一天做出会议助手的首版,Actively用两周上线跨客户销售Agent,Pendo则让产品分析开始直接读取客户的代码库。Claude官方邀请这三家公司的创始人Sahaj、Mihir和Todd,聊了聊他们使用Claude Managed Agents的经历:基础设施省下了时间,产品依然得面对认错人、记忆混乱、评测失真和成本失控这些难题。
会前简报,首先别认错人
多数会议产品围绕录音发生的那几十分钟设计功能,Wispr却把会议拆成了之前、期间和之后。Sahaj希望助手提前帮助用户准备,让想谈的事情在会上得到讨论,并在会后执行双方约定的任务;这也让会前简报成了团队正在重点打磨的一项能力。
"能帮上忙时就帮忙,不要造成伤害或打扰。"
这份简报要回答对方是谁、为什么值得见、之前约好谈什么,以及哪些旧信息可能已经被忘记。假如用户要见Tom,助手却找来了另一个Tom的资料,用户带着它进入会议只会更困惑。主动提供帮助的产品,不确定时可以什么都不展示。判断错误之后仍然交付,看起来多做了一步,实际上可能损害体验。
Wispr通常在会议前约二十四小时启动准备,留出时间核对LinkedIn、邮件和日历邀请。负责检查的Agent使用独立上下文,不沿着执行者已经走过的推理继续判断,而是重新审视结果和来源;这里的产品选择是筛掉不可靠信息,并不能据此保证所有事实永远正确。
Wispr的Sahaj讨论会前简报:独立核验结果,再决定是否向用户展示。
把用户体验写进验收标准
要让Agent判断一份简报是否合格,就需要把要求讲得足够具体。对话中的outcomes,做法是提供一份评分标准,让系统对照要求迭代。Wispr会检查是否找到了正确人物的LinkedIn,也会检查输出是否容易扫读;前者是事实问题,后者直接影响用户愿不愿意打开它。
"否则,你会在会议前得到一份五页长的预读材料,没人会看。"
材料的顺序同样需要验收:先说对方是谁,再说为什么见面,最后才是需要做什么。资料即使没有错,塞得太满或排列混乱,也会让会前准备变成额外负担。信息取舍、阅读顺序和呈现方式,都被写进了Agent的验收标准。团队因此能围绕具体体验调整,而不只是笼统要求模型回答得更好。
这项检查发生在运行时,面对的是即将交给某个用户的那一份结果;离线评测则通过一组案例,帮助团队观察整体质量有没有变化。Sahaj希望两者尽量使用一致的标准,但不要求每次都循环到完美。对于主动生成的简报,独立核验后决定暂不展示,本身就是一种有效处理。
记忆要分层,别全塞进一个仓库
Actively原本给每个客户配置持续工作的Agent,跟随整个客户生命周期积累信息。但销售还需要知道今天先跟进哪五个客户,经理也要判断下季度哪些交易更可能成交。单个客户的上下文不够回答这些问题,团队于是用两周做出了跨客户的Watchtower。
"我们的工作,很大一部分就是让token对销售人员有用。"
跨客户判断要先弄懂公司自己的规则:客户归谁、预测怎么算、销售系统里哪些同义字段已经停用。Mihir说,他们会通过交互和主动澄清学习这些含义,把可共享的概念放进组织记忆,让其他人也能受益。记忆由此分成客户与跨客户、个人与组织几个范围,而非把所有内容存成同一种知识。
客户级长期记忆仍由Actively自己维护,托管记忆主要负责组织规则和用户偏好。Watchtower回答问题时,会把两类信息结合起来;遇到几百笔交易,可以先写代码查询和筛选,再分发给独立Agent深入处理,最后汇总。自建的客户Agent没有因此整体迁入托管平台。这些客户记忆会长期存在,团队要自行处理索引、查询效率和可能出现的污染。产品也因此可以从一线销售扩展到负责人:经理管理五名销售,每人负责一百个客户,就需要在五百个客户之间判断优先级。
让代码与用户行为互相校验
应用更新得越快,产品分析越容易跟不上:界面已经变化,埋点却可能仍按旧逻辑工作。Todd介绍,Pendo的新Agent会获取客户代码库的快照,把源码与实际运行数据放在一起看,既理解用户做了什么,也能追查相关代码改过什么。
"我们的目标,是最终得到一款能够自我修复的软件。"
一次代码变更提交后,Agent先做轻量的用户体验审查;合并之后,它可能再提交修改请求,补齐新的埋点。夜间任务会检查转化漏斗,留意某天的骤降,也观察连续几周的缓慢下滑,再回看更早的改动并建议修复。对于用户与Agent的对话异常,系统还可能提出提示词调整建议。
源码访问、工具调用和仓库修改,让隔离与控制成为基础要求。Pendo曾经自己搭建,但需要处理的边界情况越来越多,于是改用托管沙箱。Todd把自我修复称为目标,实际举例仍主要是检查、建议和提交修改请求;它体现了工作方向,不等于软件已经可以自行解决所有问题。
Pendo的Todd与其他嘉宾讨论如何把源码和用户行为放在一起分析。
自建还是托管,看什么决定产品价值
Sahaj把选择标准落在一个具体问题上:Agent运行框架,是否决定了你要做的核心能力?会前简报的价值在于用户拿到的信息,而全语音控制的私人助理,可能恰恰需要一套特别的运行框架,才能实现新的交互能力。
"如果它不是决定你所构建产品质量的东西,就选择购买。"
Pendo的选择也来自实际经历:已有的自建方案上线后逐渐暴露问题,团队意识到需要重做,才与托管方案比较。结果是,几天内就有了可运行的基础设施,几周内完成产品迁移,还覆盖了原先准备自行处理的许多边界情况。对Todd而言,早期更值得投入的,是验证客户需求和关键体验。
有没有必要自建,要看每项功能是否需要那份额外的控制权。以后某处可能需要更低成本、更少延迟或更细控制,却不意味着今天就该重建整套系统。Actively保留自建客户记忆,再叠加托管的跨客户功能,就是一种混合做法;把省下的时间用于产品,并不要求团队永远放弃控制权。
一天做出首版,剩下的时间花在哪
一天做出首版以后,团队仍需要投入时间,摸清用户的真实需求。Sahaj介绍,Wispr随后几周的用户规模扩大了一百到一千倍,对相应系统部分的追加迭代只用了几天;花费更多精力的,是不断确认用户进入一场会议前究竟需要什么。
"最主要的工作,是弄清楚用户到底想从这个功能中得到什么。"
团队先自己用,再找其他人试,在两到三周里持续调整。该什么时候搜索,去哪里检索,怎样给相关信息排序,不同来源又该怎么配合,都要在使用中重新判断。同一套资料,面对不同会议也可能需要完全不同的重点,这些选择不会因为基础设施托管就自动消失。
Actively的节奏相似:构思后大约第一周开始内部试用,两周左右交到客户手里。底层准备缩短之后,时间转向了体验上的反复验证。无需亲自处理上下文压缩等机制,团队可以集中调整提示词、工具与输出,看用户是否愿意持续使用,而不只是看功能是否顺利运行。
评测要回到真实客户的问题
Sahaj对早期评测的态度很直接:先通过实际使用找到让人愿意回来用的东西,再建立系统评测把它做好。如果产品还留不住用户,精细的测试集也不能替它创造需求;等到有人开始依赖这个功能,就不能继续只凭内部感觉判断质量。
"我们发现,自己的评测过于抽象,并不能代表真实情况。"
Mihir也踩过这个坑:自家销售团队会用产品,但他们提出的问题并不能代表外部客户。后来团队拿着真实查询去找用户,询问为什么这样问、在找什么、原本期待什么结果,再结合那个客户的数据制作评测。Wispr则把反馈分成回归案例、困难场景和不同任务类型,逐步覆盖更广的使用情况。
一旦记忆和外部数据持续变化,离线评测仍有难关。Mihir坦言,他们还没有完全解决这类系统的结果评测;Sahaj也提到,Slack等外部服务的状态会漂移,固定测试很难长期稳定。升级模型时,团队同样关注新出现的失败方式,而非只追求测试分数再提高一点。面对模型升级,Sahaj更希望提前知道有哪些新的常见错误,而不是把提示词过度优化到某一代模型。他认为,模型会继续进步,但新引入的失败方式需要团队尽早识别和防范。
成本与延迟,决定托管的边界
当产品开始处理真实工作量,三位创始人都得重新面对成本问题。Wispr的简报提前一天生成,Sahaj因而希望更方便地用上批处理,并估计可能节省百分之五十到七十五的费用;这是对潜在优化空间的判断,对话并未说明这笔节省已经实现。
"一次实验的成本,在于你花了多长时间才学到东西。"
Actively的主Agent需要很强的推理能力来协调搜索,但向五百个客户分发工作时,不能处处使用同样昂贵的模型。Pendo则希望看清每次调用的具体开销,现阶段也会用降低运行频率、减少输入数据这样的调整控制成本,不急着把每个细节都优化到底。
困难、运行数分钟、对几秒延迟不敏感的任务,更适合他们眼下的托管用法。Mihir指出,需要低延迟的体验可能依赖沙箱预热,而这些控制仍有限制。若某项功能必须降本九成才有机会成立,团队就得重新寻找实现方案;若尚不确定客户要不要,先缩短验证时间,也是在控制实验成本。
写在最后
从这三家公司的做法里,可以找到一个实际起点:先选用户真正需要的任务,用真实反馈把结果验清楚,再判断哪些能力值得自建。托管替团队省下的时间,最终仍要用于打磨具体功能和用户体验;不确定时少打扰用户,成本与控制成为限制时再调整边界,比急着搭齐整套架构更有助于推进眼前的工作。
内容来源:"How founders build on Claude Managed Agents"丨Claude(嘉宾:Wispr的Sahaj、Actively的Mihir、Pendo的Todd)
原视频:https://www.youtube.com/watch?v=hm8NzEd5io0
相关文章
《好用的 Agent Skill 到底怎么构建?丨AI Engineer》 《未来属于垂直领域 Agent丨AI Engineer》 《AI Agent时代,PM更要搞清楚客户到底要什么丨UserTesting》
如果你现在没空,可以收藏进晚点再听,通勤、走路或做家务时一次性听完⇣
⇣ 关注我,每天为你更新硅谷最新的 AI 创业/科技播客总结,让你与前沿保持同频 ⇣