AI-NATIVE CREATIVE STACK
Claude Code 不是替你思考:Anthropic 研究揭示,真正拉开差距的是领域专长
从单点生成,走向可编排、可复用、可验收的数字工作室
本文看点
01
三层创作栈如何分工
02
图像、语音如何被 Agent 调度
03
生产系统的工程门禁
很多人第一次使用编码 Agent 时,最关心的是:它会不会写代码?
Anthropic 最近发布的一份研究,把问题往前推了一步:当 Claude Code 真正进入工作现场后,人和 Agent 分别在做什么?哪些职业的人更容易成功?使用者的领域经验,会不会改变 Agent 每次指令实际完成的工作量?
这份研究基于 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 交互会话、约 23.5 万名用户,分析任务构成、人机决策分工、使用者专长和会话结果。
它给出的核心判断很清楚:人主要决定做什么,Claude 主要决定怎么做;真正放大 Agent 产出的,不是会不会写代码,而是使用者是否理解自己要解决的问题。
本文是对 Anthropic 研究文章的中文整理与解读,数据口径和研究限制以原文为准。
— Claude Code 会话中的九类工作模式
— Agentic Coding 的真实分工:人规划、Claude 执行、专长放大行动链
01
RESEARCH FRAME
一、这不是一次模型评测,而是在观察真实工作
这份研究关注的不是某个 benchmark 上的分数,而是互动式 Agent 在真实会话中的工作方式。研究团队把一次 Claude Code 会话看成一个完整的协作单元:用户提出目标,Claude 读取文件、编辑代码、运行命令、生成输出,用户再检查结果、追加要求或纠正方向。
研究对象覆盖 Claude Code 的命令行界面、Claude.ai 和 Claude Code 桌面应用。研究者使用隐私保护分析方法读取会话中的任务特征,同时用自动记录的遥测信息进行交叉核验,例如判断会话是否真的新增或删除了代码行。
这一区别很重要:它测量的是“人和 Agent 如何一起完成工作”,而不是“模型单独能不能完成一道题”。
研究结论先看
01典型会话中,人做了约 70% 的规划决策,Claude 做了约 80% 的执行决策。
02约 56% 的会话与直接编写、修复、测试或编排代码有关;运行软件占 17%,规划和探索占 14%,分析与非代码文本约占 13%。
03从新手到专家,单次提示触发的 Claude 行动量从约 5 次增加到约 12 次,输出量从约 600 词增加到约 3200 词。
04新手会话的严格验证成功率约为 15%,中级到专家约为 28%~33%。
052025 年 10 月到 2026 年 4 月,调试型会话占比从 33% 降到 19%,运行软件、写文档和数据分析的占比上升。
06研究估算的典型任务价值整体上升,正文中的分组估算显示平均约增长 27%;研究摘要将其概括为约 25%。
02
WORK MODES
二、Claude Code 到底在做什么
Anthropic 将会话分成九种工作模式:修复故障、构建新东西、运行软件、写文档和演示文稿、理解系统、规划改动、编排 Agent 和流水线、分析数据,以及测试代码。
其中,修复故障占 26%,构建新东西占 25%,运行软件占 17%。写文档和演示文稿占 10%,理解系统与规划改动各占 7%,编排 Agent 和分析数据各占 3%,测试代码占 2%。
这说明“编码 Agent”正在处理比写函数更宽的工作:部署服务、配置环境、监控流水线、理解旧系统、分析数据和生成非代码文档,都已经进入同一个交互式会话。
— 人和 Claude 的决策分工
人决定什么,Agent 决定怎么做
研究把决策拆成两类:
01规划决策:做什么、采用哪种方案、什么算完成。
02执行决策:修改哪些文件、写什么代码、使用什么语言、运行哪些命令。
平均来看,人做约 70% 的规划决策,但只做约 20% 的执行决策。换句话说,人仍然掌握目标、边界和完成标准,Agent 则承担大量具体实现动作。
典型会话大约有 4 个来回。每次用户提示平均会触发约 10 个 Claude 行动,有时超过 100 个;Claude 会读取文件、编辑代码、执行命令,并在每个回合输出约 2400 词。
当用户继续牢牢控制执行时,Claude 每回合大约执行 8 个动作;当 Claude 同时接管了较多规划决策时,每回合动作量会上升到约 16 个。决策权的分配,直接影响 Agent 能够连续推进多远。
03
EXPERTISE
三、领域专长比编码身份更重要
研究把会话中的使用者专长分为五级,从新手到专家。这里的“专长”不是职位,也不是泛化的聪明程度,而是针对当前任务的领域理解:能否准确描述问题,是否知道该验证什么,能否发现 Agent 的错误,是否能提前指出设计取舍。
一个熟悉财务对账规则、但从未写过 Python 的会计人员,可能在财务脚本任务上被评为高专长;一个资深工程师第一次处理陌生的 Rust 代码库,也可能只是该任务的新手。
专家到底多做了什么
新手会话中,一次提示通常触发约 5 个 Claude 行动和约 600 词输出;专家会话中,一次提示触发的行动链超过 12 个,输出约 3200 词。
这不是因为专家写了更长的 Prompt,而是因为他们给出的上下文、验收标准和纠错反馈更有效。Agent 得到的不是一句模糊命令,而是一组可以持续执行的约束。
— 不同专长等级对应的 Agent 行动量和输出量
专长不是“替 Agent 做更多”,而是让 Agent 少走弯路
研究对专长的判断,重点看三个信号:用户如何精确地提出任务,要求 Claude 验证什么,以及双方谁更经常纠正对方。
新手往往只给出通用要求,例如“分析一下数据并画图”,验证也停留在“再检查一下”。专家则会指定边界、测试路径、数据口径、性能约束和潜在失败模式。这样一来,Claude 可以把更多行动用于推进任务,而不是反复澄清目标或修复方向错误。
这也是为什么“降低写代码门槛”不等于“降低领域知识价值”。代码实现被 Agent 接手之后,问题定义、取舍判断和结果验收反而更重要。
04
WORK SHIFT
四、七个月里,工作从调试转向端到端交付
研究团队观察到,2025 年 10 月到 2026 年 4 月,会话中的工作结构发生了明显变化:
01修复故障型会话从 33% 降到 19%。
02运行软件型会话从 14% 增长到 21%。
03写文档和数据分析等非代码工作,大约从 10% 增长到 20%。
04构建新东西的会话约为 21%,沟通和协作类任务约为 20%。
这可以理解为一个工作阶段的变化:早期用户更多是在让 Agent 解决局部错误,随着使用经验和模型能力增加,任务开始向部署、运行、分析和完整交付移动。
— Claude Code 使用场景在七个月中的变化
研究还用自由职业市场上的类似工作估算任务价值。这个估算不是实际收入,也不能当作精确价格,只适合用来比较不同月份和不同任务的相对变化。结果显示,典型任务价值在大多数工作类型中都上升:构建约增长 43%,运行约增长 34%,修复约增长 32%,整体约增长 27%。
— 不同工作类型的估算任务价值变化
05
SUCCESS
五、成功率:中级用户已经跨过关键门槛
研究没有直接询问用户“你满意吗”,而是使用两类会话级指标:
01至少部分成功:会话部分完成了用户的主要目标。
02验证成功:完成目标,并有更硬的成功证据,例如测试通过、提交成功或推送落地。
研究同时区分“判断成功”和“验证成功”,也记录失败、验证失败和放弃。它明确提醒:这些都是基于会话文本与信号的推断,不是用户现实世界结果的直接观测。
专长对成功率的影响
在所有会话中,新手的验证成功率约为 15%,中级约为 28%,高级和专家约为 33%;至少部分成功率则从新手的 77% 上升到中级及以上的 91%~92%。
遇到错误、失败测试、重复尝试或用户表达不满的“困难会话”时,新手的验证成功率约为 4%,专家约为 15%。新手困难会话最终放弃的比例约为 19%,其他专长等级约为 5%~7%。
— 不同专长等级的成功、失败和放弃情况
这里最值得注意的不是“专家一定成功”,而是从新手跨到中级,成功率提升最大。掌握基本领域规则、知道如何验证和能够识别明显错误,可能比掌握更深的高级技巧更先决定能否把 Agent 用起来。
— 成功率与专长等级的关系
职业身份的差距反而没有想象中大
软件与数学类职业的会话,整体验证成功率约为 30%;其他职业约为 26%。如果只看真正产生代码变化的会话,两组分别约为 34% 和 29%。在更宽松的“至少部分成功”口径下,代码型会话的成功率为 89% 和 88%。
研究因此得出一个谨慎判断:在代码任务中,非软件职业并没有被系统性地挡在外面。真正重要的不是职位名称,而是用户是否理解任务所在的领域,能否提出具体要求并检查结果。
— 不同职业群体在编码任务上的成功情况
06
PRODUCT IMPLICATIONS
六、这对 Agent 产品意味着什么
1. Prompt 工程会让位于任务建模
如果 Agent 的主要瓶颈不是“不会写代码”,而是“没有理解问题”,那么更长的万能 Prompt 并不是答案。产品应该帮助用户提供领域规则、输入材料、完成标准、验证方式和失败后的回退路径。
2. 结果面板必须展示证据,而不只是展示答案
研究把测试通过、提交落地、部署成功等信号视为更严格的成功证据。Agent 产品也应让用户看到变更文件、命令输出、测试结果、数据来源和待确认事项,而不是只给出一段看起来合理的总结。
3. 专长应该被产品化为工作流资产
专家的优势来自可复用的判断:知道检查什么、如何拆解任务、怎样识别风险。好的 Agent 系统可以把这些判断沉淀为领域模板、检查清单、技能包、验收规则和团队知识库,而不是让每个用户重新摸索。
4. 自动化程度应随任务风险变化
研究显示,当 Claude 接管更多规划决策时,每回合可以推进更多动作,但这并不意味着所有任务都应该打开全自动模式。低风险的格式化、测试和批处理可以扩大 Agent 权限;涉及生产发布、财务数据、隐私材料和不可逆变更时,仍应保留人工确认。
07
LIMITATIONS
七、别把这份研究读成“非程序员已经取代程序员”
Anthropic 明确指出,这些结果仍然是早期信号。研究看不到现实世界中代码是否最终被使用、是否被丢弃,也排除了相当一部分非互动式使用。所有任务、专长和结果分类都依赖模型读取会话文本,虽然研究用遥测和参考模型进行了交叉验证,但分类器仍然可能出错。
此外,任务价值只是根据自由职业市场岗位做出的近似,不等于真实收入。成功也只是会话层面的成功,不等于项目上线、业务增长或长期维护成功。
更准确的结论是:编码 Agent 正在把“实现能力”扩散到更多职业,但并没有消除领域判断;它把竞争焦点从亲手写每一行代码,推向定义问题、调度执行、验证结果和承担责任。
∞
EPILOGUE
八、真正值得关注的下一步
如果未来模型继续进步,Anthropic 认为可以持续观察几个信号:专长带来的成功率差距是否缩小,非软件职业的代码任务是否继续增长,Agent 是否开始补足用户当前提供的关键判断,以及人和 Agent 的分工是否重新变化。
这份研究对普通用户的启发很直接:学习 Claude Code 的重点,不只是背命令,也不是把 Prompt 写得越来越长,而是建立一套自己的任务方法:先说清问题,再给出约束;让 Agent 执行,但要求它验证;遇到错误时定位原因,而不是简单重试。
Agent 越能做事,人的价值就越集中在三个动作上:选择值得做的问题,提供足够准确的上下文,判断结果是否真的成立。
声明:本文由山行整理自:Anthropic Research《How Claude Code is used in practice》(https://www.anthropic.com/research/claude-code-expertise),如果对您有帮助,请帮忙点赞、关注、收藏,谢谢~
我是山行 AI,持续分享 AI 工具、Agent 工作流与开源项目观察。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。