大家好,我是PaperAgent,不是Agent!
近期,Anthropic发布长文公开了内部RSI(Recursive Self-Improvement)的落地方法论:AI在多大程度主导下一代AI,研发自动化指数以及对3万个AI Agent的监督。商汤悄悄开源了个统一大模型SenseNova-U1.5,超惊艳
要理解Anthropic的这篇RSI博客,不能不提近期的一篇重量级综述:完全没想到,这家国产大模型也在押注RSI
系统梳理了 2024–2026 年间 1,250 篇论文,是迄今对「递归自我改进RSI」最完整的一次测绘。最直观的事实是:这个领域的膨胀速度本身就在指数化——论文数量飙升。
Claude 已「主导」26% 的模型研发
Anthropic 构建了「研发自动化指数」,采用 Epoch AI 的六级自动化量表(AL):
| AL3 | AI 协作 |
| AL4 | AI 主导 |
| AL5 | 完全自主 |
核心发现(截至 2026 年 8 月):没有任何研发子集达到 AL5;Claude「主导」(AL4)了 26% 的 AI 研发工作;「AI 协作」及以上占比超过 90%。
这张图最震撼的不是绝对值,而是斜率:AL4 占比 2026 年 3 月仅 1%,4 月 3%,5 月 12%,7 月 22%,8 月已达 26%——半年内从几乎为零飙升至四分之一,低自动化等级的工作整体向上迁移。
这篇RSI综述也对「自我改进」进行了详细拆解
系统改进什么(部署行为 / 训练权重 / 评估器 / 研究过程本身),与环路由谁验证(人在环中 → 人在环上 → 完全闭环), 并由此划出全领域的核心分界:有界自我改进(bounded self-refinement,针对固定外部标准、可收敛、已是工业实践)与开放式递归自我改进(RSI,连改进标准本身也被改写、原则上发散)。
1,250 篇论文在四个技术类别上的分布如下:
按这个坐标系,Anthropic 的 26% AL4 属于典型的「人在环上」——改进信号自动生成、人类审计把关,这正是当前文献的主体所在。综述援引 Anthropic 自己的判断也与此吻合:「执行」环节已高度自动化(截至 2026 年 5 月,Claude 撰写了 Anthropic 超过 80% 的合入代码),真正的瓶颈卡在「研究方向设定」——选择什么问题值得做。这也解释了图 2 中 AL5 为何缺席:执行可以自动化,品味不能。
3 万个 Agent、10 亿次决策、0.002% 拦截率
Anthropic 员工越来越依赖可长时间半自主工作、且互相委派任务的 Agent。单个 Agent 失当目前罕见,但当 Agent 规模达到百万、十亿级,罕见事件就会常态化。为此定义三个指标:覆盖率(行为经过监控的比例)、审查延迟(从行为到复核的时间)、升级率(被拦截或标记的比例)。
表 1:Anthropic 的 Agent 双层监控体系
| 在线监控器 | 离线监控器 | |
|---|---|---|
| 职责 | 实时 | 事后 |
| 覆盖率 | ||
| 审查延迟 | ||
| 拦截 / 升级率 |
核心发现(截至 2026 年 8 月):其最常用内部平台上任意时刻约有 30,000 个 Agent 在从事研发工作,行为受双层监控。
监督的本质是一个「评估器」问题
为什么「裁判」的可靠性如此关键?RSI 综述给出了迄今最清晰的理论框架:它把自我评估单列为与部署、训练、自动研究并列的第四大类(318 篇,2026 年新增最快的方向),理由一针见血——每一条自我改进环路,本质上都是「某个信号可以替代人类判断」的声明,环路的天花板就是该替代品的质量。综述将评估信号排成一条验证层级,越往上信号越可靠但覆盖面越窄,越往下越便宜但越容易被钻空子:
经验规律是:已验证的自我改进强度严格沿此层级分布。FunSearch、AlphaEvolve 之所以成功,正因为站在层级顶端(程序可执行、结果可检验);而「AI 科学家」系统之所以产出流畅却难以审计的论文,是因为在用第三层工具(LLM 裁判)解决第四层的问题(研究品味)。
Anthropic 的自动化评级让 Claude 裁判 Claude,正落在「学习型裁判」这一级——综述称之为自我确认循环:生成器与评估器共享权重时,高置信错误会被系统性过度奖励,奖励黑客只是特例,该模式无需攻击者即可自发产生。
Anthropic 在方法附录中用「模型与人类评级一致率 59% vs 人类彼此 35%」来对冲这个质疑,这个校验设计本身就是在向验证层级的上方攀爬。
RSI才刚刚开始,Claude在持续自我进化!我天,彻底被SenseNova-U1.5技术深度惊到了
https://www.anthropic.com/institute/measuring-pace-of-ai-development
https://arxiv.org/pdf/2607.07663
Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops