大家好,我是PaperAgent,不是Agent!
继上次2篇Skill(WikiSkill,SKILL.state)之后,Google又爆肝了一篇Agentic Skills系统性基础综述。
这是一篇 46 页的系统综述,首次为火热的「Agentic Skills(智能体技能)」生态建立了统一的系统学框架。
用六元组形式化定义技能,用九阶段生命周期串联从发现、编写、存储、检索、编排、执行到演化、评估与安全的全链路,并配以 10 张大规模对比表梳理了 100+ 个代表性系统。
一、动机:智能体的两大瓶颈
LLM 智能体在长程任务上有两个致命短板:可靠性瓶颈,复用性瓶颈。
把流程塞进上下文窗口?Token 成本随指令集线性膨胀。微调进权重?工具和 API 的变化速度远超重训练周期。外置的可执行技能(Externalized Executable Skills)正是为此而生:把激活条件、程序指令、工具声明、可执行资产打包成模块化工件,存于模型之外,按需加载,无需重训练即可更新。
二、什么是 Agentic Skill?形式化定义
论文将技能形式化为六元组:s = (A, I, C, T, π, E)——激活条件 A、程序指令 I、适用约束 C、工具接口 T、执行策略 π、预期效果 E。并提出判定一个工件是否为技能的三元组标准:
封装模块化:独立于模型权重与 Agent 框架代码,可单独编写、版本化、验证与更新; 晚绑定动态调用:不常驻上下文,由激活函数 A(x_t, g) → {0, 1} 按当前状态和目标动态加载; 程序性状态转换:编码”怎么做”的操作知识,而非陈述性事实或历史流水账。
据此,论文厘清了边界案例:全局系统提示词不是技能(无晚绑定);裸 API 不是技能(无程序控制流);但一个附带超时重试、缓存降级、DOM 解析逻辑的 API 封装就是”工具执行技能”。此外还给出了安全约束的形式化:技能激活当且仅当其声明工具集是当前上下文允许工具集的子集,否则即为权限提升。
三、九阶段生命周期(论文核心)
3.1 发现与获取、编写与表示
技能发现被形式化为从长程轨迹日志中抽取可复用子策略的问题:发现算子 D 从历史轨迹 H 中找出满足”结果持久 + 熵最小化”的最优子轨迹,归纳出适用上下文 C,再经获取算子优化指令与策略,且必须通过准入前验证 V(s*)=1(单元测试、静态分析或形式化证明)才能入库。
编写方式则覆盖自主 RL 诱导(SkillRL、Skill-Pro)、AI 合成(Voyager、AutoSkill、Trace2Skill)、人机混合(AgentClick)与纯手工(EasyTool)四条路线。
表示格式上,论文对比了自然语言、结构化 JSON/DSL、可执行规范、契约式与混合格式在可验证性、可移植性、注入面、加载成本上的权衡——自然语言灵活但无法预验证,可执行代码能力最强但注入面最大。
3.2 存储、检索与路由
技能库存储借鉴了操作系统的虚拟内存思想:MemGPT 式的上下文分页、SKILL.state 的可变执行状态、SkillOps 的五维技能库健康度治理(剪除低价值技能、偿还”技能技术债”)。
检索路由则从稠密向量召回走向”检索-重排”两阶段架构(SkillRouter 在 8 万技能规模下实现亚秒级路由)与图结构检索(GraphSkill、GraSP)。
3.3 编排组合与执行修复
技能组合有三种基本结构:顺序流水线、动态 DAG 编排、层级递归调用。关键洞察是:扁平顺序链中任何中间失败都会触发全局重规划(O(N) 代价),而类型化 DAG 编排支持局部有界的子树恢复——只修坏掉的依赖节点。多智能体 SOP 流水线(MetaGPT、ChatDev、AutoGen)也被纳入这一框架统一审视。
3.4 安全、治理与市场防御
这是全文最具现实警示意义的部分。自然语言指令本质是多孔的注入信道:恶意技能可携带后门、窃取凭证、绕过护栏,且漏洞横跨全部 5 个生命周期阶段(SkillSec-Eval 在 327 个真实技能上的审计结果)。防御体系对应三层:准入前静态审计(SemiA 形式化审计、SkillAuditSAST 跨文件扫描)、运行时护栏(FlowGuard、RouteGuard)、市场治理(SecureAgentSkills 的加密溯源签名)。一个尴尬的事实是:技能在调用前无法被完全验证——这正是安全问题的根源。
四、技能分类学:五大功能类别
论文将技能实现分为五类:指令型 SOP 技能(把领域操作流程固化为可验证步骤)、工具/API 调用技能(Gorilla、Toolformer、AnyTool 应对 1.6 万+ API 的搜索空间)、推理与规划技能、领域执行技能(软件工程、GUI/OS 导航、具身机器人、科学发现四大场景)、协作与元技能(技能写技能的自我改进循环,如 CASCADE、SkillForge)。
五、生态系统与市场:从脚本仓库到技能市场
技能生态正经历从孤立脚本库到开放社区市场的范式转移。几个值得关注的实证发现:SkillsInWild 测量了3.4 万个真实世界技能,发现技能效用相当脆弱;AgentSkillOS 证明树状检索 + DAG 组合在 20 万技能规模下优于扁平池;OffensiveCS-Eval 则给出负面结果——程序性技能在网络安全 CTF 任务上零增益,印证了论文提出的”环境反馈带宽假说”:当环境本身能提供丰富诊断信息时,外置技能的边际收益递减。
最后
这篇综述的价值不在于某个单一算法,而在于给一个野蛮生长的领域立了规矩:统一的数学抽象、清晰的概念边界(技能 vs 提示词 vs 工具 vs 记忆)、完整的生命周期参考架构,以及对安全威胁的清醒认知。
https://arxiv.org/pdf/2608.29596
Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security