阅读,与值得关注的内容Readance

当 AI 开始真正“做事”,基础设施准备好了吗?

这是2026年的第 62 篇文章

( 本文阅读时间:约 15 分钟 )

AI 正在进入真实任务现场:它参与强化学习,持续提供推理服务,自动优化底层算子;也执行代码、访问文件、连接网络,甚至代表用户调用真实业务系统。当 AI 开始真正“做事”,支撑这些行动的基础设施准备好了吗?

模型如何持续学习并规模化训练?推理如何稳定承接真实流量?算子优化如何从依赖少数专家经验的反复试错,走向可验证、可复用的工程流程?当 Agent 进入业务系统,它在哪里运行、能访问什么、代表谁行动?它做出的每一次变更,又如何在进入生产之前得到可靠验证?

2026 年 9 月 22 日至 24 日,ROLL、RTP-LLM、Atrex Kernel Agent、OpenSandbox、Open Agent Auth、OpenCodeReview 六个开源项目将集中亮相云栖大会(末尾有云栖彩蛋哟~)。它们分别来自训练、推理、算子优化、Agent 运行、身份授权和代码评审等不同环节,以支撑 AI 在真实环境中更高效、更安全、更可靠地完成任务。

01

先让模型学得会、跑得动、跑得快

AI 的每一次行动,背后都离不开模型训练、推理服务和底层性能优化。训练能否扩展、推理能否稳定、硬件性能能否充分释放,决定了 AI 是否能进入更复杂、更长期的真实任务。

ROLL:让大模型在复杂任务中持续学习

大模型强化学习首先面临效率与规模问题:生成阶段的长尾任务导致资源利用率不均,GPU 空闲现象严重;千亿级参数的模型训练需要协调数千块 GPU,故障恢复成本高昂。与此同时,现有框架也难以支持研究人员快速实验新算法或开发者定制任务流程。

ROLL(面向大规模学习的强化学习优化框架,Reinforcement Learning Optimization for Large-scale Learning)是阿里巴巴开源的强化学习框架,专为大语言模型设计。它基于 Ray 构建,覆盖从小规模预研到数千卡百亿参数生产环境的完整 RL 优化流程,支持数学、代码、推理等多领域任务联合训练;原生支持 Agentic RL,灵活适配游戏、多轮对话、工具调用、CodeAgent 等多步决策场景;深度集成 Megatron-Core、FSDP 等主流框架,支持先进的 5D 并行策略;具备样本级生成管理、异步推理、异步训练加速等核心机制。ROLL 同时满足业务算法工程师、工业界研究员、学术界研究员的诉求,适用于千卡级训练、异构硬件支持、多任务路由和单卡实验等场景。开发者还可以动态配置样本的奖励计算路径,并通过透明日志实时监控实验指标,支持快速迭代。

ROLL 回答的是模型如何在复杂任务中持续进化。但训练形成的能力,只有进入稳定的推理服务,才能真正抵达应用和用户。

RTP-LLM:让模型能力稳定抵达业务

训练完成的模型,只有通过推理服务,才能真正进入应用。在推理阶段,大模型又要面对成本高昂、内存占用巨大、并发处理困难、硬件资源利用率低等核心问题。模型越大、请求越多,如何兼顾速度、成本和资源效率就越关键。

RTP-LLM 是面向大语言模型和视觉语言模型的高速服务框架,也是开源生产级大语言模型推理引擎,具备快速、灵活、可扩展等特性。通过后端运行时与前端语言的协同设计,它使您与模型的交互更快速、更可控。RTP-LLM 广泛应用了大规模 PD 分离,实现了基于 RDMA GDR 的高性能 PD KVCache 传输框架,并通过先进的 CUDA 内核、高级量化技术(INT8/INT4)、KV 缓存优化和推测解码、零开销 CPU 调度器、预填充—解码分离,实现最大吞吐量,提升推理效率。

RTP-LLM 适用于自定义 Docker Serving、多 GPU 推理和 LoRA 微调等场景。开发者可以利用 RTP-LLM 的 Python 库构建自己的推理服务,实现特定领域的高效解决方案;对于高负载场景,可以通过多 GPU 协同工作提升模型的并行处理能力;也可以结合 LoRA 技术进行模型的轻量级适应,以应对特定任务的性能优化。

当模型开始承接大规模推理请求,性能问题还会继续向下深入。最终,推理效率往往取决于一个个运行在不同硬件上的底层算子。

Atrex Kernel Agent:让 Agent 深入性能优化现场

GPU 算子性能高度依赖硬件架构和优化经验。通用 LLM 虽能生成可运行的 Kernel,却往往难以持续提速,更难证明单算子收益能否转化为真实业务收益。

Atrex Kernel Agent(AKA)是生产级异构推理算子生成 Agent,它融合 GPU 知识库与性能分析,自动生成、验证与调优算子,助力 SOTA 算子落地生产。AKA 支持 NVIDIA、AMD 等硬件,适配多种 GPU 编程模型。它将编码 Agent、GPU 领域知识和确定性工程编排结合,形成从算子生成、性能优化到端到端验证的闭环,让算子优化从依赖个人经验的反复试错,走向可复现、可度量、可持续迭代的工程流程。

AKA 面向 AI Infra、推理引擎、训练框架及算子研发团队,适用于热点算子自动生成与调优、跨硬件平台适配、Benchmark 评测,以及面向真实业务负载的算子优化与工程交付。AKA 曾助力 Qwen3.8 登顶 SOL-ExecBench FlashInfer 算子优化榜。

从 ROLL 的强化学习,到 RTP-LLM 的高速服务,再到 AKA 的算子生成、验证与调优,三个项目分别解决能力如何形成、如何服务、如何释放底层性能的问题。模型能力准备好之后,下一步才是更好地进入环境、调用工具并完成任务。

02

再让 Agent 在明确边界内行动

当 Agent 开始执行代码、访问网络和调用工具,基础设施的关注点随之改变。系统不仅要让任务运行起来,还要同时回答:Agent 在哪里运行,以及它代表谁、获得什么授权去访问资源。

OpenSandbox:Agent 应该在哪里运行

Agent 场景对运行时提出新的要求:在易用与扩展方面,需要支持多语言接入、完备的执行能力与运行环境定制;在规模与效率方面,需要适应高并发、短生命周期负载,兼顾启动延迟、批量吞吐和资源成本;在安全与可观测方面,需要覆盖租户隔离、网络与凭据管控,以及运行过程的审计与追踪。

OpenSandbox 是面向 Agent 的通用沙箱运行时,提供统一的生命周期与执行 API、多语言 SDK 和多运行时支持。通过批量调度、池化预热、极速冷启动、安全隔离、网络管控与凭据保护,构建安全、快速、可扩展的运行环境,适用于自主 Agent、Agent 评测与训练等场景。

OpenSandbox 适用于构建自主 Agent、Agent 评测与训练平台的开发者和基础设施团队。它提供 Python、Java/Kotlin、JavaScript/TypeScript、C#/.NET 和 Go SDK,支持 CLI 与 MCP;适配主流 Coding Agent 工具,并已接入 Harbor、AgentScope、NeMo Gym、DeerFlow 等开源 Agent 框架。

沙箱回答了 Agent“在哪里运行、如何隔离”的问题。但 Agent 要完成真实任务,通常还需要走出沙箱,调用企业工具或访问受保护资源。这时,仅有安全运行环境还不够,系统还必须确认每一次行动的身份与授权来源。

OpenSandbox 已收录于 CNCF Landscape,并已在阿里内部规模化落地,日均创建百万数量级沙箱。

Open Agent Auth:Agent 可以代表谁行动

把 Agent 放进受控环境,并不意味着权限问题已经解决。Agent 代用户操作时,存在身份来源难确认、授权灵活度不足、隔离和审计机制缺失等问题。Agent 能够调用的工具越多、接触的资源越敏感,“谁在行动、代表谁行动、被允许做什么”就越需要成为明确的系统约束。

Open Agent Auth 是一款企业级授权框架,为代表用户执行操作的 AI 智能体提供密码学身份绑定、细粒度授权、请求级隔离与语义审计追踪能力。该框架构建了一个协作生态系统,人类、智能体与资源提供方以平等伙伴的身份,在相互信任与问责机制下共同协作。Open Agent Auth 通过三层密码学身份绑定、请求级虚拟工作负载隔离与 W3C VC 语义审计链,将每一次 Agent 操作追溯至用户的明确授权。Open Agent Auth 适用于 Agent 代用户调用工具或访问受保护资源时的身份认证、用户授权、资源访问和操作追踪。目前项目处于公开 Beta 测试阶段——功能完整、持续演进,现已开放探索。

OpenSandbox 为 Agent 提供运行环境,Open Agent Auth 为 Agent 建立身份与权限边界。一个解决行动在哪里发生,一个解决行动凭什么发生。对于会形成代码变更的任务,环境和权限准备好之后,还需要回答最后一个问题:代码产出如何进入可靠交付流程?

03

最后,让代码类任务的产出经得起验证

Agent 可以写代码、修改配置并提交变更,但“任务已完成”不能只由 Agent 自己判断。代码进入生产之前,仍然需要稳定、准确、可追溯的评审机制。

OpenCodeReview:让代码变更进入验证闭环

通用 Agent 做代码评审时,存在覆盖不完整、行号漂移、效果质量不稳定的问题。纯语言驱动架构也难以对评审流程形成稳定约束。

OpenCodeReview 是基于大语言模型的智能代码评审工具,源自阿里集团内部官方 AI 代码评审助手。两年间服务数万名开发者、识别百万级代码缺陷,经大规模生产验证后孵化为开源项目。它读取 Git 差异,通过具备工具调用能力的 Agent 向可配置 LLM 发送变更文件,生成精确到行的结构化评审意见

OpenCodeReview 通过将确定性工程与 Agent 结合、各司其职的设计,解决了纯语言驱动架构在评审流程约束上的不足。OpenCodeReview 适用于独立开发者、公司内部部署、模型训练数据合成。典型场景包括日常代码变更审查、陌生代码库全量审查和超大变更并发审查,并可通过精细化规则匹配满足定制需求,同时支持与 AI 编程 Agent 协同及接入 CI/CD 自动化评审流程。

相比通用 Agent,OpenCodeReview 在相同底层模型下取得了显著更高的准确率(Precision)与 F1 综合得分,同时仅消耗约 1/9 的 Token。截至材料整理时,项目拥有 38k+ Stars,获得 OpenSSF Gold Badge,npm 下载量超过 600k。

至此,从模型学习与推理,到 Agent 运行与授权,再到代码变更评审,我们通过六个开源项目,看到了一条从能力供给到行动支撑,再到代码类结果验证的基础设施链路。

即将在云栖大会 AI Native 论坛上发布的《AI Native 研发范式实践手册》指出:“让 Agent‘能用’只是起点,让 Agent‘持续有效’才是真正的工程问题”。真正的任务交付,需要形成“行动—验证—纠错”的循环,也需要可执行、可复现的环境,以及明确的身份、权限和安全边界。六个开源项目从不同方面回应了这个观点:ROLL 支撑大规模强化学习,RTP-LLM 承接生产级推理,AKA 深入异构算子优化;OpenSandbox 提供受控执行环境,Open Agent Auth 建立身份与授权边界,OpenCodeReview 让代码变更进入验证闭环。它们不是一套预先拼装好的方案,而是六个来自真实工程现场的开源切面。它们共同指向的,不只是“让 AI 更强”,而是让 AI 的每一次行动都有能力支撑、有边界约束、有结果验证,也能够被持续改进。

如果你正在做 AI Infra、Agent Infra 或研发工具,欢迎在评论区留言互动,将有各项目负责人交流解答。

参考链接

ROLL

https://github.com/alibaba/ROLL

RTP-LLM
https://github.com/alibaba/rtp-llm
Atrex Kernel Agent
https://github.com/alibaba/atrex-kernel-agent
OpenSandbox
https://github.com/opensandbox-group/OpenSandbox
Open Agent Auth
https://github.com/alibaba/open-agent-auth
OpenCodeReview
https://github.com/alibaba/open-code-review


云栖现场展位吆喝区

欢迎你于 2026 年 9 月 22 日至 24 日,前往杭州国际博览中心二期 1F 智能馆 1-D6-B2「智能体及 AI 基础设施开源项目」展位,现场更有「阿里技术」周边礼品,福利多多等你来!

图片

图片



图片
欢迎留言一起参与讨论~

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →