阅读,与值得关注的内容Readance

直播预告!聊聊 Lego-RL 框架,如何在真实 Coding Agent Harness 中接入 RL 进行训练?

图片

主页:http://qingkeai.online/




 

青稞社区为科研人员提供成果宣传支持,如有优秀研究成果分享推广,欢迎投稿联系:aiFreeCode

 

 

随着编码智能体从“模型能力”走向“模型 + Harness”协同,工具调用、上下文管理与控制流正在成为影响智能体能力的重要因素。

然而,将真实 Agent Harness 接入强化学习训练并不简单:环境故障与奖励投机会污染训练信号,训练与推理环境的差异也可能导致策略更新偏离真实 Agent 行为。

华为和港中文最新开源的 Lego-RL 从三个方面解决了这些问题:Faithful(保真优化)、Reliable(可靠执行)和 Observable(可观测训练)。

华为&港中文最新开源 Lego-RL:让 Coding Agent 的强化学习训练真正"长稳可靠"

论文:https://arxiv.org/abs/2608.17393
代码:https://github.com/LegoX/Lego-RL

Lego-RL 是一套面向 Coding Agent 的强化学习训练框架,不需要修改 OpenHands SDK、Claude Code 或 OpenCode 的任何一行代码,就能把它们直接接入强化学习,基于 Qwen3.5-35B-A3B,三个 harness 上的 SWE-bench Verified 分数分别从 64.0 / 62.4 / 57.2 提升到 70.4 / 68.2 / 66.6。

9月8日(周二)20:00,青稞Talk 第152期,华为莱布尼兹研究所研究员、香港中文大学博士杜一鸣,将以 LEGO-RL 为核心案例,介绍面向真实编码智能体的 Harness-Native 强化学习方法。

重点拆解其“忠实优化、可靠执行、可观测训练”三大设计,并结合多种 Coding Agent 的实测结果,分析 Harness 对训练效果、任务筛选、系统效率及 Agent 行为变化的影响。

同时也将介绍 Agent Plugin 如何支持训练校验、实时诊断与人工复盘,形成从数据准备到训练运维的半自动化闭环,并进一步讨论这套方法对实际 Agent 研发与训练基础设施建设的启示。

青稞介绍

杜一鸣。香港中文大学博士,师从黄锦辉教授,华为莱布尼兹研究所研究员,研究方向为代码智能体、强化学习、记忆智能体,曾在顶级会议ICLR、AAAI、EMNLP等发表多篇论文包括AAAI2026 Oral,曾获ACL SIGHAN 2024最佳论文,是Lego-RL代码智能体强化学习训练框架核心开发者,也是华为LegoX 系列工作的贡献者。

主题提纲

Lego-RL:面向真实 Coding Agent 的 Harness-Native 强化学习方法

1、Coding Agent 概述与训练范式之变
2、把真实 Harness 接进 RL 的挑战
3、Lego-RL:Harness-Native 强化学习方法设计
4、多种 Coding Agent 的实测结果与分析
5、基于 Agent Plugin 的训练运维半自动化闭环
6、对未来的启示AMA(Ask Me Anything)环节

直播时间

9月8日(周二)20:00 - 21:00

如何观看

Talk 将在青稞社区【视频号:青稞AI】上进行直播,欢迎预约观看!

 



往期推荐

图片

直播预告!从 Harness 看 AI4AI 如何实现

图片

直播预告!到底模型的“什么经验值得被看见”?一起聊聊 LOPD:不再手动设计 OPSD 特权信息

图片

直播预告!聊聊 TriAttention:面向长上下文推理的三角级数式 KV Cache 压缩

图片

直播预告!聊聊 Agentic RL 下半场: 无需梯度更新的即时强化学习JitRL




 

加入青稞AI技术交流群

 

加入青稞AI技术交流群,不仅能与来自MIT、港中文、CMU、UCLA、斯坦福、清华、阿里、腾讯等名校名企AI研究员/开发者一起进行技术交流,同时还有一线青年AI研究员/开发者的Talk分享、青稞Tea、论文精读、招聘内推、国内外硕/博申请、大模型技术报告解读等。备注:姓名+学校/公司+方向,暗号"AI"优先审核通过!





都看到这了,点个关注再走吧🧐~


前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →