主页:http://qingkeai.online/
青稞社区为科研人员提供成果宣传支持,如有优秀研究成果分享推广,欢迎投稿联系:aiFreeCode
随着编码智能体从“模型能力”走向“模型 + Harness”协同,工具调用、上下文管理与控制流正在成为影响智能体能力的重要因素。
然而,将真实 Agent Harness 接入强化学习训练并不简单:环境故障与奖励投机会污染训练信号,训练与推理环境的差异也可能导致策略更新偏离真实 Agent 行为。
华为和港中文最新开源的 Lego-RL 从三个方面解决了这些问题:Faithful(保真优化)、Reliable(可靠执行)和 Observable(可观测训练)。
华为&港中文最新开源 Lego-RL:让 Coding Agent 的强化学习训练真正"长稳可靠"
论文:https://arxiv.org/abs/2608.17393
代码:https://github.com/LegoX/Lego-RLLego-RL 是一套面向 Coding Agent 的强化学习训练框架,不需要修改 OpenHands SDK、Claude Code 或 OpenCode 的任何一行代码,就能把它们直接接入强化学习,基于 Qwen3.5-35B-A3B,三个 harness 上的 SWE-bench Verified 分数分别从 64.0 / 62.4 / 57.2 提升到 70.4 / 68.2 / 66.6。
9月8日(周二)20:00,青稞Talk 第152期,华为莱布尼兹研究所研究员、香港中文大学博士杜一鸣,将以 LEGO-RL 为核心案例,介绍面向真实编码智能体的 Harness-Native 强化学习方法。
重点拆解其“忠实优化、可靠执行、可观测训练”三大设计,并结合多种 Coding Agent 的实测结果,分析 Harness 对训练效果、任务筛选、系统效率及 Agent 行为变化的影响。
同时也将介绍 Agent Plugin 如何支持训练校验、实时诊断与人工复盘,形成从数据准备到训练运维的半自动化闭环,并进一步讨论这套方法对实际 Agent 研发与训练基础设施建设的启示。
青稞介绍
杜一鸣。香港中文大学博士,师从黄锦辉教授,华为莱布尼兹研究所研究员,研究方向为代码智能体、强化学习、记忆智能体,曾在顶级会议ICLR、AAAI、EMNLP等发表多篇论文包括AAAI2026 Oral,曾获ACL SIGHAN 2024最佳论文,是Lego-RL代码智能体强化学习训练框架核心开发者,也是华为LegoX 系列工作的贡献者。
主题提纲
Lego-RL:面向真实 Coding Agent 的 Harness-Native 强化学习方法
1、Coding Agent 概述与训练范式之变
2、把真实 Harness 接进 RL 的挑战
3、Lego-RL:Harness-Native 强化学习方法设计
4、多种 Coding Agent 的实测结果与分析
5、基于 Agent Plugin 的训练运维半自动化闭环
6、对未来的启示AMA(Ask Me Anything)环节
直播时间
9月8日(周二)20:00 - 21:00
如何观看
Talk 将在青稞社区【视频号:青稞AI】上进行直播,欢迎预约观看!
往期推荐
加入青稞AI技术交流群
都看到这了,点个关注再走吧🧐~