1. 首页
  2. 青稞Talk
  3. 直播预告!如何在真实 Coding Agent Harness 中接入 RL?

直播预告!如何在真实 Coding Agent Harness 中接入 RL?

  • 发布于 2026-09-05
  • ·
  • 9 次阅读
  • ·
  • ·

随着编码智能体从“模型能力”走向“模型 + Harness”协同,工具调用、上下文管理与控制流正在成为影响智能体能力的重要因素。

然而,将真实 Agent Harness 接入强化学习训练并不简单:环境故障与奖励投机会污染训练信号,训练与推理环境的差异也可能导致策略更新偏离真实 Agent 行为。

华为和港中文最新开源的 Lego-RL 从三个方面解决了这些问题:Faithful(保真优化)、Reliable(可靠执行)和 Observable(可观测训练)。

华为&港中文最新开源 Lego-RL:让 Coding Agent 的强化学习训练真正"长稳可靠"

论文:https://arxiv.org/abs/2608.17393
代码:https://github.com/LegoX/Lego-RL

Lego-RL 不需要修改 OpenHands SDK、Claude Code 或 OpenCode 的任何一行代码,就能把它们直接接入强化学习,基于 Qwen3.5-35B-A3B,三个 harness 上的 SWE-bench Verified 分数分别从 64.0 / 62.4 / 57.2 提升到 70.4 / 68.2 / 66.6。

Canvas – 980.png

9月8日(周二)20:00青稞Talk 第152期,华为莱布尼兹研究所研究员、香港中文大学博士杜一鸣,将以 LEGO-RL 为核心案例,介绍面向真实编码智能体的 Harness-Native 强化学习方法,重点拆解其“忠实优化、可靠执行、可观测训练”三大设计,并结合多种 Coding Agent 的实测结果,分析 Harness 对训练效果、任务筛选、系统效率及 Agent 行为变化的影响。

同时也将介绍 Agent Plugin 如何支持训练校验、实时诊断与人工复盘,形成从数据准备到训练运维的半自动化闭环,并进一步讨论这套方法对实际 Agent 研发与训练基础设施建设的启示。

青稞介绍

杜一鸣。香港中文大学博士,师从黄锦辉教授,华为莱布尼兹研究所研究员,研究方向为代码智能体、强化学习、记忆智能体,曾在顶级会议ICLR、AAAI、EMNLP等发表多篇论文包括AAAI2026 Oral,曾获ACL SIGHAN 2024最佳论文,是Lego-RL代码智能体强化学习训练框架核心开发者,也是华为LegoX 系列工作的贡献者。

主题提纲

Lego-RL:面向真实 Coding Agent 的 Harness-Native 强化学习方法

1、Coding Agent 概述与训练范式之变
2、把真实 Harness 接进 RL 的挑战
3、Lego-RL:Harness-Native 强化学习方法设计
4、多种 Coding Agent 的实测结果与分析
5、基于 Agent Plugin 的训练运维半自动化闭环
6、对未来的启示AMA(Ask Me Anything)环节

直播时间

9月8日(周二)20:00 - 21:00

目录