当前 Agent 训练面临两难:
- 传统环境静态僵化,Agent 易过拟合;
- 完全合成环境又易产生逻辑幻觉。
而 Agent 本质上是一个不断与环境(Environment)进行交互的主体:感知反馈、做出决策、影响环境。在自进化 Agent 的主流范式中,往往高度依赖 Agent 在环境中的单向探索来拉升性能。
那么问题来了:在这个闭环中,有没有可能让环境也随之进化起来,与 Agent 互相博弈,达成“左脚踩右脚”上天的效果?

EnvHarness 提出了“无侵入式可编程包装层”的新范式——无需修改底层环境代码和真值校验器,仅通过在初始状态 (Stage)、交互契约 (Contract) 与任务链 (Chain) 维度注入可编程组件,即可动态改变环境的观察与转换逻辑。
论文:EnvHarness: Awakening Static Worlds for Agent Learning
链接:https://arxiv.org/abs/2608.19880
主页:https://www.envharness.com
代码:https://github.com/google-research/envharness

结合 ENVRIGGER 的“观察-诊断-编写-验证”自动化闭环,EnvHarness 能够精准靶向 Agent 的能力短板,重构出渐进式、高强度的对抗性环境,将环境从“被动的测试集”升级为“主动的演化催化剂”,为复杂 Agent 的针对性技能进化提供了极具扩展性的通用基础设施。

9月12日(周六)上午10:00,青稞Talk 第153期,青稞社区邀请到华盛顿大学圣路易斯分校博士生黄呈松,对 EnvHarness 进行直播讲解。欢迎一起来交流学习~~
青稞介绍
黄呈松,华盛顿大学圣路易斯分校(WUSTL)计算机科学与工程系博士生,导师为 Jiaxin Huang 教授,本科毕业于复旦大学软件工程专业,曾任 Google Student Researcher。研究方向为大语言模型与视觉语言模型,专注于测试时计算扩展、自演化推理与可编程 Agent 环境设计。代表工作包括 LoraHub(LoRA 跨任务无缝组合)、R-Zero(零数据自演化推理)与 EnvHarness(Agent 可编程环境重构框架)等,这些项目均在 GitHub 上获得 500+ Stars。
主题提纲
EnvHarness:左脚踩右脚!让环境随着 Agent 的训练一起进化
1、Agent 训练的难点,以及为什么需要会进化的环境
2、EnvHarness:无侵入式「环境脚手架」
3、ENVRIGGER 的“观察-诊断-编写-验证”自动化闭环
4、长线实验中的 "Scaling"能力验证
5、探讨模型 × 环境协同进化的未来
6、AMA(Ask Me Anything)环节
直播时间
9月12日(周六)10:00 - 11:00