VLA 刷爆了 Benchmark,却依然搞不定真实世界里的细微变化。
面对这一困境,继续堆叠参数与数据未必是唯一解。数字 AI 的进化已经给出了启发:以 Claude Code 为代表的 Coding Agent,其突破不仅源于更强的 LLM,更依赖于模型之外的执行组织系统(Harness Layer)——模型负责思考,Harness 负责维护上下文、调度工具与纠错容错。
那么,具身智能的下一站,是否也该给 VLA 装上它的 Harness Layer?

借鉴数字 Agent 通过 Harness Layer(执行组织系统)实现能力跃升的经验,清华大学于超教授团队最新提出了 Harness VLA,首次将 Harness 机制引入具身智能。
论文:Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents
链接:https://arxiv.org/abs/2607.08448
代码:https://github.com/RLinf/RPent
Harness VLA 是一个开源的面向机器人操作任务的记忆增强式执行框架。它突破了单靠扩大模型规模的传统路径,通过“模型能力 + 系统组织能力”的协同设计,大幅提升了机器人在长程任务与复杂环境下的稳定执行与泛化能力。
不同于直接训练更大的端到端 VLA 模型,Harness VLA 在保持底层视觉语言动作模型冻结的基础上,引入 Agentic Planner 与 Harness Layer,对模型调用、任务分解、状态检查、失败恢复和经验复用进行统一组织。

系统将 frozen VLA 封装为负责抓取、放置、按压、抽屉/门操作等接触密集行为的 VLA_ACT Primitive,同时结合 MOVE_TO、RELEASE、SET_GRIPPER 等解析式原语完成稳定的空间移动、位姿调整与非接触执行。
通过探索式自举阶段,Harness VLA 从环境反馈中学习成功的原语组合轨迹,并将任务级执行结构沉淀为 Task-Specific Memory,将跨任务可复用的成功规则与失败模式沉淀为 Global Memory;
在部署阶段,系统根据当前任务指令和 RGB-D 观测重新绑定目标、位置与状态,而不是机械复现旧轨迹,从而提升机器人在扰动布局、长程任务和跨场景迁移中的泛化能力。
实验表明,Harness VLA 在 LIBERO-Pro、RoboCasa365 和 RoboTwin C2R 等多个具有挑战性的机器人操作基准上取得显著性能提升,验证了“模型能力 + 系统组织能力”协同工作的具身智能新范式。

8月8日(周六)上午10点,青稞Talk 第144期,清华大学深圳国际研究生院硕士在读张翼显,将直播介绍 Harness VLA 的系统架构、原语设计、Agentic Planner、记忆机制与失败恢复流程,并讨论其在视觉语言动作模型、机器人长期自主执行、样本高效学习和通用具身智能系统中的应用价值。
青稞介绍
张翼显,清华大学深圳国际研究生院硕士在读,主要研究方向为具身智能与强化学习。其研究聚焦于面向机器人操作任务的具身智能框架,围绕视觉语言动作模型(VLA)、智能体规划、记忆增强决策与样本高效强化学习等核心问题,从策略学习、任务分解、失败恢复、经验复用与长期自主执行等角度进行探索。已在 ICLR 发表多篇第一作者论文,并参与发表 RSS 等国际会议论文,累计发表论文 10 余篇。曾担任 NeurIPS、ICLR 等国际人工智能会议审稿人。主要成果有Harness VLA, SAC Flow等,
主题提纲
从 端到端 VLA 到 Harness VLA:面向具身智能与机器人操作任务的记忆增强式执行框架
1、具身智能的困境:端到端 VLA 的能力边界
2、Harness VLA 的系统核心架构与原语设计
3、Agentic Planner、记忆机制与动态失败恢复流程
4、在扰动布局、长程任务和跨场景迁移中的实验验证
5、应用价值与未来技术趋势探讨
6、AMA (Ask Me Anything)环节
直播时间
8月8日(周六)10:00 - 11:00