1. 首页
  2. 青稞Talk
  3. 直播预告!从 Harness 看 AI4AI 如何实现

直播预告!从 Harness 看 AI4AI 如何实现

  • 发布于 2026-09-03
  • ·
  • 1 次阅读
  • ·
  • ·

我们能否在不更新任何模型参数的情况下,把强模型的能力迁移给弱模型?

我们通常认为,更强的 AI 能力需要通过蒸馏,OPD等各种方式训练更弱的模型,但在 Harness 的热潮下,一个更本质的问题值得探索:如果完全不改模型参数,强模型能不能在 test time 直接帮弱模型“搭好思考方式”?

Harness 的本质其实就是 Strong2Weak Capability Transfer,基于这个想法,最新的一篇工作做了以下探索:让强模型作为 builder,自动为较弱的 target model 构建 inference-time harness,包括 task routing、structured extraction、deterministic code、verification 和 output control 等,而 target model 本身不需要任何训练。

论文:AI4AI at Test-Time: Strong-to-Weak Capability Transfervia Harnesses
链接:https://arxiv.org/pdf/2608.12307

实验发现,仅仅改变模型外部的 harness,就能让 GPT 在不同 Benchmark 上的准确率提升将近翻倍。而且这种提升并不是简单让弱模型“想得更久”,而是让强模型把一部分 reasoning 编译成 code、rules 和 structured procedures,减少弱模型真正需要解决的认知负担。

研究显示,harness 中能够被 offload 的 reasoning 越多,最终效果通常越好;同时,builder model 越强、投入的 reasoning effort 越高,构建出的 harness 也往往越有效。

这个结果也提供了一种有趣的 AI4AI 视角,未来AI4AI的范式下,能力往往不一定要被压缩进 weights,也可以被外化成 tools、code、routing、verification 和 harness 等等不同形式存在。

AI4AI的未来,也不只是拥有一个更聪明的模型,而是让 AI 学会如何为 AI 构建更好的思考环境。

9月5日(周六)10:00点​,青稞Talk 第151期,UIUC 博士生钱成,将直播分享《AI4AI at Test-Time:从 Harness 看 AI4AI 如何实现以及未来

青稞介绍

钱成,伊利诺伊大学厄巴纳-香槟分校(UIUC)计算机学院二年级博士生,导师为季姮教授。本科毕业于清华大学,期间师从刘知远教授。他的研究主要聚焦于大语言模型智能体,尤其关注智能体推理、工具使用与创造力等方向。他一作发表 ToolRL、UserRL 等代表性工作,相关论文目前已在 Google Scholar 上累计获得超过 3600 次引用。

钱成曾获 Capital One ASKS Center Fellowship,并担任 ACL、EMNLP 等会议的领域主席(Area Chair),以及 NAACL 2027 Student Research Workshop 的 Program Chair。他还牵头组织了 ICLR 2026 和 COLM 2026 Lifelong Agent Workshop,并长期担任 NeurIPS、ICLR、AAAI 等国际学术会议的审稿人。

主题提纲

AI4AI at Test-Time:从 Harness 看 AI4AI 如何实现以及未来

1、从蒸馏、OPD 到 Harness,AI4AI 范式的演进?
2、测试时能力迁移:AI4AI 最本质的实现方式?
3、让强模型当架构师:自动构建弱模型的 Harness
4、一个有效 Harness 由什么组成?
5、从实验结果看 Harness 的价值边界
6、探讨 AI4AI 的未来 & AMA(Ask Me Anything)环节

直播时间

9月5日(周六)10:00 - 11:00

目录