1. 首页
  2. 精选文章
  3. 当 Harness 也能被 AI 自动设计:AI4AI 正在重写小模型变强的方式

当 Harness 也能被 AI 自动设计:AI4AI 正在重写小模型变强的方式

  • 发布于 2026-08-31
  • ·
  • 10 次阅读
  • ·
  • ·

今年,AI 的竞争正在悄悄换一个方向:决定一个 AI 系统能力的,开始不只是模型本身,还有模型外面的那套“工作方式”。

过去,我们想让一个模型变强,通常意味着继续训练它:更多数据、更好的反馈、更大的计算量,本质上都是在改变模型内部的参数。但 Agent 时代正在让另一条路线变得越来越重要:模型可以完全不变,只要给它更好的外部系统,它也可能完成原本做不到的任务。

比如,把复杂任务拆成明确步骤,把计算交给工具,把重要信息存进记忆,把确定性的规则写成程序,再用验证器检查结果。就像同一个员工,在没有接受任何新培训的情况下,仅仅因为获得了一套更好的工作流程、工具和检查机制,最终表现就可以截然不同。

这类围绕模型搭建的外部能力系统,通常被称为 HarnessScaffolding

而来自 Salesforce AI 和 UIUC 的这项研究进一步提出了一个更有意思的问题:

如果强模型已经知道怎样解决一个问题,它能不能不去训练弱模型,而是直接为弱模型设计一套合适的 Scaffolding,把自己的能力“外置”并迁移过去?

论文将这一问题称为 Strong-to-Weak Scaffolding:让更强的 AI 为更弱的 AI 自动构建“认知外骨骼”。

从这个角度看,它探索的已经不只是模型能力迁移,而是一种更广义的 AI4AI未来的 AI,不仅解决人类的问题,也开始主动设计和改造其他 AI 的工作方式。

论文链接:https://arxiv.org/pdf/2608.12307

结果非常直接地证明了这条路线的潜力。在主实验中,GPT-5.4-mini 裸模型的平均准确率只有 0.488;加入由强模型自动构建的 Harness 后,最高成绩跃升至 0.912,性能几乎提升了一倍。

更值得注意的是,研究中面向 GPT-5.4-mini 进行的 57 次 Harness 自动搜索与构建,没有一次低于原始模型。其中最优秀的 Harness,甚至让这个 mini 模型超越了多款原本能力更强、但直接裸跑的模型。

但如果故事只停留在“0.488 变成 0.912”,这项研究反而被低估了。作者真正想追问的是另一个问题:Harness 到底给弱模型补上了什么?

因此,他们没有只展示最终排行榜,而是继续把这近乎翻倍的性能增益逐层拆解:哪些能力来自更合理的任务分解,哪些来自工具和程序的介入,哪些来自验证与纠错,又有哪些原本属于强模型的解题策略,被重新编码进了弱模型外部的 Harness 之中。

换句话说,这篇论文真正试图解释的,不只是 “弱模型能被增强多少”,而是 “强模型的能力究竟可以以什么形式被迁移出去”。而这个答案,可能比 0.912 本身更重要。

一、强模型不替弱模型答题,而是替它改“系统”

这项工作的实验规则其实很简单:更强的 AI 从头到尾都不能直接替小模型完成最终测试。 它能做的,只有一件事:在考试开始之前,为小模型重新设计一套运行系统。

研究中,真正面对测试题的是 Target AI「目标模型」;能力更强的 Builder AI「构建模型」 则扮演系统设计者。Builder 会获得一个可编程环境,可以修改 Prompt、编写 Python 代码、加入规则与状态管理、设置检查流程,最终产出一个包裹在 Target 外部的 Harness

这意味着,它优化的并不是模型参数,而是模型解决问题的路径。

比如,某类题可以先被自动识别,再交给专门的 Prompt;确定性的计算可以直接交给程序;容易遗漏的条件可以显式记录;最终答案也可以经过额外校验。甚至当 Builder 发现某个子任务本身存在稳定算法时,它完全可以绕开语言模型推理。

但 Builder 能看到的数据非常有限。

对于每个 Benchmark,只有随机抽取的 5% 样本会暴露出来作为 Validation Set。Builder 可以利用这部分数据观察 Target 的失败模式,反复修改 Harness;一旦开发结束,Harness 就会被锁定,随后直接运行在完全不可见的 Hidden Test Set 上。

因此,这里的关键挑战并不是记住少量样本,而是完成一次更高层次的判断:

哪些错误来自模型本身,哪些可以通过系统设计解决?哪些步骤值得交给语言模型,哪些步骤应该直接程序化?

Strong-to-Weak Scaffolding 真正研究的,就是这种能力:让强模型学习如何组织弱模型,而不是亲自替弱模型解决问题。

图1:AI4AI 的整套设计流程:Builder AI 并不直接解决问题,而是给 Target AI 搭建脚手架以减轻其认知负担,从 Harness 角度实现最基本的 AI4AI 能力迁移。

二、为什么偏偏用 ToM 测 Harness?

作者没有选择普通的数学题或知识问答,而是把实验放在 Theory of Mind「心智理论」 上。原因很直接:这类任务天然混合了两种完全不同的“思考”:

  • 一部分是可以机械处理的:谁看见了什么、谁离开过、物体被移动到了哪里,这些都可以写成显式状态并持续更新。
  • 另一部分却很难直接程序化:一个人相信什么、误解了什么、另一个人又如何理解他的信念,甚至还会出现多层嵌套。

因此,ToM 恰好提供了一个很好的观察窗口:当 Harness 开始接管推理时,它究竟拿走的是哪部分认知工作?

实验覆盖四个 Benchmark:BigToM、Hi-ToM、MMToM-QA 和 MuMA-ToM。这些任务横跨信念追踪、递归心智状态、对话与行为理解,以及 Bayesian Goal Inference,复杂度和任务结构都并不相同。

在此基础上,研究人员让不同能力的 Builder 进入 Cursor、Claude Code、GPT Codex 等 Agentic Coding Environment,自行探索如何为 Target 构建 Harness。

最终,他们一共得到 72 次独立构建实验。而后续分析也系统性追踪了更多问题:Builder 强弱有多重要?Validation Budget 是否决定效果?不同 Coding Environment 会不会改变结果?哪些 Harness 技巧能够稳定复用?不同 Target 是否需要完全不同的设计?更关键的是:

当性能上升时,原本属于模型的“认知负担”,到底被转移到了哪里?


表1:以 GPT-5.4-mini 为 Target AI 的实验结果摘要及对比

图2:全量主实验结果

三、Harness 的收益,甚至超过了直接换更强模型

最反直觉的结果是:升级系统,有时比升级模型更有效。

GPT-5.4-mini 裸跑四个任务时,平均准确率只有 0.488。加入自动生成的 Harness 后,平均提升到 0.763,最佳达到 0.912;而更强的 GPT-5.4 在没有 Harness 的情况下,也只有 0.619

换句话说,一个被正确编排的小模型,完全可以跑赢一个没有外部支持的强模型。

而且这种提升非常稳定。针对 GPT-5.4-mini 的 57 次 Scaffold Run 全部优于 Baseline,11 种 Builder Configuration 也全部实现了平均正增益。这说明 Harness 带来的不是偶然中奖,而是一种可重复的系统性收益。

不过,自动设计还没有追平人工经验。此前人工构建的 UserHarness 可以把 GPT-5.4-mini 推到 0.939,仍高于自动 Harness 的最佳 0.912

这个差距反而提出了更有价值的问题:

自动 Harness 已经学会了什么,而人类设计者还掌握着哪些它没学到的结构?

四、应该把哪些东西从 AI 的大脑里搬进 Harness?

表2:模型使用的 Harness 技巧统计以及对 Target AI 带来的效果提升

发现一:最有效的 Harness,并不是让弱模型思考得更久

一种最自然的猜测是:小模型不够聪明,那强模型帮它写一个超级 Prompt,让它多做 Chain-of-Thought、多采样几遍、多自我检查,是不是就行了?

实验的结果却并非如此,而是指向了另一件事:Builder AI 最常采用的措施,首先是一些听起来甚至有点“朴素”的工程手段:答案格式约束、Greedy Decoding、任务 Routing、结构化输入输出

而真正区分优秀 Harness 的,则往往是更进一步的东西:Deterministic Solver、Structured Extraction、Polarity Logic,以及显式的状态追踪等等。

换句话说,好的 Builder 并不是不断告诉弱模型 “请再认真想一遍”,而是会进一步问 “这里为什么还需要你想”。 如果某段推理其实存在稳定规律,就把它写成代码;如果某个步骤只是在机械地记录谁看到了什么,就把状态显式存起来;如果问题可以先分成四类,就不要要求模型每次重新理解整个任务。

论文还发现,Harness 中由外部代码和规则直接完成的工作比例,与最终准确率存在很强的正相关 (r=0.72);相反,单纯“代码写得更多”与准确率的关系非常弱,只有约 (r=0.22)

这两组数字放在一起看,我们不难发现:

有效的 Harness 不是给模型增加更多思考,而是在删除那些本来就不应该由概率模型承担的思考。


图3:Builder AI 将任务结构外化从而降低 Target AI 的认知负担,这种认知负担的转移是 AI4AI 通过 Harness 成功提升小模型能力的关键

发现二:真正发生的不是知识迁移,而是认知结构迁移

这是整篇文章最值得细想的核心。传统蒸馏的逻辑,是让老师把知识教进学生的大脑。但这里 Target AI 的参数从头到尾根本没有变化。强模型真正留下来的反而可能是一个分类器,一组规则,一套状态表示,若干程序,以及一整套约束弱模型如何工作的流程等等。

也就是说,被迁移的并不是某个问题的答案,也不完全是语言层面的知识,而更接近于:

强模型把自己对“这个任务应该怎样思考”的理解,编译成了一套小模型能够执行的外部结构。

论文把这一现象称为 Cognitive-Load Reduction「认知负担降低」:即一部分工作被彻底 Offload 给程序和工作流;剩下仍然需要模型处理的问题,也会被 Harness 重新组织成范围更小、输入更清晰、输出更受约束的子任务。

从这个角度看,Strong-to-Weak Scaffolding 很像给弱模型制造了一副“认知外骨骼”:外骨骼并没有让人的肌肉本身突然变强,但它改变的是原本需要肌肉独自承担的负荷,现在却被整个 Harness 系统重新分配了。

图4:在不同 Benchmark 上对于残存错误的统计分析

发现三:不是所有思考,都同样容易被编译成规则

这篇文章也没有得出一个过度乐观的结论,因为并不是所有智能都能轻易写进 Harness。其实四个 Benchmark 之间就已经出现了非常明显的差异。

例如在 BigToM 中,大约 94% 的任务最终可以被 Harness 通过固化工作流处理。正是因为这个任务存在很多稳定的“谁看到了什么、谁没有看到什么”的规律,因此 Builder 很容易把它们编译成程序。

但到了 Hi-ToM,这一比例降低到约 51%。 而更加开放、依赖对话和社会推理的 MuMA-ToM 只剩下约 36%

这实际上也划出了一条非常有意思的边界:AI 推理中,一部分困难来自“计算和组织不可靠”;另一部分困难则来自问题本身真的需要理解和推断。

前者非常适合被 Harness 消灭,但是后者却不会因为多写几百行代码就自动消失。论文对于残余错误的分析也印证了这一点:Hi-ToM 中随着 belief recursion 越来越深,准确率明显下降;MMToM 中更复杂的 Bayesian goal inference 依然困难。因此,这篇研究真正提出的不是代码可以替代推理,而是一个更加精细的问题:

未来的 AI 系统,应该学会判断哪些认知和推理活动应该交给模型,哪些应该被编译成工具、状态和规则,通过 Harness 来自动化。

图5:Builder AI 可以不断让 Harness 自我进化,提高 Target AI 的下游任务表现。但是这个表现好坏与 Builder AI 进行 Harness 进化的轮数并不成正比,反而和推理强度正相关

发现四:强模型真正的价值,体现在更会看懂任务

Builder AI 在构建 Harness 的过程中可以不断自我反思进化,重跑 Validation。直觉上,测试次数越多,应该越容易找到一个好的方案。但实验并没有发现这样的关系。

最终完整测试集表现与 Validation 最佳成绩高度相关;但是与 Builder 一共进行了多少次 Refinement 的相关性只有 (r=0.17)

相反的,当研究人员固定 Builder 为 Opus-4.7,只提高 Builder 自己的 Reasoning Effort 时,不同平台上 Builder AI 搭建的 Harness 质量都呈现持续上升趋势。

这意味着强 Builder AI 的优势似乎并不主要来自更勤奋地试错,而是要更快地发现这个任务到底有什么可以被利用的结构。

这其实给“推理算力应该花在哪里”提供了一个非常不同的视角:与其让弱模型在未来的每一道题上都重复进行昂贵而不稳定的思考,不如让强模型先进行一次更昂贵的元推理,即

先想清楚以后应该怎么想

然后把再这个结论固化进 Harness。

表3:相同 Builder AI 在面对不同 Target AI 时,Harness 对小模型带来的收益往往由其已有的能力决定:已有能力越强 Harness 越有可能成为束缚

发现五:越弱的模型,越可能从好的 Harness 中受益

文章进一步换掉 Target AI,用本身表现已经更强的 Gemini-3.5-flash 再次进行实验。一个非常清晰的规律便出现了:Target 原本留下的 Headroom 越大,Harness 能够实现的提升也往往越大。

论文在不同 Target×Benchmark 条件下得到的相关性约为 (r=0.75)。对于 GPT-5.4-mini,很多 Builder 可以产生 0.2、0.3 甚至更大的提升;而当 Target 本身已经非常擅长某些任务时,复杂 Harness 的收益会迅速缩小,个别任务甚至会出现轻微退步。

这其实非常符合现实中的组织经验。一个已经能够独立处理任务的专家,被强行塞进十层审批、二十张表格和固定流程里,未必会工作得更好。Harness 本质上也是一种约束:

对于能力不足者,它是脚手架;对于已经足够强的人,它也可能变成束缚。

因此,未来优秀的 Harness 不会是一个对所有模型都固定不变的“超级 Prompt”,而需要动态判断这个模型在哪些地方需要帮助,哪些地方应该放手。

五、AI4AI 的真正变化:Scaling 开始走出模型

这篇工作让我们重新思考:AI 能力究竟应该以什么为单位来衡量?

过去,我们习惯把模型单独拎出来测试。但真实的 Agent 系统早已不是一个裸模型:它身边有 Memory、Tools、Router、Verification、Skills、Context Management,还有大量程序化逻辑。

因此未来更重要的问题,可能不再是:这个模型有多强? 而是:这个模型被放进一个足够好的系统之后,能有多强?

这篇论文给出了一个很直观的例子:0.488 的 Model Capability,可以对应 0.912 的 System Capability。 这也改变了强模型应该扮演的角色。最强、最昂贵的 AI 未必需要亲自处理所有任务。

它也可以先成为 Builder:分析问题结构、诊断弱模型、设计 Harness、编写工具和验证规则,再把之后的大量执行交给成本更低的 Target AI。

于是,一个很有意思的经济问题出现了:

强模型昂贵的“思考”,能不能只发生一次,却被后续成千上万次调用重复利用?

如果可以,那么 Scaling 就不再只是不断购买更多 inference compute。另一种 Scaling 方式,是把高成本智能沉淀成可以重复执行的结构。

而这可能也是 AI4AI 更现实的一条路径。

它不一定意味着 AI 立刻开始重新训练、修改甚至递归创造另一个 AI。更早发生的事情,可能是:AI 开始为 AI 设计 Prompt、工具、规则、记忆和工作流,也就是设计另一个 AI 所处的运行环境。

当优化对象从“如何答好一道题”上升到“如何设计一个更会答题的系统”,模型与 Harness 之间也可能形成新的 Co-evolution「共同进化」

更强的模型创造更好的 Harness;更好的 Harness 又把模型能力推向新的上限。

过去十年的 Scaling,主要是在模型内部堆参数、数据和计算。而 Agent 时代的下一轮 Scaling,可能越来越多地发生在模型之外——怎样拆任务、怎样调用工具、怎样保存记忆、怎样验证错误,以及怎样把强 AI 的经验编译成弱 AI 可以反复使用的基础设施。

如果传统蒸馏是在尝试把老师的能力塞进学生的参数里,那么 Strong-to-Weak Scaffolding 展示的是另一条路:

不必先让学生变成老师,也可以先让老师替学生设计一套更聪明的工作方式。

这或许才是 AI4AI at Test-Time 最值得关注的地方。

目录