工业搜索长期围绕同一条技术主线演进:让结果「找得更全、排得更准、转化更高」。查询理解不断深入,召回覆盖持续扩大,排序目标日益精细,生成式搜索与大模型也在持续拓展系统的能力边界。
但随着系统日趋复杂,真正制约迭代效率的已不只是能否设计出更强的模型,而是:如何在持续变化的真实流量中,稳定地找到并验证可信的优化方向。
工业搜索并不缺少可以尝试的方案,真正稀缺的是一套将实验结果转化为可靠认知的机制。
一个策略从想法走向上线,需要经过假设提出、候选设计、策略实现、离线评估、小流量验证和正式 A/B 实验;随着业务规则和控制参数不断累积,搜索空间迅速膨胀,不同变量之间也高度耦合。
系统必须回答:一次收益究竟来自稳定规律还是偶然波动,一次失败否定了哪个假设,有限的线上流量又应该投入到哪些更有潜力的方向?
大模型智能体的发展,为自动化这条研究链路提供了新的可能。但自动生成候选、执行更多实验,并不等于实现了自动研究。许多 AutoResearch 框架采用「指标更高即保留」的策略,隐含地假设不同实验结果可以直接比较。
然而,真实环境中的用户需求、流量结构、内容供给和系统状态持续变化,短期增益很容易被误判为稳定提升;离线评估、小流量验证和正式线上实验,在成本、目标一致性与统计可靠性上也并不等价。
若缺少统一的证据解释与候选晋级机制,更多实验未必带来更准确的认知,反而可能更快地积累错误结论、消耗线上流量。
PEAR 正是对这一问题的回应。它将工业搜推 AutoResearch 的重点,从「自动生成候选、执行更多实验」推进到「依据可信证据持续更新研究方向」。
字节跳动 Global E-Commerce Agentic Search 团队在技术报告《PEAR: Progressive Evidence-Based AutoResearch for Industrial Search Systems》中,提出并验证了一套面向工业搜推系统的渐进式、证据驱动 AutoResearch 框架:低成本实验负责扩大探索,高成本线上实验负责验证关键候选,各阶段产生的证据则持续用于修正假设和引导后续搜索。
在 TikTok 电商搜索的真实业务中,PEAR 已用于多个搜索策略的自动优化。在 3 个策略任务的不同搜索阶段中,系统从 14~147 个 L2 实验组中逐步筛选出 1~5 个候选进入后续线上验证;当早期线上结果未达预期时,已有证据会用于修正假设、终止缺乏支持的分支,并将搜索扩展到新的候选空间。
最终,两项决策级 A/B 实验分别推动 Main Order/DAU 显著提升 2.7336% 和 3.2957%;GMV/DAU 最高提升 2.2136%,ASN、SKU Order/DAU、Main OPMS 和 SKU OPMS 等指标也取得显著改善。

技术报告: PEAR: Progressive Evidence-Based AutoResearch for Industrial Search Systems
研究团队: ByteDance Global E-Commerce Agentic Search Team
论文链接: https://arxiv.org/abs/2609.35031
👉👉👉 PEAR 的核心**贡献是:不是仅仅提出一种新的 RSI Agent,而是提供了面向搜推这种工业级别在线系统的 MLE-RSI 可靠的 rollout 与 evaluate 环境框架;使得策略 evolving/training 的离线环境与在线系统尽量保持一致,同时根据 AutoResearch 的不同阶段使 evaluate 越来越接近线上指标。
背景:工业搜索 AutoResearch,正在从自动执行走向可信决策
如果说提出假设解决的是「还可以尝试什么」,实验自动化解决的是「能不能更快地试」,那么工业搜推系统 AutoResearch 真正要回答的是:系统能否从不断变化的实验结果中形成可靠判断,并据此持续找到更好的方向。 这要求系统不仅执行实验,还要理解不同结果提供了多强的证据,以及这些证据应该如何改变下一轮搜索。
现有自动化迭代面临三个挑战:
1. 一次指标提升,不等于获得了可靠规律
在线搜索的用户需求、内容供给和流量分布持续变化。同一个策略在不同实验窗口中的表现可能并不一致。
如果简单地把单轮最高分作为下一轮起点,系统很容易将短期波动误判为稳定收益,并在错误方向上继续投入实验预算。
2. 不同实验结果,具有不同的决策价值
低成本代理评估可以快速覆盖大量候选,却不一定与最终线上目标完全一致;真实流量实验能够直接观测用户反馈,但成本更高、周期更长,也伴随着更大的业务风险。
如何让候选从低成本探索逐步进入高可信验证,是工业搜索 AutoResearch 无法绕开的核心问题。
3. 保存实验记录,不等于积累搜索知识
一个分数只能描述候选在特定环境中的表现,却无法单独说明收益来自什么机制、结论适用于哪些条件,以及失败否定了哪个假设。
如果历史结果没有与研究假设和实验上下文建立联系,Agent 即使完成了更多实验,也可能反复探索相似区域,或被偶然出现的高分引向错误方向。
因此,PEAR 的核心贡献是:不是仅仅提出一种新的 RSI Agent,而是为工业搜推场景中的 MLE-RSI 提供一套可靠的实验展开(rollout)与效果评估(evaluation)框架。
它让候选沿着成本和证据强度逐步提升的路径接受验证,并将每一阶段的结果用于修正假设、淘汰无效方向和指导后续搜索,在探索效率、线上风险与决策可信度之间建立平衡。
PEAR 怎么做?把策略优化组织成可积累、可验证、可回流的证据闭环
PEAR 由两个相互配合的部分组成:Evidence-driven AutoResearch 负责维护策略研究状态,决定下一步应该探索什么;Confidence-Gated Verifier Ladder 负责组织不同强度的评估证据,判断一个策略是否值得继续验证。
两者共同形成「提出假设—设计策略—分层验证—更新认知—继续研究」的闭环。

Evidence-driven AutoResearch:让实验结果变成策略认知
Research State:把分散的实验记录组织成策略认知
PEAR 的贡献不只是为 Agent 增加一份实验记忆,而是改变实验结果被组织和使用的方式。系统为每个策略任务维护独立的研究状态,包括优化目标、干预边界、当前假设、历史方案,以及每次实验对应的评估层级和流量环境。
传统AutoResearch方法往往根据单轮分数保留当前最优方案;PEAR 则以策略假设为研究单位,将结果保存为带有上下文的证据。一次正向结果只构成对假设的支持,而不会被直接当作稳定规律;失败和冲突结果同样会被保留,用于识别风险边界并修正后续方向。
Strategy Evolution:让证据决定下一轮研究什么
对于每个策略任务,PEAR 都维护独立的研究状态,包括优化目标、干预边界、当前假设、历史方案和累计证据。
Agent 按照 Plan—Execute—Evaluate—Update 持续推进:基于已有证据设计策略,执行实验,判断结果对假设构成支持、反驳还是仍不确定,再据此决定复验、调整方向或停止当前分支。
这种设计避免了系统被一次偶然高分带偏。面对非平稳流量,单轮正向结果只会成为一条支持证据,而不会被直接当作稳定规律;失败和冲突结果也会被保留下来,用于修正假设、识别适用边界并扩大后续探索。
由此,PEAR 将分散的实验记录转化为能够跨轮积累、持续修正并指导下一轮策略设计的研究认知。
Verifier Ladder:让策略沿证据强度逐级验证
不同评估方式提供的证据并不等价。低成本代理评估适合扩大探索,但不能直接替代真实用户反馈;线上 A/B 最接近最终业务目标,却需要更多流量、时间和实验资源。
为此,PEAR 将策略验证组织为四个递进层级:
- L1 Offline Replay:在固定的历史请求集上,同时回放候选策略与基线策略,并使用代理模型评估排序结果,以较低成本完成大规模策略初筛。
- L2 Shadow-Traffic Evaluation:将线上实时请求复制为影子流量,让候选策略在与线上一致的环境中运行,但不对用户结果生效;通过代理反馈,检验策略在动态流量和实时特征下能否保持稳定表现。
- L3 Rapid Online Evaluation:将筛选后的策略部署到小规模随机真实流量中,在较短观察窗口内读取真实用户反馈,验证代理评估中的正向收益能否迁移到线上。
- L4 Decision-Grade Online Evaluation:通过更充分的随机流量和更长的观察周期,对策略收益、稳定性与业务风险进行正式 A/B 验证,形成支持最终上线决策的证据。
四个评估层使用的流量、反馈信号和观察周期各不相同,每一层都在自身实验条件下,将候选策略与对应基线进行比较,采用统一的置信度门控:显著正向的策略晋级,证据不足的继续观察,显著负向的停止验证。不同层级仍然保留各自的评估信号和实验条件,统一的是证据结构与晋级规则,而不是将所有结果合并成一个总分。
证据回流:一次失败,也要改变下一轮搜索
Verifier Ladder 负责让策略从低成本探索逐步进入高可信验证,但 PEAR 的目标并不只是筛选一个暂时领先的方案。每一层产生的评估结果和晋级结论,都会回流到对应策略的研究状态。
在同一个评估层级内,Agent 可以根据新证据继续提出策略、复验机制或探索替代方向;当方案进入更高层级后,真实线上结果又会反过来检验此前的代理判断和研究假设。
如果一个策略在低成本评估中表现突出,却没有在正式线上实验中取得预期收益,PEAR 不会只记录一次“上线失败”。系统会继续追问:此前的代理信号是否存在偏差?策略假设是否只在特定条件下成立?这些后验信息会被写回研究状态,用于修正假设并重新设计下一轮策略。
由此,PEAR 形成两个相互连接的循环:
- 策略验证循环:策略方案沿 Verifier Ladder 获得逐步增强的证据,从广泛探索收敛到决策级验证;
- 认知更新循环:各层证据持续回流研究状态,支持策略归因、假设修正和下一轮方案设计。
这也是 PEAR 与普通自动实验系统的关键区别:低成本评估负责扩大策略探索,高成本实验负责把策略结论做实,而持续回流的证据负责让系统在每一轮之后变得更懂得该往哪里走。
真实工业系统验证:从大规模探索到可信线上收益
PEAR 在真实工业在线搜索系统中完成了端到端验证。实验主要展示 3 个策略优化任务,重点考察三件事:系统能否从大规模实验中筛选出少量高潜策略,低成本代理证据能否迁移到真实线上,以及线上结果能否反过来修正后续研究方向。
从大规模实验中收敛出少量线上候选
在 3 个策略任务的多个搜索阶段中,PEAR 累计完成 70 轮策略研究、评估 454 个实验组。单个阶段覆盖 14~147 个实验组,最终仅有 1~5 个候选进入更高成本的线上验证,晋级率为 1.36%~7.14%。这说明低成本评估能够承担广泛探索,而宝贵的线上流量可以集中用于证据更充分的策略。

线上反馈能够改变下一轮研究方向
一个代表性任务在前两阶段没有获得显著线上收益。PEAR 没有将这些结果简单视为失败,而是把后验反馈写回研究状态,重新校准代理判断、终止缺乏支持的分支,并扩大后续策略探索。经过方向修正,第三阶段最终找到显著正向策略,Main Order/DAU 提升 3.2957%。

代理证据能否迁移到真实线上?
两个晋级候选在 L2 影子流量评估、L3 快速线上评估和 L4 决策级实验中均呈现显著正向结果,展现出清晰的跨阶段方向一致性。三个阶段从代理信号到真实用户反馈逐步增强证据强度,共同验
证了低成本代理评估的候选筛选价值,并为后续线上决策提供了可靠依据。

优化策略取得显著业务收益
在最终的决策级 A/B 实验中,PEAR 优化后的两个线上策略相较各自基线,分别推动 Main Order/DAU 显著提升 2.7336% 和 3.2957%。与此同时,ASN、SKU Order/DAU、Main OPMS 和 SKU OPMS 等多项指标也取得显著改善。

总结
PEAR 为工业界搜推系统提供了一种新的持续优化范式,通过连接假设提出、候选探索、分层评估、线上决策与证据回流,系统能够将每次实验转化为可积累的研究认知,并持续指导后续优化。
未来,PEAR 将进一步提升复杂空间中的搜索效率,拓展至模型训练、模型架构优化等更广泛的干预空间,并逐步形成适配不同任务与业务场景的通用 RSI 框架。