1. 首页
  2. 精选文章
  3. 打假大模型动态评测:你以为的“最新考题”,模型其实早就背过答案?

打假大模型动态评测:你以为的“最新考题”,模型其实早就背过答案?

  • 发布于 2026-08-04
  • ·
  • 25 次阅读
  • ·
  • ·

如今,评测圈最流行的词之一就是 Live

旧题可能混进训练数据?那就不断收集刚刚发生的新题,专门挑选模型知识截止日期之后发布的题目,再按月、按季度更新测试集。

这类 Live Benchmark,也就是动态评测(Dynamic Evaluation),听起来几乎无懈可击:题目是在模型“闭卷”之后才出现的,它总不可能提前见过吧?

然而,一项最新研究给这个看似牢靠的逻辑打上了一个大大的问号:发布时间晚于知识截止日期,不代表问题真的超出了模型的已有知识。 正如 X平台知名AI博主@dongxi_nlp(马东锡NLP) 评论到,"Déjà Vu" 描述了这样一种奇特体验:当你完全清醒时,面对一个全新的场景或经历,却突然产生仿佛曾经亲历过的感觉, 仿佛记忆先于现实而至

来自香港浸会大学Yupeng Li教授的研究团队发现,即便在专门收集“截止日期之后”新 Claim 的动态基准中,仍有 17.09%–29.30% 的样本存在潜在污染风险;

换句话说,**你的 Benchmark 看起来很 Live,对大模型来说却未必真的 Live。**一道看似刚刚发布的“新题”,可能只是把旧知识换了个问法。污染最高可令多模态自动事实核查系统的 Macro-F1 虚高 11.34 个百分点,甚至直接改写模型排行榜。 面对这类"Déjà Vu" Claim 时,模型仿佛已经知道应该去哪里找。它发出的查询更加精准,更容易在前几条结果中命中相关证据,也就不必充分探索整个证据空间。

今天和大家深入聊一聊《**Novel Claim or Déjà Vu? Rethinking “Contamination-Free” Dynamic Evaluation for Multimodal Automated Fact-Checking》**这篇非常有意思的工作。

该论文由香港浸会大学、香港大学与北师香港浸会大学的研究团队共同完成,论文第一作者为Haorui He (香港浸会大学、香港大学),指导老师为香港浸会大学Yupeng Li教授,已被多媒体领域国际顶级会议 ACM Multimedia 2026(ACM MM 2026) 接收。研究首次系统审视了一个被广泛默认的前提:动态评测真的“无污染”吗?

论文:Novel Claim or Déjà Vu? Rethinking “Contamination-Free” Dynamic Evaluation for Multimodal Automated Fact-Checking
ArXiv:https://arxiv.org/abs/2607.23514
代码: https://github.com/TrustworthyComp/Rethink-MAFC-Eval
项目网页:https://trustworthycomp.github.io/Rethink-MAFC-Eval/

一、Benchmark开始追着新闻跑:只要更新够快,就算Live吗?

虚假信息早已不只是文字谣言。一张移花接木的图片、一段脱离语境的视频,再配上一句极具煽动性的描述,就足以在社交平台快速扩散。为应对这类内容,当前先进的多模态自动事实核查(Multimodal Automated Fact-Checking,MAFC) 系统通常会像一名调查记者一样工作:先理解待核查的文字、图片或视频,再调用搜索工具从开放网络收集证据,最后综合判断该 Claim 究竟是“得到支持”“被证伪”,还是“证据不足”。

这里真正困难的,并不是让大模型直接给出一个标签,而是让它面对一条刚刚出现的可疑信息时,能够:

  • 找到正确的检索方向;
  • 从嘈杂网页中定位可信证据;
  • 处理文字与图像等多模态信息;
  • 在证据冲突时继续探索,而不是草率下结论。

但现有系统大多在静态基准上接受检验,其中最新的 Claim 也只到 2020 年,而今天主流大模型的训练数据早已覆盖了大量相关事件、报道和事实核查文章。这就产生了一个非常现实的问题:我们以为是在测试模型“会不会查”,实际上可能只是在测试它“记不记得”。

如果模型已经从训练数据中见过相关事件,甚至见过原始事实核查文章,那么它完全可能绕过外部证据检索,仅凭参数中储存的知识答对。最终分数看起来很高,却无法代表系统处理真正突发新闻的能力。

为了破解这一难题,研究社区开始采用动态评测,也常被称为 Live Benchmark:持续收集模型知识截止日期之后发布的新 Claim,并按月或按季度刷新测试集。

LiveBench 等通用大模型评测,以及多模态事实核查领域的 XFACTA、VERITAS,都体现了这种“用持续更新对抗数据污染”的思路。其逻辑非常直观,只要题目出现得足够晚,模型就不可能在训练时见过它。

可惜,数据在时间上是 Live 的,不代表它在知识上也是 Live 的。

二、新闻是新的,答案却可能藏在旧知识里

研究团队指出,仅靠时间戳划线,会漏掉两种更隐蔽的污染。

1. 新发布的 Claim,可能问的是一个老事实

一篇事实核查文章可能发布于 2025 年,但它讨论的对象可能是一项几十年前颁布的法律、一场几年前已经报道过的事件,或一项长期公开的政策。论文中的一个例子涉及美国《紧急医疗和劳工法案》(EMTALA)。

相关 Claim 与事实核查文章虽然出现在模型知识截止日期之后,但这部法律早在 1986 年就已颁布,核心条款也被长期公开记录

。大模型即使没有见过这篇“新文章”,仍可能依靠训练时掌握的旧资料给出完整判断。此时,新闻发布时间是新的,核查所需的证据却一点也不新

2. Claim 本身是新的,但答案可以由旧事实“拼”出来

另一类情况更隐蔽:某个说法可能从未出现过,但判断它所需的每一块拼图都早已存在。例如,论文分析了一条关于 Barron Trump 能否在 2028 年竞选美国参议员的 Claim。即使这条具体说法是全新的,模型只需要组合两条旧知识:

  • (1) Barron Trump 出生于 2006 年;
  • (2) 美国宪法规定参议员必须年满 30 岁。

简单计算即可得出:到 2028 年,他仍达不到年龄要求。模型没有见过原题,也没有读取最新事实核查文章,却仍能凭已有知识完成验证。这种能力本身当然不是坏事;问题在于,如果测试的目标是衡量系统能否针对真正未知的新事件检索外部证据,那么这类样本就会让评测失真。

这正是论文标题中“Novel Claim or Déjà Vu?”的含义:对人类事实核查机构而言,它是刚刚出现的新 Claim;对大模型而言,它可能只是一场似曾相识的“昨日重现”。

三、怎么判断模型是在查证,还是在“凭记忆答题”?

看不到大模型的训练数据,如何判断一条测试样本是否已经被模型内部知识覆盖?研究团队设计了一套基于证据充分性的污染检测流程。

它不要求访问模型参数或训练语料,而是直接检查:如果不让模型上网,它仅凭内部知识,能否复现人类事实核查员使用的关键证据? 整个流程可以概括为三步。

第一步:让模型“闭卷”撰写事实核查文章

研究人员把待核查 Claim 交给目标模型,要求它仅依靠自身参数知识生成一篇事实核查文章。这样得到的内容,相当于模型“记忆库”的一次外显。

如果 Claim 确实涉及模型从未接触的新事件,它理应无法给出充分而具体的证据;反之,如果它能准确写出与专业核查文章高度一致的事实,就说明该样本可能没有真正考到外部检索能力。

第二步:从人类文章和模型文章中提取证据

随后,系统分别从专业事实核查机构撰写的原始文章,以及大模型生成的文章中提取关键证据。

这一步会去除文风、广告、网页提示等无关差异,只保留真正支撑或反驳 Claim 的事实信息。即使证据原本来自图片、音频或视频,也会被整理为可比较的文本陈述。

第三步:一对一匹配两组证据

最后,研究人员使用匈牙利匹配方法,在模型证据与人类证据之间寻找最佳的一对一对应关系,并从字面与语义两个层面计算相似度。

为了避免只抓到“原句复读”而漏掉同义改写,论文同时采用:

  • METEOR,检测较严格的文本重合;
  • Gemma-Emb-0.3B 与 Qwen3-Emb-0.6B,检测语义层面的相似。

若模型仅凭内部知识生成的证据已经足够接近人类核查证据,该 Claim 就会被标记为对该模型存在潜在污染

值得注意的是,这里的“污染”并不只指模型逐字背过某条测试数据。它采用的是更贴近事实核查任务的定义:模型是否已拥有足够的内部知识,可以绕过本应接受考验的外部证据检索环节。

四、901 条最新 Claim、6 个主流模型,动态评测仍未“洗干净”

为了检验动态评测究竟能把污染降低到什么程度,研究团队对比了两个数据集

  • 静态基准 AVeriTeC:去重后包含 491 条 Claim,Claim 最晚发布于 2020 年;
  • 动态基准 ClaimReview2025Q4:研究团队从国际事实核查网络(IFCN)签约机构的文章中收集并清洗出 901 条英文 Claim,全部发表于 2025 年第四季度。

研究覆盖 6 个主流闭源与开源模型:GPT-5.2、GPT-4o-Mini、Gemini-3.0-Pro、Gemini-3.0-Flash、DeepSeek-V3.2,以及 Qwen3.5-122B-A10B。

动态评测有效,但远没有“一劳永逸”

好消息是,与静态基准相比,动态基准确实降低了污染信号

  • 按 METEOR 衡量,平均污染分数下降 2.92–4.95 个百分点
  • 按两种语义指标衡量,平均下降 6.20–11.16 个百分点

但坏消息更加关键:当研究人员采用严格标准,只统计同时被三种指标识别的样本时,ClaimReview2025Q4 中仍有 17.09%–29.30% 的 Claim 存在潜在污染,具体比例因模型而异。

也就是说,即使测试题全部来自知识截止日期之后,每 10 道题中仍可能有接近 3 道,可以被模型用已有知识“绕过去”。语义指标发现的污染样本也显著多于纯文本匹配。

这意味着,现实中的污染往往不是一句话原封不动地出现在训练语料中,而是模型掌握了同一事实的不同表述。若只检查关键词或句子重合,风险很可能被严重低估。

五、最危险的不是分数虚高,而是排行榜都可能排错

发现污染只是第一步。更重要的问题是:这些“似曾相识”的题,究竟会把系统成绩抬高多少?研究团队将 6 个模型分别接入先进的多模态事实核查框架 DEFAME。

该系统能够调用网页与图片搜索工具,自主反复检索证据。随后,研究人员把同一时间段、同一来源中的 Claim 分为“潜在污染”与“未污染”两组,比较模型表现。

结果非常直接:所有模型从污染子集转到未污染子集后,Accuracy 和 Macro-F1 均出现下降。

其中:

  • Gemini-3.0-Flash 的 Macro-F1 从 61.22% 降至 49.88%,相差 11.34 个百分点
  • Qwen3.5-122B-A10B 的 Accuracy 从 74.62% 降至 63.74%,相差 10.88 个百分点
  • GPT-4o-Mini 的 Accuracy 与 Macro-F1 分别下降 9.609.59 个百分点
  • Gemini-3.0-Pro 的 Accuracy 与 Macro-F1 分别下降 10.508.57 个百分点

对其中 4 个模型,研究观察到统计显著的性能下降。

更值得警惕的是,污染不仅抬高绝对分数,还会改变模型之间的相对排名。 在污染子集上,Gemini-3.0-Flash 以 61.22% Macro-F1 排名第一;到了未污染子集,第一名却变成了 GPT-5.2,Macro-F1 为 52.81%

这意味着,如果不控制污染,我们不仅可能高估所有系统,还可能选错“最好”的那个模型。对于依赖榜单决定研究方向、系统选型与资源投入的团队而言,这不是几个百分点的小误差,而是可能影响整个技术判断的系统性偏差。

六、大模型为什么能“抄近道”?搜索轨迹暴露了答案

为了弄清污染如何影响事实核查过程,研究团队进一步分析了模型的搜索轨迹,并将相邻两次查询的变化分为四类:

  • 具体化:增加约束,把搜索范围收窄;

  • 泛化:放松约束,把搜索范围扩大;

  • 探索:转向同一主题的另一个侧面;

  • 重复:再次发出相同或近似的查询。

结果显示,面对未污染 Claim 时,模型会显著增加“探索”型搜索:它需要切换视角、尝试替代关键词、检查更多可能的证据路径,才能逐步接近答案。

而面对污染 Claim 时,模型仿佛已经知道应该去哪里找。它发出的查询更加精准,更容易在前几条结果中命中相关证据,也就不必充分探索整个证据空间

这揭示了污染抬高分数的真正机制:模型表面上完成了“搜索—阅读—判断”的完整流程,内部知识却已经提前为它标好了检索路线。

它看起来像一名高效的调查记者,实际上更像一名提前拿到线索提示的考生。评测最终奖励的,可能并不是面对未知事件时的调查能力,而是模型记忆与测试题之间的暗合程度。

七、彻底去掉“熟题”后,最强模型也不到56分

最后,研究团队构建了一个更严格的统一评测集:只有当一条 Claim 对全部 6 个模型、在全部 3 种相似度指标下都未被识别为污染时,它才会被保留。901 条动态 Claim 经过层层筛选,最终只剩下 154 条。在这个污染受控的评测集上,排行榜再次发生变化:

  • DeepSeek-V3.2 取得最高 Macro-F1:55.93%
  • GPT-5.2 为 51.66%
  • Gemini-3.0-Pro 为 50.88%
  • 其余模型均低于 50%。

所有模型的 Macro-F1 都没有达到 56%。 这组结果撕掉了高分背后的“记忆滤镜”:当测试真正聚焦于模型尚未掌握、必须依靠外部检索才能判断的新 Claim 时,当前多模态事实核查系统远未成熟。

八、结语:更新得再勤,也不代表Benchmark真的Live

这项工作的意义,并不是否定动态评测。恰恰相反,实验已经证明,持续加入知识截止日期之后的新 Claim,确实能够明显缓解静态基准的污染问题。但它同时提醒我们:时间上的 Live 只是一道必要条件,不是知识层面“无污染”的充分保证。

一道题是否真正新颖,不能只看它什么时候发布,还要看:

  • 核查所需的关键事实是否早已公开;
  • 模型能否直接从参数知识中复现人类证据;
  • 答案是否可以由多条旧知识简单组合得到;
  • 系统是否真的进行了充分的外部证据探索。

未来更可信的事实核查评测,不能满足于“把时间戳推到模型训练之后”,还需要把污染检测变成数据构建的常规环节:先让模型闭卷作答,再比较其内部知识与人类证据,过滤掉能够走捷径的样本,并持续审计模型的真实搜索轨迹。

这篇论文最终抛出的,其实是一个远超事实核查领域的问题:当大模型已经吞下如此庞大的公共知识,我们究竟该如何证明,一道测试题真正测到了它的未知能力?

“新发布”不等于“新知识”。如果评测系统分不清二者,那么越来越高的榜单分数,可能并不意味着 AI 更会调查事实,只意味着我们越来越擅长用新包装,重复考它早已知道的答案。而一个无法准确测量能力的评测,最终也无法可靠推动能力进步。

目录