1. 首页
  2. 精选文章
  3. 大模型画框总翻车?给 9B 视觉模型装上“进度条”与“撤回键”

大模型画框总翻车?给 9B 视觉模型装上“进度条”与“撤回键”

  • 发布于 2026-10-12
  • ·
  • 3 次阅读
  • ·
  • ·

详细的语言描述,并不等于准确的视觉定位。 让模型框出“餐盘右上角的西兰花”,它可能完整描述了食物类别和相对位置,却仍把相邻的一簇圈进目标框。视觉指代定位要求将语言理解落实到具体区域与精确边界;流畅的解释本身,并不能保证中间空间判断可检查、最终坐标可纠正。

这一落差也要求重新审视后训练的终点。对于已经接受强化学习后训练的模型,继续围绕最终答案追加 RL,未必就是最优的优化路径。 当剩余误差涉及区域选择与边界偏差时,值得进一步研究的是:如何保留可操作的空间判断,并训练模型在已有判断上识别、取舍和修正错误。

CoEvolve 据此探索一种面向可修复性的构造—编辑后训练范式:先用强化学习将空间推理组织成显式区域轨迹,再训练双向编辑器,在保留语义上下文的同时修正坐标。RL 在这一流程中承担状态构造的职责,后续几何监督与编辑偏好分别学习“往哪改”和“值不值得改”,将后训练延伸到已有预测的可修复性。

餐盘案例中的初始定位与坐标精修

保留语义上下文,通过坐标编辑修正定位偏差。

先看效果:9B 主干的定位表现与单轮纠错能力

在论文汇总的 RefCOCO 系列对比中,采用 9B 主干的 CoEvolve,整体定位准确率与总参数量达 241B 的模型相当。

表 1|标准视觉定位:八个划分的平均 Acc@0.5。

方法 参数规模 / 主干 准确率(%)↑
Qwen3.5-9B 9B 89.48
InternVL3.5-241B-A28B 241B 92.39
CoEvolve 9B 主干 92.41

数值摘自论文主表;公开方法沿用其报告协议,241B 为总参数量。

修复能力则通过三万余个受控扰动框单独检验。面对位置、尺度和长宽比偏差,一轮编辑就将平均框重叠度提高约 27.4 个百分点,并修复近 88% 原本未达标的输入框。

表 2|受控纠错:各方法接收相同扰动框,CoEvolve 编辑器仅运行一轮。

方法 / 状态 mIoU(%)↑ 修复率(%)↑
扰动输入,未修复 58.80 —
Qwen3.5-9B 纠错 83.85 79.88
CoEvolve 编辑器 86.19 87.99

mIoU 衡量平均框重叠度;修复率指初始 IoU < 0.7 的框被修复至 IoU ≥ 0.7 的比例。

空间状态显式化:让推理成为可度量的优化对象

上述构造—编辑分解通过显式状态连接两个分阶段训练的组件,形成状态—编辑器耦合(State–Editor Coupling)。

Region-Evolution Reinforcement(RER,区域演化强化)要求每个推理步骤给出候选框,将分析过程组织成“语义解释+区域坐标”的轨迹。强化学习同时评价结构、空间进展和最终定位,使中间空间判断获得可计算的训练信号。这些监督来自目标框标注,无需人工编写推理链或额外标注中间区域。

后续编辑因此拥有明确的操作对象:候选区域、定位历史,以及可供比较的输入坐标。

相对编辑效用:让优化方向与修正收益对齐

Bidirectional Denoising Refiner(BDR,双向去噪精修器)读取完整轨迹,将推理文字作为固定语义上下文,利用双向信息在坐标原位置同步预测修改结果。

BDR 区分目标几何与相对编辑效用:前者规定坐标应移向哪里,后者评价修改是否优于保留输入。训练中的质量门控选择保留、纠正或巩固的目标,逐坐标偏好则鼓励有益修改、抑制有害修改。

这一偏好目标具有明确的方向性质。对参与监督的坐标,记 (D) 为发生变化的数字位置上、输出相对输入的平均模型评分差,(y) 标记修改是否减小坐标误差。其偏好损失 (\ell) 满足:

\frac{\partial \ell}{\partial D}=\sigma(D)-y, \qquad \sigma(D)=\frac{1}{1+e^{-D}}.

有益编辑对应 (y=1),梯度下降推动 (D) 增大;有害编辑对应 (y=0),则推动 (D) 减小。这将编辑取舍落实为具有明确方向的优化信号。

CoEvolve 的显式状态构造与双向坐标编辑

RER 构造显式空间状态;BDR 结合目标几何与相对编辑效用,学习坐标修正。

状态—编辑器耦合:用下游精修评价状态价值

论文分别为原生输出和 RER 状态训练匹配的编辑器。RER 路径的 mIoU 精修增益为 5.02 个百分点,原生输出路径为 2.41 个百分点;前者的最终 mIoU 也更高,达到 85.72%,对比 84.57%。

这一结果支持将可修复性理解为状态与编辑器的关系属性:评价中间状态时,还应考察匹配编辑器能从中获得多少改进,以及最终能达到怎样的质量。

对后训练的启发

CoEvolve 将输出准确率、空间状态构造和编辑效用纳入同一套后训练设计。由此,中间状态既是一次预测的结果,也是后续修正可利用的接口。

对于动作参数、代码补丁等可结构化编辑的输出,这提供了一条值得验证的路线:训练可供编辑的状态,学习相对输入的修正效用,并以状态与编辑器的组合表现评价系统。


目录
正在直播 B 站