资讯动态

GROUNDHOG总体版

发布时间:2026/9/27 6:23:08 来源:尧图企业网站定制
1. 这篇论文到底想解决什么问题GROUNDHOG 想解决的是让 MLLM 的语言能够精确对应到像素区域以前很多 grounded MLLM比如 Shikra、Kosmos-2主要把语言和bounding box对齐但 box 很粗尤其不适合不规则物体天空、草地这类背景区域物体局部比如“狗的尾巴”多个实例图像中的文字区域。所以 GROUNDHOG 希望做到也就是把语言真正 grounding 到像素级。2. 最核心的思想不是直接生成 mask而是“先分割再选择”这是整篇论文最重要的设计。GROUNDHOG 不采用语言 → 直接生成 mask而是Mask Proposal Language-guided Mask Retrieval首先给图像产生很多候选 mask。然后 MLLM 根据语言判断用户说的这个东西对应哪些候选 mask所以整个 grounding 被拆成先找到可能存在的视觉区域 再判断语言对应哪个区域论文把这两部分称为Localization Recognition这种解耦设计也是 GROUNDHOG 和 LISA 一类方法非常明显的区别。3. 第一步生成尽可能全面的候选 mask既然后面只能从已有 mask 中选择那么前面的 mask proposals 就必须尽量全面。GROUNDHOG 希望候选区域覆盖不同语义粒度完整物体 背景区域 物体部件 文字区域例如dog、grass、dogs tail、sign textproposal 覆盖能力决定后续 grounding 的上限因为如果“狗尾巴”从一开始就没有被切成候选区域那么后面的 MLLM 即使知道用户说的是狗尾巴也没有对应的 mask 可以选择。4. 为什么作者要设计 Mask2Former普通 Mask2Former 主要在 COCO Panoptic 上训练因此对于 COCO 常见类别很好但对于物体部件、视觉文字、开放世界中的其他实体 覆盖能力不足。所以作者构建了Mask2Former。他们整合了 COCO、LVIS、Entity-v2、Pascal、PACO、MHP-v2、TextOCR 等数据并在原本的 200 个 entity queries 基础上增加50个 part queries 50个 text queries专门增强物体部件和文字区域的候选 mask 生成能力。Mask2Former 负责“尽可能把图里的有意义区域都切出来”它还没有负责语言理解。5. 第二步把每个候选 mask 变成 MLLM 能理解的视觉表示现在假设已经得到为方便模型解耦GROUNDHOG 只拿 Mask2Former 产生的binary mask并不直接使用 内部的 feature。而是然后整张图分别经过 CLIP 和 DINOv2得到两套 feature maps。对于某个 mask分别做 mask pooling本质上就是利用 mask只保留这个区域相关的视觉特征再进行聚合。然后分别经过 MLP 映射到 MLLM 的 embedding 空间最后相加最终的就是这个候选区域对应的也就是说一个 mask 对应一个视觉实体 token。6. 这时 MLLM 实际上看到的图像是什么经过上一步之后GROUNDHOG 不再只是把图像理解成一堆普通 patch。而是变成一组视觉实体Image → 一组视觉实体如 第一只狗 第二只狗 草地 某个文字区域这些 Visual Entity Tokens 会进入 MLLM后面语言 grounding 的本质就是当前语言描述到底和哪几个 visual entity tokens 最匹配7. 第三步语言如何变成一个 grounding query假设模型生成I see GRD two dogs /GRD on GRD the beach /GRDGRD和/GRD表示中间这段语言需要和图像区域对应。对于GRD two dogs /GRDMLLM 最后一层分别得到和然后相加得到可以直接把q记成“two dogs” 这个需要被定位的语言短语的表示8. 第四步用 q 去选择前面的候选区域现在已经有两类东西语言q视觉拼接经过 MLP得到一个 score代表这个候选区域Mi 和当前语言 phrase 的匹配度如对于 two dogs可能得到模型就知道对应 two dogs。所以这里 GROUNDHOG 的 grounding本质就是9. 为什么它天然支持多个目标因为 GroundHog 不是只能选一个 mask。对于 two dogs两个 dog mask 都可以获得高分。最后模型把高分 mask 合并所以可以一起组成最终结果。因此它天然支持和甚至本质上都统一成从候选 mask 中选择并组合10.PTRGROUNDHOG 还可以反过来让用户“指区域”GROUNDHOG 不只是也支持例如用户指着某个位置What is thatPTR?这里PTR代表用户提供的 point、box 等空间提示。GROUNDHOG 可以先用 SAM然后同样经过前面的再用这个视觉实体 token 替换PTR。因此 MLLM 就能理解用户现在到底指的是哪一个区域。这使得模型可以进行 Referential Dialogue也就是基于空间指示进行交互。11. M3G2 数据集训练模型把各种任务统一成 grounded dialogue作者构建了它把很多已有 grounding、segmentation、VQA 数据重新整理成统一的视觉对话形式。主要包括四类任务Grounded Image Captioning生成 caption同时把里面的 phrase 和 mask 对应起来。Referring Expression Segmentation给一句语言找到对应 mask。Grounded Visual Question Answering回答问题同时给出支持这个答案的像素区域。Referential Dialogue用户通过 point、box、region 等方式和模型交互。前文和表格描述M3G2 大约2.5M text-image pairs、36 个子任务、来源于 27 个数据集。但结论部分又写成了1.9M training text-image pairs12. 这篇论文真正想证明的不是“某一个分割任务做到最好”作者更强调GROUNDHOG 是一个 generalist grounded MLLM即同一套模型参数可以同时处理、、、而不是一个模型只专门做一个 segmentation benchmark。在这些任务上使用的是同一组模型权重没有针对每个数据集单独 fine-tune。在 RefCOCO、RefCOCO、RefCOCOg、gRefCOCO、PhraseCut、ReasonSeg 等任务上它整体表现也比较强。13. 为什么作者强调“可解释”和“可诊断”这种的解耦还有一个很重要的好处。如果最后 grounding 错了可以检查情况一目标区域根本没有被 proposal model 切出来。那么问题在情况二目标区域其实已经存在但 MLLM 给它的 score 很低。那么问题在如图对应区域其实已经被成功 proposal 出来了但 MLLM 没有正确识别 “KWIK”所以没有把对应 mask 选中。所以相比 LLM hidden state → 直接生成 maskGROUNDHOG 更容易知道错在哪一步14. 实验里还有两个比较重要的结论1、 hallucination在 M3G2 中加入 negative QA问题里问到的目标在图像中不存在正确答案应该否定 数据再加上模型要求语言和视觉区域建立明确对应因此在 POPE 上 object hallucination 明显减少。但不是 pixel grounding 彻底解决了 hallucination更准确的是共同改善了 hallucination。2、消融实验作者发现整体优于单独使用其中一个同时整体效果优于只使用其中一个 boundary token 的 hidden state。15. 论文局限本质上仍然是在“选已有的 mask”它的流程是先 proposal → 再 retrieval因此没有 proposal 出来的区域MLLM 很难凭空生成如用户问red brick spire但 Mask2Former 只 proposal 出整个 tower没有单独 proposal 出 spire那么即使 MLLM 完全理解 “spire”也只能从已有 mask 中选择很难得到精确的尖塔区域。所以它的最大优点和最大局限来自同一个设计把 segmentation 和 language grounding 解耦优点是模块化、可替换、可解释缺点是最终 grounding 的上限受到 mask proposal 的限制如果现在把整篇论文最后压缩成一条完整链路你可以记成图像 → Mask2Former 产生候选 mask → CLIP/DINO 提取每个区域特征 → Visual Entity Tokens然后语言这一边最后q {e1, …,eN} → 给候选区域打分 → 选择并合并 mask所以整篇 GROUNDHOG 最核心的一句话它不是让 MLLM 学会“画 mask”而是让 MLLM 学会“理解并选择已有的像素级视觉实体”。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑