资讯动态

人大:让视觉语言模型像人一样反复思考

发布时间:2026/10/8 19:37:39 来源:尧图企业网站定制
📖标题:LoopVL: Recurrent Visual Intelligence🌐来源:arXiv, 2609.38426v1🛎️文章简介🔸研究问题:循环Transformer架构能否有效扩展到视觉语言模型中,以提升多模态理解与推理能力?🔸主要贡献:论文提出了LoopVL模型,通过模块循环和模型循环机制,在参数量极小的情况下实现了超越更大规模非循环模型的性能,并揭示了视觉注意力在循环过程中的动态重组现象。📝重点思路🔸采用嵌套循环架构:结合模块循环(Module-Loop)和模型循环(Model-Loop),利用共享参数对统一的视觉语言状态进行迭代更新,在不增加参数量的前提下增加计算深度。🔸分层状态更新机制:设计L模块和H模块,L模块在较快时间尺度下多次更新以细化局部视觉语言表示,H模块在较慢时间尺度下整合信息并更新全局状态,模拟生物系统的多尺度处理。🔸视觉Token持续演化:视觉Token在进入循环骨干网后并非静止不变,而是随着循环步骤不断更新其隐藏状态和相对重要性,允许模型在不同循环阶段重新分配对图像区域的注意力。🔸三阶段训练策略:从语言预训练开始,经过视觉语言对齐和多模态中期训练,最后通过监督微调和视觉强化学习进行后训练,逐步提升模型的多模态推理能力。🔎分析总结🔸高效能表现:LoopVL-1B在多项多模态理解和视觉推理基准测试中,性能优于或媲美参数量大数倍的非循环模型,且训练所需的计算量和数据量显著更低。🔸视觉顿悟时刻:实验观察到“Visual Aha Moments”,即在循环过渡阶段,视觉注意力分布发生显著变化,模型会从关注次要区域转向关键证据区域,表明后续循环并非简单重复,而是重新组织视觉证据。🔸循环配置敏感性:模型性能高度依赖L/H循环的组织方式,训练时的循环配置与推理时匹配效果最佳,单纯增加循环次数或改变调用顺序并不一定能提升性能,甚至

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑