资讯动态

南大MOTIP:多目标跟踪不再需要复杂匹配规则,简洁方法效果更优

发布时间:2026/8/9 3:32:55 来源:尧图企业网站定制
导读多目标跟踪MOT的主流做法是检测关联先检测出每一帧的目标再用匈牙利算法、IoU 匹配等手工设计的启发式方法把前后帧的目标对应起来。这些方法能用但每遇到一个新场景遮挡严重、目标外观相似、运动轨迹不规律就需要一轮新的调参和规则修改。南京大学王利民团队提出了一个新视角把目标关联问题转化为 ID 预测问题。给定一组历史轨迹每条轨迹带有一个 ID 标签直接预测当前帧检测到的目标应该分配哪个 ID。这个过程形式上类似分类但本质不同传统分类的标签有固定语义猫1、狗2而 MOT 中的 ID 标签是随机分配的只表示一致性而不携带语义信息——同一条轨迹的 ID 保持一致即可具体是哪个数字无所谓。这种上下文相关的标签设计使模型可以泛化到推理时未见过的新轨迹。基于这个思路MOTIP 用一个 DETR 检测器 可学习 ID 字典 ID Decoder 的简洁架构在 DanceTrack 上 HOTA 达到69.6不使用额外数据超越此前最优 CO-MOT65.34.3 个百分点。在 SportsMOT 和 BFT鸟类追踪上同样达到 SOTA。论文信息标题Multiple Object Tracking as ID Prediction作者Ruopeng Gao, Ji Qi, Limin Wang†通讯作者机构南京大学新型软件技术国家重点实验室、中国移动苏州、上海 AI Lab代码https://github.com/MCG-NJU/MOTIP一、启发式匹配的困境为什么需要换个思路主流 MOT 方法的关联步骤依赖手工设计的启发式规则方法类型做法局限IoU 匹配用前后帧检测框的 IoU 计算相似度匈牙利算法做最优匹配目标快速移动或遮挡时 IoU 接近零匹配失败运动模型用卡尔曼滤波预测目标下一帧位置再做匹配假设线性运动非线性轨迹如舞蹈、球类运动效果差外观特征提取 ReID 特征计算余弦相似度目标外观相似时如穿同色队服的运动员容易混淆这些方法的共同问题是每一种假设线性运动、外观可区分、IoU 重叠充分都有适用边界一旦超出边界就需要针对性修补。比如 OC-SORT 为了处理突然停止和启动的运动专门设计了虚拟轨迹Hybrid-SORT 组合了多种相似度度量。每次改进都需要大量人工分析和参数调优。论文提出的核心问题是能否在保持检测关联解耦的同时把关联部分从启发式规则变成端到端可学习的MOTIP 的回答是把关联转化为 ID 预测——给定上下文历史轨迹 它们的 ID 标签直接预测当前检测目标的 ID。图片来源于原论文二、MOTIP 的三个组件检测器 ID 字典 ID Decoder组件 1DETR 检测器使用 Deformable DETRResNet-50 骨干对每一帧做目标检测输出每个目标的 C 维特征向量和检测框。MOTIP 的一个关键设计是检测和关联解耦检测器只负责检测关联由后续的 ID Decoder 独立完成。这避免了 MOTR 等方法中检测 query 和跟踪 query 在同一个解码过程中产生冲突的问题。组件 2可学习 ID 字典定义一个 ID 字典 I {i₁, i₂, ..., iK, i_spec}其中K 个常规 ID token每个是 C 维可学习向量代表不同的身份1 个特殊 tokeni_spec代表新出现的目标关键理解ID 标签不携带语义信息它们只表示一致性。轨迹 1 和轨迹 2 的 ID 可以互换只要同一条轨迹内的 ID 保持一致。这使得模型可以泛化到推理时未见过的新轨迹——不需要为每条新轨迹学习新的表示只需复用已有的 ID token。组件 3ID Decoder标准 Transformer Decoder包含交替堆叠的 self-attention 和 cross-attention 层。注意力结构如下Query当前帧的检测目标特征与 i_spec 拼接2C 维Key / Value过去 T 帧固定窗口中所有历史轨迹的 token特征与对应 ID embedding 拼接2C 维其中self-attention 层让当前帧的多个检测目标之间互相交换信息避免多个相似目标被分配到同一个 ID。消融实验Table 4显示在最终配置中去掉 self-attention 后 HOTA 从 62.2 降至 60.2论文还指出引入轨迹增强后有无 self-attention 的性能差距进一步拉大验证了这一设计的重要性。ID Decoder 输出每个检测目标在 K1 个 ID 上的概率分布经线性分类头得到最终预测。推理时的 ID 分配并非简单取最高概率而是包含一套完整的决策流程检测置信度低于 λ_det 的目标直接过滤同一帧中如果多个目标预测了同一个 ID只保留置信度最高的其余标记为新目标ID 预测概率需超过 λ_id 阈值才被接受否则标记为新目标新目标的检测置信度需超过 λ_new 才正式建立新轨迹整个过程等价于在历史轨迹提供的上下文中为当前检测目标做 ID 预测——这就是in-context ID prediction的含义。图片来源于原论文三、轨迹增强训练时模拟推理时的错误MOTIP 的一个巧妙设计是轨迹增强Trajectory Augmentation解决训练和推理之间的分布差异。训练时使用 Ground Truth 构建历史轨迹轨迹是干净的。但推理时模型的 ID 分配可能出错比如把目标 A 的 ID 分给了目标 B导致历史轨迹中夹杂错误。如果训练时从未遇到过这种脏数据模型的鲁棒性就不够。论文设计了两种增强策略策略做法模拟的场景轨迹随机遮挡以概率 λ_occ 随机丢弃轨迹中的 token目标被遮挡导致轨迹不完整轨迹随机交换以概率 λ_sw 随机交换同一帧中两条轨迹的 ID token模型给外观相似的目标分配了错误 ID两种增强的超参数都设为 0.5在消融实验中证明对性能有显著贡献。四、消融实验ID 预测 vs ReID 匹配差距有多大DanceTrack 主实验DanceTrack 是当前最具挑战性的 MOT 基准之一包含群舞场景中频繁交互、外观相似、非线性运动的目标。方法HOTAAssAIDF1额外数据ByteTrack47.732.153.9无OC-SORT55.138.354.6无MeMOTR63.452.365.5无CO-MOT65.353.566.5无MOTIP69.660.474.7无MOTRv269.959.071.7有MOTIP72.063.576.8有不使用额外数据时MOTIP 在 HOTA4.3、AssA6.9、IDF18.2上全面领先。AssA关联准确率的提升最大直接验证了 ID 预测在目标关联上的优势。使用额外数据后MOTIP 达到 72.0 HOTA超越 MOTRv269.9和 CO-MOT69.4。SportsMOT体育赛事场景包含频繁的镜头切换、运动员的高速移动和反复交互。OC-SORT 通过显式建模非线性运动在该数据集上表现突出。方法HOTAAssAIDF1ByteTrack62.150.569.1TrackFormer63.361.172.4OC-SORT68.154.868.0MeMOTR68.857.869.9MOTIP72.663.277.1MOTIP 在不使用额外数据的情况下 HOTA 达到 72.6比 MeMOTR68.8高 3.8且在 AssA5.4和 IDF17.2上优势更为明显。值得注意的是MOTIP 不使用额外数据的成绩甚至超过了多数使用额外数据的方法如 OC-SORT 71.9、DiffMOT 72.1。BFT鸟类追踪鸟类追踪与行人追踪有显著不同鸟类在三维空间中运动更动态且外观高度相似没有衣服等人工特征可用于区分对关联算法提出了不同维度的挑战。方法HOTAAssAIDF1JDE30.723.437.4FairMOT40.228.241.8ByteTrack62.564.182.3CenterTrack65.054.061.0OC-SORT66.868.779.3MOTIP70.571.882.1MOTIP 在这个全新的跟踪场景中同样达到 SOTA验证了方法的跨场景泛化能力。ID 预测 vs ReID 管线的直接对比论文在完全相同的目标特征上做了直接对比实验分别用 ReID 方法FairMOT 的分类损失、对比学习损失和 MOTIP 的 ID 预测做关联关联方式HOTAAssAIDF1两阶段 ReIDFairMOT 式29.411.522.1两阶段对比学习41.022.636.4两阶段 ID 预测MOTIP55.441.155.7一阶段 ReID 匈牙利50.634.750.9一阶段 ID 预测MOTIP59.547.261.1在相同特征下ID 预测方式的 HOTA 比 ReID 高8.9-26 个百分点两阶段设置下差距更大。这说明性能差距主要来自关联范式的不同而非特征提取的差异。五、总结与思考论文贡献总结新范式将多目标跟踪的关联问题重新定义为 in-context ID 预测端到端可学习不依赖启发式匹配简洁架构DETR ID 字典 Transformer Decoder没有复杂的额外模块跨场景验证DanceTrackHOTA 69.6/72.0、SportsMOTHOTA 72.6和 BFT鸟类追踪HOTA 70.5三个基准上均达到 SOTA轨迹增强随机遮挡 随机交换有效弥合训练和推理之间的分布差异MOTIP 最值得关注的不是具体的数字提升而是它对 MOT 关联问题的重新定义。传统方法把关联看作匹配问题在两组对象之间找最优对应MOTIP 把它看作预测问题给定上下文预测 ID 标签。这种视角转换带来了两个结构性优势端到端可学习匹配规则不再需要手工设计模型直接从数据中学习最优的关联策略上下文感知ID Decoder 通过 Transformer 的注意力机制看到所有历史轨迹和当前所有检测目标可以利用全局信息做决策而传统方法只做两两比较训练效率也值得一提8 张 4090DanceTrack 训练不到一天。对于学术实验室来说门槛不高。局限方面K 的上限ID 字典大小 K 限制了同时可追踪的轨迹数量。论文通过回收已结束轨迹的 ID 来缓解实验显示 token 利用率通常低于 40%但在极端密集场景下仍可能成为瓶颈架构刻意从简论文作者明确指出当前设计遵循less is more原则优先验证 ID 预测范式的可行性。未来可以探索定制化的 ID Decoder 结构、引入运动/深度等额外跟踪线索、以及更精细的轨迹建模技术总体来说MOTIP 用一个简洁且符合直觉的思路重新定义了 MOT 的关联问题在多个高难度基准上取得了一致的 SOTA 结果。作者自己也指出MOTIP 的简洁性和显著结果为后续研究留下了大量发展空间——这正是好 baseline 的特征。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价