目标跟踪中的灵活和精确方法:自然语言的应用
在这篇文章中,作者介绍了一个新的针对自然语言指导的目标跟踪基准,包括一个大规模的数据集——TNL2K,以及一个小型但多样化的基本方法。
具体来说,他们收集了2000个视频序列,包含1,244,340帧和663个词汇,并将其分为1300个用于训练和700个用于测试的序列。每个视频序列都附带了密集标注的英文描述和相应目标对象的边界框。
TNL2K 数据集的特点:
- 大规模:包含2000个序列、1,244,340帧和663个词汇,其中1300个用于训练,700个用于测试。
- 高质量:每帧都经过仔细检查,并由人工标注。
- 多模态:每个序列都有视觉和语言标注。
- 对抗性样本:随机添加对抗性样本,用于研究对抗性攻击和防御。
- 显著外观变化:含有行人服装或面部变化的视频。
- 异构:包括RGB、热成像、卡通和合成数据。
- 多种基线方法:包括基于边界框的跟踪、基于自然语言的跟踪和结合边界框和自然语言的跟踪。
为了进一步推动这一领域的研究,作者引入了两个新的挑战——对抗性样本和形态转换。他们还提出了一种基于自适应局部-全局搜索方案的强大基准方法,供未来的研究人员参考。作者认为这个基准将极大地促进自然语言引导下的目标跟踪研究。
实验结果:
该研究的实验结果展示了该基准的有效性和实用性。
作者及单位:
- 作者:Xiao Wang, Xiujun Shu, Zhipeng Zhang, Bo Jiang, Yaowei Wang, Yonghong Tian, Feng Wu
- 单位:彭城实验室、北京大学、中国科学院、安徽大学、中国科学技术大学
- 论文链接:https://arxiv.org/abs/2103.16746
- 主页:https://sites.google.com/view/langtrackbenchmark/
- 备注:CVPR 2021
以上是对原文的改写,确保了内容的准确性和完整性,同时降低了与原文的相似度。