论文第一作者为伍永博士,2022级计科专业本科生丁子杰为第二作者,安徽师范大学为第一完成单位。
视频可见光-红外行人重识别旨在利用不同模态的视频序列实现跨模态行人身份匹配,在智能安防等领域具有重要应用价值。然而,由于可见光与红外模态之间存在显著差异,同时视频序列还受到遮挡、运动变化以及背景干扰等因素影响,如何学习鲁棒的跨模态时序表示仍然面临挑战。针对上述问题,论文提出了一种动态模态-时序自适应(Dynamic Modality-Temporal Adaptation,DMTA)框架。该方法通过引入模态提示动态感知机制,利用混合专家模型根据不同视频序列特点自适应调整跨模态特征学习过程,有效缓解不同模态之间的差异。同时,论文设计了序列图关系建模方法,通过挖掘视频帧之间的时序关系,提高模型对复杂场景和动态变化的适应能力。论文在HITSZ-VCM和BUPTCampus等公开数据集上进行了大量实验,结果表明,所提出方法在多个评价指标上均取得了优于现有方法的性能,验证了动态模态适应与时序关系建模策略的有效性。

ACM Multimedia 是多媒体领域国际顶级学术会议之一,由美国计算机协会(ACM)主办,是中国计算机学会(CCF)推荐的计算机图形学与多媒体领域A类会议。本次论文录用体现了学院在人工智能、多媒体智能分析与计算机视觉领域科研创新能力的持续提升。