计算机与信息学院(人工智能学院)

联系我们 师大首页

当前位置: 学院首页 >> 学院新闻 >> 正文

计算机与信息学院(人工智能学院)伍永博士在视频跨模态行人重识别领域取得新进展

发布日期:2026-08-15 浏览次数:   编辑:林贺  预审:安广虎  终审:张园园 

近日,计算机与信息学院(人工智能学院)伍永博士团队在视频跨模态行人重识别领域取得新进展。相关成果以“Dynamic Modality-Temporal Adaptation for Video-based Visible-Infrared Person Re-Identification”为题,被多媒体领域国际顶级学术会议ACM International Conference on Multimedia(ACM MM 2026)接收。

视频可见光-红外行人重识别旨在利用可见光与红外视频序列实现跨模态行人身份匹配,在智能安防和夜间监控等场景具有重要应用价值。然而,受光照变化、成像条件和复杂环境等因素影响,可见光与红外视频之间的模态差异会随不同序列动态变化;同时,遮挡、运动模糊和背景干扰等瞬时扰动容易破坏视频帧间的时序连续性,使跨模态身份表征面临较大挑战。

针对上述问题,研究团队提出动态模态-时序自适应(Dynamic Modality-Temporal Adaptation,DMTA)框架。该框架从模态自适应感知和时序关系建模两个方面协同提升跨模态视频表征能力。一方面,通过模态提示动态感知机制,融合模态先验与序列特征进行混合专家动态路由,根据不同视频序列自适应选择特征学习路径,以缓解序列相关的动态模态差异;另一方面,通过序列图关系建模显式刻画相邻视频帧之间的时序连续性,并进一步聚合全局时序语义,从而降低瞬时扰动对身份表征的影响,获得更加稳定且具有判别性的序列特征。

研究结果表明,DMTA在HITSZ-VCM和BUPTCampus两个公开基准数据集上均取得了优于现有方法的性能。其中,在HITSZ-VCM数据集上,DMTA在红外到可见光和可见光到红外两种检索模式下分别取得79.6%和81.6%的Rank-1准确率,验证了该方法在动态模态差异和复杂时序变化条件下的有效性。该研究为复杂场景下跨模态视频表征与检索提供了新的研究思路。

ACM Multimedia(ACM MM)是国际多媒体领域公认的顶级学术会议,也是美国计算机协会多媒体专业组(ACM SIGMM)的旗舰会议。会议创办于1993年,是全球多媒体研究领域最具影响力的学术盛会之一,集中展示多媒体、计算机视觉、多模态智能、视觉与语言等方向的前沿研究成果。ACM MM被中国计算机学会(CCF)列为计算机图形学与多媒体领域A类国际学术会议,在国际多媒体研究领域具有广泛的学术影响力。

该研究由我校计算机与信息学院(人工智能学院)伍永博士与其指导的2022级计算机科学与技术专业本科生丁子杰共同完成,安徽师范大学为第一完成单位。该成果体现了学校坚持科研育人、积极引导本科生参与高水平科研实践、着力培养学生创新能力的积极成效。该工作得到国家自然科学基金(62302013)和安徽省自然科学基金(2308085QF220、2508085QF247)等项目支持。