TRECVID 2023 · 视频检索
在海量视频中找到目标片段
研究问题
融合视觉语言模型、扩散模型生成的图像查询与相关性反馈,完成复杂语义的视频检索。
方法概述
系统结合 CLIP 系列模型、生成式图像查询和排序融合,并使用相关性反馈优化交互式重排序。
我的工作
负责 AVS 项目,参与检索流程、实验、技术报告撰写,并代表团队介绍方案与经验。
阶段成果
WHU-NERCMS 团队在 TRECVID 2023 AVS 自动与交互两个赛道取得第一名。
在海量视频中找到目标片段
融合视觉语言模型、扩散模型生成的图像查询与相关性反馈,完成复杂语义的视频检索。
系统结合 CLIP 系列模型、生成式图像查询和排序融合,并使用相关性反馈优化交互式重排序。
负责 AVS 项目,参与检索流程、实验、技术报告撰写,并代表团队介绍方案与经验。
WHU-NERCMS 团队在 TRECVID 2023 AVS 自动与交互两个赛道取得第一名。