← 全部项目
多模态检索 / 2023

TRECVID 2023 · 视频检索

在海量视频中找到目标片段

研究问题

融合视觉语言模型、扩散模型生成的图像查询与相关性反馈,完成复杂语义的视频检索。

方法概述

系统结合 CLIP 系列模型、生成式图像查询和排序融合,并使用相关性反馈优化交互式重排序。

我的工作

负责 AVS 项目,参与检索流程、实验、技术报告撰写,并代表团队介绍方案与经验。

阶段成果

WHU-NERCMS 团队在 TRECVID 2023 AVS 自动与交互两个赛道取得第一名。