探索如何利用视频内容引导音乐生成,并进一步研究面向长视频的配乐方法。
融合视觉语言模型、扩散模型生成的图像查询与相关性反馈,完成复杂语义的视频检索。
将多模态表征与量子启发的相关性反馈方法整合为可操作的视频检索系统。
项目记录与复盘 ↗