在审
基于文本音频联合引导的高时序性视频生成方法及系统
摘要
本申请公开了一种基于文本音频联合引导的高时序性视频生成方法及系统,涉及计算机视觉处理、人工智能,在训练阶段,对视频数据提取音频,构建视频‑音频‑文本三元组并分别编码,其中对音频序列级编码以捕捉时序特征,利用U‑Net结构,随时间步加深对视频的潜在表示逐步添加噪声,并通过串行的视频‑文本交叉注意力和视频‑音频时序注意力,将文本信号和音频信号融合到视频生成过程中,以学习多模态信号与视频生成的映射关系以及音乐的时序性对视频生成的影响;在非训练阶段,将文本和音频作为条件输入,从初始的完全噪声开始逐步去噪,利用U‑Net中串行的视频‑文本交叉注意力和视频‑音频时序注意力,注入文本和音频信息,生成高时序性的视频。
暂无引用专利



