在审
基于时序增强隐空间扩散的文本到视频生成方法、系统、设备及介质
方
方智淳 专利 28
国网浙江桐庐县供电有限公司姜
姜驰 专利 90
国网浙江省电力有限公司肖
肖吉东 专利 20
国网浙江省电力有限公司营销服务中心叶
叶红豆 专利 30
国网浙江省电力有限公司营销服务中心王
王辉东 专利 11
国网浙江省电力有限公司营销服务中心芦
芦鹏飞 专利 71
国网浙江省电力有限公司营销服务中心陈
陈麟红 专利 26
国网浙江省电力有限公司营销服务中心吴
吴昊天 专利 19
国网浙江省电力有限公司营销服务中心王
王倩莹 专利 17
国网浙江省电力有限公司营销服务中心闫
闫园 专利 19
国网浙江省电力有限公司营销服务中心高
高函 专利 18
国网浙江省电力有限公司营销服务中心周
周璐瑶 专利 20
浙江华云信息科技有限公司孙
孙钢 专利 188
浙江大学俞
俞佳莉 专利 85
国网浙江省电力有限公司李
李亦龙 专利 148
烟台冰轮节能科技有限公司张
张靖琛 专利 21
国网浙江省电力有限公司营销服务中心陈
陈宇阳 专利 14
国网浙江省电力有限公司营销服务中心陈
陈昱豪 专利 33
国网浙江省电力有限公司营销服务中心曹
曹瑞峰 专利 16
国网浙江省电力有限公司营销服务中心张
张云雷 专利 15
国网浙江省电力有限公司营销服务中心摘要
本发明属于文本到视频生成技术领域,涉及一种基于时序增强隐空间扩散的文本到视频生成方法、系统、设备及介质,以解决高频艺术风格视频生成中的时序不一致问题。方法包括:接收文本提示和噪声潜在序列;基于文本提示生成扩散模型控制条件;在多步扩散去噪过程中,对除首帧外的各帧执行时序增强处理,包括:根据相邻帧潜在状态预测隐空间运动流,对前一帧潜在状态进行运动补偿并经细化网络去除伪影,依据融合权重将细化潜在状态与当前帧潜在状态自适应融合;将融合后的潜在序列输入去噪主干网络完成更新,重复迭代直至获得最终潜在序列,并解码生成视频。本发明通过显式的潜在运动对齐与融合机制提高生成视频的时序一致性和结构稳定性。
暂无引用专利



