计算机研究与发展

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:11-1777/TP

国际刊号:1000-1239

计算机研究与发展杂志2020年第7期:基于多模态输入的对抗式视频生成方法

发布日期:

作者:于海涛,杨小汕,徐常胜,

关键词:深度学习, 视频生成, 视频预测, 卷积神经网络, 生成对抗网络,

视频生成是计算机视觉和多媒体领域一个重要而又具有挑战性的任务.现有的基于对抗生成网络的视频生成方法通常缺乏一种有效可控的连贯视频生成方式.提出一种新的多模态条件式视频生成模型.该模型使用图片和文本作为输入,通过文本特征编码网络和运动特征解码网络得到视频的运动信息,并结合输入图片生成连贯的运动视频序列.此外,该方法通过对输入图片进行仿射变换来预测视频帧,使得生成模型更加可控、生成结果更加鲁棒.在SBMG(single-digitbouncingMNISTgifs),TBMG(two-digitbouncingMNISTgifs)和KTH(kungligatekniskah?gskolanhumanactions)数据集上的实验结果表明:相较于现有的视频生成方法,生成结果在目标清晰度和视频连贯性方面都具有更好的效果.另外定性评估和定量评估(SSIM(structuralsimilarityindex)与PSNR(peaksignaltonoiseratio)指标)表明提出的多模态视频帧生成网络在视频生成中起到了关键作用.

来源:2020年第7期

《计算机研究与发展》期刊编辑部

查看计算机研究与发展杂志2020年第7期

联系我们

  • 地址:北京中关村科学院南路6号
  • 电话:(010)62620696
  • E-mail:crad@ict.ac.cn

咨询工作人员