论文部分内容阅读
目前高清视频在娱乐、医疗、视频监控等领域的应用越来越广泛,促进了视频超分辨技术的研究。其中,基于深度学习的视频超分辨算法快速发展,但它们在视觉感知、精度、时序一致性的指标方面各有侧重,且模型参数量大。因此需要进一步研究如何更好地综合上述三方面指标,并提升模型推理速度,为视频超分辨技术在嵌入式终端的应用打好基础。
由此,本文设计了基于生成式对抗网络的视频超分辨算法( High Optical Flow Wasserstein Generative Adversarial Networks, HOFWGAN),整体网络包括高分辨率光流运动补偿前缀网络(High Optical Flow-Motion Compensation, HOF-MC)和适用于视频超分辨的生成式对抗主体网络( Wasserstein Generative Adversarial Networks-Limited Discriminator, WGAN-LD)两部分;另外,为了减少重建视频的闪烁现象,HOFWGAN还设计了高时序一致性优化方案。论文的主要工作和贡献点有:(1)设计了HOF-MC前缀网络,通过估算输入的低分辨率帧间的高分辨率光流并加以运动补偿,能够有效地提高重建视频的精度。(2)设计了WGAN-LD主体重建网络,通过增加对判别器的惩罚项来提升其鉴别能力,能够有效提高重建视频的视觉感知效果。(3)设计了整体的时序优化方案,通过约束相邻的图像帧间像素运动的位移量,来保证重建视频的时序一致性。同时,本文还针对嵌入式平台算力低、处理速度慢等问题,通过设计自定义插件来利用TensorRT对HOFWGAN算法进行加速优化,实现了算法在嵌入式平台的部署。
实验结果表明,HOFWGAN算法在视觉感知、精度、时序一致性和速度方面都取得较好的结果:(1)使用 WGAN-LD 网络,Vid4 数据集上自然图像质量评价和学习感知图像块相似度指标值为4.23和16.25,相较于TecoGAN提升了0.37%和1.2%;(2)使用 HOF-MC 前缀网络后,Vid4 数据集上精度相关峰值信噪比和结构相似度指标值为26.63dB和0.782,相较于TecoGAN提升了4.15%和3.44%;(3)使用时序优化方案后, Vid4数据集上时序一致性指标tOF和tLP值为19.09和0.00702,帧间闪烁现象明显降低。(4)对算法加速优化后,在Jetson TX2嵌入式平台上模型推理速度由7FPS提升至23FPS的近实时速度,证明了算法在嵌入式平台上的实用性。
由此,本文设计了基于生成式对抗网络的视频超分辨算法( High Optical Flow Wasserstein Generative Adversarial Networks, HOFWGAN),整体网络包括高分辨率光流运动补偿前缀网络(High Optical Flow-Motion Compensation, HOF-MC)和适用于视频超分辨的生成式对抗主体网络( Wasserstein Generative Adversarial Networks-Limited Discriminator, WGAN-LD)两部分;另外,为了减少重建视频的闪烁现象,HOFWGAN还设计了高时序一致性优化方案。论文的主要工作和贡献点有:(1)设计了HOF-MC前缀网络,通过估算输入的低分辨率帧间的高分辨率光流并加以运动补偿,能够有效地提高重建视频的精度。(2)设计了WGAN-LD主体重建网络,通过增加对判别器的惩罚项来提升其鉴别能力,能够有效提高重建视频的视觉感知效果。(3)设计了整体的时序优化方案,通过约束相邻的图像帧间像素运动的位移量,来保证重建视频的时序一致性。同时,本文还针对嵌入式平台算力低、处理速度慢等问题,通过设计自定义插件来利用TensorRT对HOFWGAN算法进行加速优化,实现了算法在嵌入式平台的部署。
实验结果表明,HOFWGAN算法在视觉感知、精度、时序一致性和速度方面都取得较好的结果:(1)使用 WGAN-LD 网络,Vid4 数据集上自然图像质量评价和学习感知图像块相似度指标值为4.23和16.25,相较于TecoGAN提升了0.37%和1.2%;(2)使用 HOF-MC 前缀网络后,Vid4 数据集上精度相关峰值信噪比和结构相似度指标值为26.63dB和0.782,相较于TecoGAN提升了4.15%和3.44%;(3)使用时序优化方案后, Vid4数据集上时序一致性指标tOF和tLP值为19.09和0.00702,帧间闪烁现象明显降低。(4)对算法加速优化后,在Jetson TX2嵌入式平台上模型推理速度由7FPS提升至23FPS的近实时速度,证明了算法在嵌入式平台上的实用性。