基于分布式算术编码的低复杂度视频编码器研究

来源 :武汉理工大学 | 被引量 : 0次 | 上传用户:rscgmy
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
分布式视频编码(DistributedVideoCoding,简称DVC)有别于传统的视频编码方式,它将具有复杂运算的模块(如运动估计、运动补偿等)从编码端转移到解码端。因此,它可以应用于编码端的计算能力、存储空间和功耗资源都受限的场景。目前,大多数的DVC采用信道编码实现信源的编解码,如低密度奇偶校验码(Low-DensityParity-Check,简称LDPC)。然而,LDPC在视频中常见的中短长度信源上表现不佳,且LDPC编解码时依赖于稀疏校验矩阵致使其编码结构过于复杂,这造成了DVC编码性能被抑制的问题。与此同时,尽管无反馈DVC由于不存在反馈信道而降低了网络时延,但它对码率估计的精度要求较高。除此之外,当压缩率受到限制时,帧预测往往不够准确,这将直接影响到DVC系统的解码质量。为了解决上述问题,本文开展如下的研究,旨在提高DVC编码效率,提升率失真性能,改善码率控制算法,降低编码器结构复杂度。
  1)针对基于LDPC的DVC在中短长度信源上表现不佳的问题,本文提出基于分布式算术编码(DistributedArithmeticCoding,简称DAC)的DVC。经研究发现,诸如DAC之类的信源编码也能够用于相关信源压缩。尤其是对于视频中常见的中短长度信源,其压缩性能要优于LDPC。因此,本文以分布式信源编码为理论基础,采用DAC构造DVC编解码器,以解决DVC编码性能受到抑制的问题。
  2)针对无反馈DVC码率控制问题,本文在上述DVC编解码器的基础上建立了码率估计模型。本文将DAC的区间重叠因子映射到信息熵,并根据信息熵与码率的数学关系,推导出码率与区间重叠因子之间的关系。然后模拟出三种函数关系模型,并进行实验选择恰当的函数模型。最后,利用该函数模型实现DVC的码率控制,以适用于复杂多变的视频流。
  3)针对当压缩率受到限制时,帧预测不够准确的问题,本文提出基于神经网络的DVC帧预测。利用神经网络在图像分析和图形处理中的突出能力,本文将神经网络应用到DVC中,提出了基于神经网络的DVC帧预测。使用编码网络模块、二值化网络模块以及解码网络模块构建具有分阶网络结构的DVC神经网络模型。在低压缩率的条件下,实现了对关键帧和参考帧的预测。
  本文针对基于信道编码的DVC存在的不足,提出了基于DAC的低复杂度视频编码器,以降低DVC编码器的算法复杂度,提升DVC系统的压缩性能。实验结果表明,基于DAC的DVC优于采用信道编码的DVC系统,能有效提升编解码性能。对于具有不同运动剧烈程度的视频,本文的码率估计模型都能自适应地计算出合适的DAC区间重叠因子,实现无反馈DVC的码率控制。同时,本文的DVC编码复杂度低于解码的19~25倍,能应用于编码端资源受限的场景。此外,在低压缩率的情况下,神经网络能高效地预测目标帧,在DVC领域有良好的应用前景。
其他文献
暴力场景检测对于网络信息净化、保护未成年人身心健康、自动视频监控等方向具有广阔的应用前景。视频和音频是媒体中主要信息,但除了视频中的暴力画面和音频中的暴力声音之外,类似愤怒或憎恨情绪的字幕出现往往伴随着暴力场景的发生。字幕文本中所包含的情绪也有很多值得参考的补充信息。尤其是在视频帧或音频帧缺失的情况下,字幕信息对于暴力场景检测有着十分重要的作用。本文对融合视听特征和字幕特征的暴力场景检测方法进行了
随着计算机和信息技术的快速发展,越来越多的用户将海量数据存放到云平台,享受云计算与深度学习技术带来的便利。然而存放于云平台上的数据涉及用户隐私,一旦遭到非法窃取,会给用户带来极大的损失和风险。针对这一问题,学者和专家们提出了基于同态加密的神经网络模型来完成云上的推理任务。用户利用同态加密技术对隐私数据完成加密并上传到云平台。云平台在不解密的前提下,对密文进行处理然后将结果以密文的形式发送给用户。然
学位
互联网中充斥着大量的恶意网页,这些恶意网页在用户不知情的情况下非法窃取用户信息,对用户的网络安全造成威胁。分析并提取恶意网页特征是基于机器学习的恶意网页识别方法的研究重点。恶意网页在URL文本、网页内容等方面与良性网页存在客观的差异,通过特征工程提取这些特征并结合机器学习分类算法,可实现对恶意网页的识别。恶意网页生存期短且攻击手段多变,存在样本收集困难的问题;同时网页样本标注的工作量大,目前还没有
随着经济全球化的日益加深,机器翻译(Machine Translation,简称MT)在许多国际舞台上扮演着不可或缺的角色,成为突破不同语言交流障碍的重要手段。在大规模语料库和计算能力有限的条件下,基于神经网络的机器翻译方法能够通过编码器-解码器架构完成源语言序列到目标语言序列的直接映射,从而获得比统计机器翻译更好的效果。然而,由于自然语言本身的复杂性和多样性,单个神经机器翻译模型的表达能力往往存
散货堆场是港口的核心资源,堆位分配是堆场资源调度中极为重要的部分。如果堆场堆位分配不合理,则极易导致堆场资源利用率低下,增加港口作业成本,降低港口吞吐量。如何进行合理的堆位分配,提高货物与堆位之间的匹配度、提高散货堆场的利用率、降低港口作业成本,已成为建设智慧港口进程中亟待解决的问题。因此,研究散货港口中散货堆场的堆位智能分配策略具有实际应用意义和一定的理论价值。针对以上问题,本文开展了相关研究,
学位
近年来,主题情感联合模型成为了无监督学习领域的一项重要研究内容,在文本主题挖掘和情感分析等方面均有实际应用。然而在现实场景中,微博本身存在文字短小,结构不完整等特征,当处理小型微博数据集时,主题情感模型的情感极性分类效果不佳。因此,本课题围绕微博主题情感模型展开研究与改进,提出基于词嵌入主题情感模型的微博情感极性分析方法,主要研究成果如下:首先,针对基于多特征融合的微博主题情感挖掘模型——TSMM
学位
本文以自然场景文档图像为研究对象,针对多变的拍摄视点引起的文档形变、文档尺度多变和复杂场景造成的文档定位错误和精确度低的问题,提出了基于角点检测的两阶段自然场景文档定位算法,通过由粗定位到精确定位的两阶段角点定位方式,实现自然场景文档的精确定位目标。本文主要工作如下:1)以CNN为算法特征提取框架,建立了粗定位-精确定位的两阶段定位算法框架。粗定位阶段以全局优化得到角点坐标近似最优解为目标,精确定
学位
随着港口运输越来越发达,为适应港口集装箱业务的发展需求,集装箱作业自动化的程度也越来越高,正确高效地识别集装箱箱号是自动化作业的基础。随着人工智能在港口领域得到广泛应用,机器学习作为人工智能的关键核心技术,受到了前所未有的重视和快速发展。基于机器学习方式识别集装箱箱号,需要足够的集装箱箱号数据集,目前在港口领域,还没有成熟的集装箱箱号数据集。因此研究集装箱箱号图像样本扩充方法对于基于机器学习的集装
随着智能设备的普及,GPS和Web2.0技术的发展,能够基于位置提供服务的应用程序应运而生。基于位置的社交网络(Location-based Social Network,LBSN)也变得流行起来,用户可以轻松地访问LBSN应用程序,并在自己感兴趣的兴趣点(Point of Interest,POI)留下足迹,比如用户感兴趣的餐厅、酒店、剧院等。然而,随着城市的发展,人们生活的物理边界不断被拓宽,
随着信息技术的飞速发展,网络上的信息量激增。在求职领域中,传统的线下招聘也逐步被网络招聘所取代,出现了诸如58同城、智联招聘的大量求职网站系统,用户可以在网站上投递简历、进行面试,但是大量的职位信息可能让用户难以抉择。为了从海量的求职信息中发现用户的兴趣,满足用户个性化的信息需求,对求职推荐的准确性要求更加严格。传统求职推荐系统多采用协同过滤算法,协同过滤算法存在冷启动和数据稀疏问题,解决这些问题
学位