论文部分内容阅读
图像识别是计算机视觉和人工智能领域的重要问题,其终极目标是使计算机具有分析和理解图像内容的能力。图像识别是一个综合性的问题,涵盖图像匹配、图像分类、图像检索、人脸检测、行人检测等技术,并在互联网搜索引擎、自动驾驶、医学分析、遥感分析等领域具有广泛的应用价值。近年来,随着机器学习算法的进步,特别是深度学习算法的迅猛发展,图像识别在多个领域取得了重大突破。此外,由于图像获取设备和存储设备的普及,以及互联网的盛行,“大数据”成为未来发展的趋势,大尺度的图像识别成为最具挑战性的问题之一。基于机器学习领域的特征选择和特征学习算法,本文深入地讨论了图像识别技术中的图像匹配和图像分类问题,提出了一系列方法,显著地提高了图像识别系统的性能。本文的主要研究内容和贡献归纳如下: (1)我们提出了一种新颖的跨域图像匹配框架,有效地提高了匹配系统的精确度,并减少了系统的响应时间。不同于此前最先进的跨域图像匹配方法,我们提出的框架整合了多种视觉特征的判别力以提高匹配精确度,并提出数据驱动和基于查询的特征融合模型,不仅在各种特征内部进行特征选择,而且同时优化各种特征之间的权重向量。此外,我们设计了一种基于超平面哈希的加速策略快速地收集困难负样本,避免了暴力搜索过程,从而有效地减少了系统的运算负担。大量的跨域图像匹配实验表明,我们提出的方法在系统精确度和响应速度上都显著地胜过此前最先进的方法。 (2)我们提出了一种新颖的图像分类算法,该方法将图像分类形式化为一个多任务学习问题,其核心思想是在分类任务之间自适应地共享信息。不同于在多个任务之间加以很强的假设或发现其中特定的结构,我们的方法有选择性地抽取并利用类别之间的共享信息,同时可以有效地捕捉类别之间的差异性。为了实现自适应的信息共享,我们使用两个对应的参数集合,并分别对其施加不同的正则化约束。除了将该方法应用于预计算的图像特征,我们也将其整合至深层神经网络中,深层神经网络充分考虑了类别间的关系,其判别力随之增强。针对预计算的图像特征和深层神经网络,我们进一步开发了两种策略来求解自适应共享的优化问题。大量实验结果表明我们的算法可以通过恰当地知识迁移大幅提升图像分类的精确度。 (3)我们提出了一种新颖的判别字典学习方法,该方法利用类别之间的层次化结构关系捕捉多层的判别信息,并用于图像分类。对类别结构中的每个内部节点,我们学习一个有判别力的字典和用于区分其孩子节点的分类器模型。不同层的判别字典被学习用来挖掘不同尺度的视觉属性,其学习与分类器的学习联合进行,以最小化整个层次结构的损失函数。此外,每个中间节点的字典会被其孩子节点继承,使其孩子节点可以被多尺度的视觉信息所描述。相比于此前没有考虑类别之间关系或只依赖于无监督字典学习的算法,我们提出的算法恰当利用了类别之间的结构关系,使有监督字典学习能适用于大尺度的图像分类任务。实验结果验证了该算法处理大尺度图像分类问题的有效性。