论文部分内容阅读
智能信息大数据时代的到来,数据量以及数据类型海量地增长。伴随着机器学习理论不断地完善,使得机器学习在现实的生活应用中取得了长足的发展。传统机器学习的目的是通过最小化训练数据上的正则化经验风险来寻找测试数据上期望风险最小的模型,但该模型假设训练数据和测试数据具有相同的联合概率分布。而在自然语言处理、文本处理、计算机视觉、数据挖掘等实际的应用中,上述模型假设基本上无法满足。如何基于存在的不同分布数据散度,快速实现模型构造,完成数据标注,是当代机器学习中最具有挑战性的前沿方向。
领域自适应是迁移学习中的一种代表性方法。领域自适应学习是源领域数据样本和目标领域数据样本具有相同的数据特征和类别但数据分布不同的自适应学习算法,希望在源领域中构建数据模型,通过知识的迁移使得在目标领域中未知标签能够被执行,从而可以忽略源领域和目标领域独立同分布的模型假设,来提高测试数据的学习性能。目前迁移学习方法中存在着两种主要的方法,即以数据中心的方法和子空间为中心的方法。基于数据为中心的方法中,主要是通过同时减少边缘概率分布差异和条件概率分布差异,进而减少了分布偏移。然而这一类算法中两种分布差异具有相同的权重,导致在实际的应用中性能较差。另外,基于子空间为中心的方法中,仅仅是减少了子空间几何的偏移,并没有考虑到两个域之间的分布差异,同时也没有考虑到源领域和目标领域类别的判别特征学习。因此,本文针对于这两个问题,提出了基于特征匹配与实例加权的联合匹配方法以及基于联合特征分布和几何对齐的联合匹配方法。本文的主要工作和创新是:
针对基于以数据为中心的方法实现领域自适应时,忽略了在不同的模型中边缘分布和条件分布权重不一定相同的重要的问题,提出了基于特征匹配与实例加权的联合匹配方法。该方法先通过源领域实例重新加权来增加源领域数据样本和目标领域数据样本的相关性,其次通过平衡因子动态调节两个域之间的分布权重来减少分布偏移,从而达到平衡概率分布适配。仿真实验表明:所提出的框架可以有效地提高迁移学习的分类精度。
针对基于子空间的方法实现领域自适应,提出了基于联合特征分布和几何对齐的联合匹配方法。该方法同时减少了子空间几何的偏移和分布偏移并且使得样本在特征空间中具有一定的可分性。在多个数据集上的实验表明,所提出的框架可以有效地提高迁移学习的分类精度。
领域自适应是迁移学习中的一种代表性方法。领域自适应学习是源领域数据样本和目标领域数据样本具有相同的数据特征和类别但数据分布不同的自适应学习算法,希望在源领域中构建数据模型,通过知识的迁移使得在目标领域中未知标签能够被执行,从而可以忽略源领域和目标领域独立同分布的模型假设,来提高测试数据的学习性能。目前迁移学习方法中存在着两种主要的方法,即以数据中心的方法和子空间为中心的方法。基于数据为中心的方法中,主要是通过同时减少边缘概率分布差异和条件概率分布差异,进而减少了分布偏移。然而这一类算法中两种分布差异具有相同的权重,导致在实际的应用中性能较差。另外,基于子空间为中心的方法中,仅仅是减少了子空间几何的偏移,并没有考虑到两个域之间的分布差异,同时也没有考虑到源领域和目标领域类别的判别特征学习。因此,本文针对于这两个问题,提出了基于特征匹配与实例加权的联合匹配方法以及基于联合特征分布和几何对齐的联合匹配方法。本文的主要工作和创新是:
针对基于以数据为中心的方法实现领域自适应时,忽略了在不同的模型中边缘分布和条件分布权重不一定相同的重要的问题,提出了基于特征匹配与实例加权的联合匹配方法。该方法先通过源领域实例重新加权来增加源领域数据样本和目标领域数据样本的相关性,其次通过平衡因子动态调节两个域之间的分布权重来减少分布偏移,从而达到平衡概率分布适配。仿真实验表明:所提出的框架可以有效地提高迁移学习的分类精度。
针对基于子空间的方法实现领域自适应,提出了基于联合特征分布和几何对齐的联合匹配方法。该方法同时减少了子空间几何的偏移和分布偏移并且使得样本在特征空间中具有一定的可分性。在多个数据集上的实验表明,所提出的框架可以有效地提高迁移学习的分类精度。