论文部分内容阅读
人类信息社会的飞速发展,产生了海量的信息。这些信息一般呈现复杂的关系,如社交网络、网页等,它们不仅数据内部关系复杂,数据外部也通过链接、关注、订阅等联系起来。虽然人类可以利用机器学习方法,从这些海量信息中得出有价值的模式和知识,来解决各种社会、生活方面的问题,然而目前最常用的统计机器学习方法,却常常忽略数据内部和外部的联系,模型的学习大都建立在数据独立同分布的假设基础上,导致模型对于关联数据的拟合效果不甚理想。为了解决以上问题,研究者提出了统计关系学习(Statistical Relational Learning,SRL)。统计关系学习又称概率逻辑学习,目标是挖掘关系数据中的模式、逻辑、概率分布等信息,通过结构和参数学习建立学习模型,最终利用模型对关系数据进行推理和分类。因为它结合了知识库与概率模型,从而具有解决复杂领域问题的能力。统计关系学习已经成为人工智能和模式识别领域的一个研究热点,在生物信息分析、在线社交网络分析、自然语言处理、复杂数据挖掘等领域,都取得了成功应用。本文主要研究统计关系模型在分类中的应用。用于分类的统计关系学习模型通常称为关系分类模型(Relation Classification model,RC model)。关系分类模型在学习过程中,会受到样本间关系的影响。有研究工作表明,当关系数据具有很高的关系自相关值,关系分类模型学习的结果将优于传统的分类模型。然而,由于涉及关系分类模型的一般学习界限的理论研究相对较少,使得研究者只能凭借经验来控制分类模型的学习过程,导致分类模型的泛化性能较差。因此,非常有必要针对该问题进行深入的研究,加深对关系分类模型学习过程的理解,进而优化学习的过程。另外,在网络安全相关的态势感知、网络舆论分析问题中,由于采集的数据呈现出很高的相关性,因此在这些问题中应用关系分类模型具有很强的现实需求。鉴于以上考虑,本文主要研究以下4个方面:1.针对关系分类模型缺少准确的复杂性度量和一般学习界限的问题,提出一个新的衡量关系分类模型关联数据能力的复杂性度量——关系维。证明了该复杂度和关系分类模型的生长函数之间的关系,推导出有限VC维和有限关系维情况下的学习界限。然后分析了该界限可学习和有意义的条件,并对界限的可行性进行了详细的分析。最后分析了基于马尔科夫逻辑网的传统学习界限和关系分类中的学习情况,实验结果表明提出的界限能够解释实际关系分类中遇到的一些问题。在社交网络相关分析和具有内在关联性的网络安全数据分析中有广泛的应用前景。2.针对关系分类模型缺少稳定性度量和稳定学习算法的问题,定义了关系分类模型的稳定性测度——依赖稳定性,得出一个基于依赖稳定性的学习界限。根据对该界限的详细分析,设计了一个稳定的关系分类模型学习算法。最后实验结果表明该算法增加了关系分类模型的稳定性,同时降低了其经验风险和真实风险之间的差距。3.针对多领域关系分类问题,设计了一个多关系领域迁移学习算法,该算法能够将多个领域的知识进行融合、杂交和创新,并将这些知识存储在一个不确定的知识超图中。然后提出一个精确地和一个近似的期望支持度算法,从不确定的知识超图中有效地挖掘频繁子知识超图。最后将这些频繁子知识超图,即多个关系分类之间蕴含的有价值的核心知识优先迁移到目标域中。实验结果表明我们的算法在准确性方面优于目前最好的关系迁移学习算法。4.将上述理论和算法应用于网络可用性预估、网络舆论领袖识别、垃圾邮件分类和网络舆论倾向性分析中,验证了本文提出的学习理论和算法在网络安全问题中的有效性。通过以上的研究,本文建立了关系分类模型的一般学习界限理论,加深了对模型学习过程的理解,进一步优化了模型学习的过程。另外,还在网络安全相关的态势感知、网络舆论分析等问题中进行了实际应用,取得了良好的效果。