论文部分内容阅读
随着互联网的日益普及和发展,其传播内容的健康性、安全性问题也日益突出,色情、暴力、反动等不良信息在互联网上随意传播,这严重危害了国家的安定和人民的身心健康。因此,对互联网实施有效的内容安全管理,需求迫切。就我国目前情况来看,媒体监管主要采用人工审核的方式,要耗费大量的人力物力,这不仅影响了互联网的开放性,而且,随着互联网爆炸式的发展,人工审核的方式也越来越不能适应内容监管的需要。
至今互联网都是作为一个供人使用的文件的载体而不是作为一个计算机可以理解的并能自动处理的数据与信息的载体而发展起来的。用面向计算机的数据来扩充网页,同时加入仅供计算机阅读和处理的文件,我们就把互联网变成了语义网。计算机跟踪通向关键术语的定义以及对这些术语进行逻辑推理的规则的超连接,就可以发现语义数据的意义。这样所得到的基础结构将促进自动化网上服务(如内容安全监管)的开发。
本文首先基于Web具有的一些特征以及应用于语义网的知识表示语言,比较了语义网中知识表示和传统知识表示的不同,提出了语义网知识表示的评价标准,界定了本体的概念并介绍了本体在知识表示中的应用。资源描述框架(RDF)内容标记规范讲的是从互联网内容监管和过滤的需求出发,应该如何来对内容进行标记,使计算机能够理解网络内容并对其进行自动处理。资源描述架构(RDF)是处理标记的基础,为在互联网上互相交换机器可理解数据的应用程序提供互操作性。
然后从监管需求和监管难度两方面阐述了内容监管模式研究的必要性。从网络的不同位置指出了几种可能的监管模式。分析了当前存在的两种监管手段,并从当前技术发展的成熟度考虑,倾向于使用基于内容标记的内容监管。在这之后详细阐述基于标记的内容监管方法。给出了以信息网关为中心的内容监管体系结构模型。
接着阐述了Web给数据挖掘带来的挑战,以及基于’Web的数据挖掘的方法。其中着重介绍了Web内容挖掘、结构挖掘、用法挖掘。
最后提出了一种利用多智能主体和本体论(ontology)理论设计的信息检索服务器。它集成了界面主体、预处理主体、管理主体、信息处理主体和具有移动性的信息搜集主体,并利用ontology对文档进行领域分类,同时对用户的查询信息进行规范。该系统能够比较及时地反映网络中信息的动态变化,并具有较好的信息导引能力。