基于伪属性语义匹配的Deep web信息抽取

来源 :四川大学学报(工程科学版) | 被引量 : 0次 | 上传用户:a381697182
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
已有的Deep Web信息抽取算法主要对结构规范的网页进行模版的提取,目前多数Deep Web网页在结构上是非规范的,网页中记录属性字段可能缺失或重复、原子属性字段可能被html标签分隔.为了正确抽取这些非规范网页,提出了一种新方法:引入了记录的伪属性及其语义匹配概念,通过实现记录间伪属性序列的语义匹配实现信息抽取;提出了伪属性序列的模型及其语义匹配算法和记录Wrapper模型及其生成算法.实验表明,在结构不规范deep web网页的抽取上,能达到91%的查全率和93%的查准率,相对其它算法有一定优势.
其他文献
为了提高家庭服务机器人的智能,提出了一种面向家庭服务的人体动作识别算法。首先,提出了利用运动历史图像自适应更新背景的方法,对家庭环境进行背景建模;然后,利用YCbCr图像
利用喷雾干燥技术在制备热敏性物质方面的优势,研究野木瓜速溶固体饮料的工艺流程和工艺条件,喷雾干燥的进风温度和出风温度对产品的冲调性和含水率有很大的影响,试验结果表
李果表面具有蜡质,导致其热风干燥时间长。该试验采用热烫和氢氧化钠溶液浸泡的方法,对李果进行预处理,测定其干燥时间并结合感观评定,优选了李果热风干燥的预处理工艺条件。
会议
由中华医学会航空航天医学分会主办的全国第六次航空航天医学学术会议将于 2 0 0 2年 6月 2 6~2 9日在浙江宁波市召开。本次会议共收到应征论文 2 1 9篇 ,经专家评审组采用双
面对突发的传染性非典型肺炎,科学家们通力协作积极投入研究,这种精神和热情令人鼓舞,但是对其研究应严格按照相关的条件进行,否则有可能导致SARS病毒再污染。 世界卫生组织
本试验对水果废弃物(橙皮,桔皮,橙叶,桔叶)中提取精油萃取方法进行了研究,通过三种不同试剂(乙醚,乙酸乙酯,石油醚)萃取水蒸汽蒸馏所得产物,比较萃取率进而研究其适宜度。经
巴斯德去世已有95年了.但是后人却永远怀念他.他是法国人,怀念他的却是全世界.因为他在科学上的贡献永远造福于人类. 巴斯德的成就从何而来?他对青年人的教导,便是他的经验
在秋子梨带肉果汁的生产中,梨汁提取时,加入0.2%的果胶酶制剂,可使出汁率提高20%左右。同时在果汁的榨取过程中,为防止其氧化变色,可在榨汁的同时,加入0.04%的抗坏血酸,这样榨出
会议
该文以可溶性固形物浓度为16%的甜高粱茎杆汁液为材料,通过单因素试验确定适宜的氮源;对不同的pH值、接种量、温度、时间条件下发酵甜高梁汁对酒精度的影响进行了研究;通过正