论文部分内容阅读
提出一种模板化的Web列袁页面信息自动抽取方法,并对其实现的关键技术进行了阐述.包括页面预处理,Web列表页面中数据区域、数据记录的定位方法。同时提出一种有效的对DOM子树进行属性对齐和标注的方式,并给出相关算法。实验结果表明,该方法能够自动寻找并抽取Web列表页面的主要信息,具有较高的查全率和查;住率。