首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到17条相似文献,搜索用时 49 毫秒
1.
随着互联网的快速发展,信息也呈爆炸式增长,如何从海量的文本信息中获取所需的信息成为当今一门重要的课题.检索、分类、抽取等文本信息处理技术取得了长足发展,但面向人物属性的自动信息提取却没有引起人们的重视.基于规则的人物信息抽取算法,首先对需要抽取的信息进行规则描述,重点是时间、地点、籍贯等信息.在规则的基础上,研究开发人物信息抽取系统,最终实现了半结构化人物属性信息的自动提取.  相似文献   

2.
基于 DOM 的 Web 信息抽取规则的构造与实现   总被引:1,自引:0,他引:1  
为了实现对Web信息的查询重、构和再利用,人们采用了Web信息抽取技术.本文主要讨论基于 DOM 的 Web 信息抽取,研究如何构造抽取规则,才能提高信息抽取的准确度、提高抽取规则的适应能力,并给出了抽取规则的生成过程.  相似文献   

3.
Web信息抽取是近十年来发展起来的一门数据挖掘技术。主要介绍信息抽取的概念和任务,并给出了Web信息抽取的评价指标和信息抽取的原理,最后提出了当前Web信息抽取方法中存在的问题以及以后研究的重点。  相似文献   

4.
霍滨焱 《应用科技》2009,36(7):37-40
提出了最小节点信息树概念,将抽取规则分为粗略规则和精细规则,降低了DOM树的高度,提高了信息抽取效率.设计并实现了一种最小节点信息树抽取规则的可视化实现方法.  相似文献   

5.
基于DOM的Web信息抽取方法研究   总被引:1,自引:0,他引:1  
以往基于DOM的Web信息抽取方法在信息抽取过程中存在如需要较多样本集、适应性较差等问题,为解决Web上的信息在抽取中存在的问题,本文提出了一种在原有基于DOM的Web信息抽取方法的基础上引入竞争分类方法进行信息抽取。  相似文献   

6.
合理利用城市轨道交通安全事件案例对突发事件下辅助制定应急决策具有重大意义.目前,中国轨道交通运营商存储了大量的安全事件案例,但大多以自由化或半自由化文本的形式存储在数据库中,使用率较低.为提高城市轨道交通安全事件案例的使用效率,提出了基于规则的信息抽取方法,将城市轨道交通安全事件案例的自由文本转化为用共性知识元表示的结...  相似文献   

7.
一种Web信息抽取规则的优化方法   总被引:2,自引:0,他引:2  
提出一种Web信息抽取规则的优化方法,用于提高信息抽取的效率.采用分级制的思想,将原有规则中的限制条件分为粗规则和细规则两部分.粗规则面向网页中所有的信息片断,用于信息的初步过滤;细规则面向过滤后的信息片断,用于抽取最终的信息.由此,避免了将规则中的限制条件应用于网页中的所有信息片断,达到了减少计算量、提高抽取速度的目的.  相似文献   

8.
提出了一种从模板网站中利用网络上的冗余内容提取结构化数据的方法。该算法从一些原始网站提取记录来填充种子数据库。然后,在每一个新的站点标识值,为了配合不同跨站点交涉的属性值,我们进行了相似性度量。同时为了过滤掉噪声,我们在那些基于模板的网站发现并应用了该属性的实际值。另外借助SOGOU和NICTCLAS中文分词等第三方接口来准确计算词频,使文字分析更适合人们常用的习惯。  相似文献   

9.
提出了一种基于树形结构的Web结构化数据抽取算法.该算法基于HTML的树形层次结构,包括HTML树构造算法,数据区域挖掘算法,数据记录挖掘算法以及数据记录模式生成算法.算法引入了页面元素布局位置等信息用于清洗页面,采用层次划分思想实现页面数据区域的挖掘,并通过树匹配生成记录模式,实现最终数据项抽取.实验表明,该方法可以有效地实现Web结构化数据抽取.  相似文献   

10.
为了加快工作票的生成速度和保证操作过程的安全性,提出了一种基于规则的工作票描述语言自动生成算法.根据选定的工作设备,以电力行业知识为基础,由电气系统图自动生成操作设备链表,通过基于规则的推理机制,实现了从设备操作到自然语言的解释和翻译,最终生成完整、准确的操作描述.实验结果表明,所提算法比传统手工方法的生成速度提高约20倍,利用它可以大幅度提高工作票的生成速度,保证操作过程的安全性,有效地降低操作人员的劳动强度.该算法已在数十家供电企业得到了应用.  相似文献   

11.
基于填充标记的自适应Web信息提取   总被引:1,自引:0,他引:1  
提出一种自适应Web信息提取算法,基于自底向上规则模块层叠,通过在提取模板中填充一定数量有助于识别信息类别的SGML标记,较好地覆盖Web页中不可见信息,有效控制自适应过程中信息的过少和溢出,实现智能化Web信息提取.  相似文献   

12.
Web信息抽取技术研究进展   总被引:14,自引:0,他引:14  
Web信息抽取技术是当今的一个研究热点.目前出现了基于不同原理的多种信息抽取技术,它们具有不同的性能.本文根据信息抽取的原理,对现有的信息抽取技术进行了分类,结合典型的系统,在语义的附加方式、模式的定义方式、规则的表现形式、语义项的定位方式、对象的定位方式等几方面进行了分析和比较,在此基础上提出了待研究的问题.  相似文献   

13.
经典粗糙集理论是面向完备信息系统的,为处理不完备信息系统.需要进行理论扩充.本文首先介绍了粗糙集理论的基础知识,然后对经典粗糙集理论在不完备信息系统中的几种扩充模型进行了介绍和分析,并对现有基于粗糙集理论的不完备信息系统知识获取方法的研究进行了总蛄,最后展望了谊理论未来的发展方向.  相似文献   

14.
当愈来愈多的数据资料以XML为标准格式进行存储时,由于其格式的不同而导致传统的数据库及查询语法无法适用,文章分析了一种全新的XML查询语言XQuery,并对其在相关领域的应用作了介绍.最后,对XQuery的发展前景作出了展望.  相似文献   

15.
李金艳  余忠华 《科学技术与工程》2023,23(35):15117-15123
诊断决策过程本质上为信息的处理过程。由于信息结构的复杂性和采集的局限性使得获取的信息存在缺失、模糊、冗余等不完备现象,从而影响诊断的准确性。为此,对条件属性冗余、部分数据值缺失情形下,如何提高被诊断信息的完备性开展讨论,试图通过问题聚类探寻诊断决策所需的隐含规则,提出信息补齐与属性约简的知识挖掘方法:首先,针对Roustida算法在缺失值处理时存在的局限性进行改进,扩充其在工程实践中的适用范围,使缺损信息趋于完整;然后,利用遗传算法和广义诊断规则推理实现条件属性约简和规则凝练;最后,以质量问题诊断为对象进行了案例研究,测试样本诊断结果覆盖度 ,验证了不完备信息条件下该方法可以实现以相对较简方式表达问题与情境信息之间的关联关系,挖掘问题发生的隐含规律。  相似文献   

16.
XML查询语言XQuery的分析与研究   总被引:1,自引:0,他引:1  
李元韬  曹志宇 《太原科技》2010,192(1):90-92
随着XML日益广泛的应用,XML的查询语言XQuery变得尤为重要。阐述了XML的查询语言XQuery.设计并实现了一个基于XQuery的XML查询系统,同时介绍了它的结构框架和执行过程,提出了对其查询优化的具体方案。  相似文献   

17.
文章针对广义多尺度信息系统的知识获取问题,分别研究了协调与不协调广义多尺度决策信息系统的规则提取,阐明了系统协调性与决策规则之间的联系,并给出相关性质。进一步研究了规则提取与特征矩阵之间的联系。并利用矩阵对尺度组合进行刻画,分别给出了协调与不协调的广义多尺度决策信息系统中的最优尺度组合与保持正域不变的最优尺度组合选择的矩阵方法,并且结合实例说明矩阵方法的直观性与简便性。  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号