首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到18条相似文献,搜索用时 54 毫秒
1.
序列模式的一种挖掘算法   总被引:6,自引:1,他引:5       下载免费PDF全文
序列模式挖掘是数据挖掘中最重要的研究课题之一。基于记录数据库频繁集中各元素CtiD表的基础上,提出了序列模式挖掘的一种算法ISP。该算法考虑了项目集与序列之间的关系,利用时序连接法,采用不同的构造法,构造出相对应的候选集,从而计算出频繁集。由于算法ISP能够利用中间的挖掘结果,故提高了挖掘过程的效率。  相似文献   

2.
序列模式挖掘是数据挖掘中最重要的研究课题之一。基于记录频繁集各元素的Ctid表的基础上,有研究者提出一种渐进式序列模式挖掘算法IMSP,目的是支持度保持不变,而数据库变化不大时,如何利用前次的结果和中间结果,以加速本次挖掘过程。笔者深入分析了算法IMSP结构,指出该算法在时间复杂度,挖掘规则的完备性上的不足,同时也指出利用该算法所可能得到的错误结果。  相似文献   

3.
为了解决分布式环境下挖掘全局序列模式常产生过多候选序列,加大网络通信代价问题,提出了一种基于分布式环境下的快速挖掘全局序列模式算法--DMGSP.该算法将分布式环境下的各站点得到的局部序列模式压缩到一种语法序列树上, 避免了重复的序列前缀传输. 采用合并树中结点序列规则和项序扩展策略,对非频繁序列进行剪枝,有效地约简了候选序列,减少了网络传输量,从而快速生成全局序列模式.算法分析和实验结果表明,在大数据集环境下的DMGSP算法性能优越,能够有效地挖掘全局序列模式.  相似文献   

4.
针对序列模式挖掘中, 频繁子序列个数随模式长度增加而爆炸性增长的问题, 提出一种从序列数据库中挖掘最大频繁序列模式的新算法(MFSPAN). MFSPAN充分利用不同序列可能具有相同前缀的性质来减少项集比较次数. 在标准测试数据集上的实验结果表明了MFSPAN的有效性.  相似文献   

5.
为了实现对数据流的序列模式挖掘,提出了基于数据流的序列模式挖掘算法MFSDS-1和MFSDS-2,它们均通过调整入选度的大小来调整保存信息的粒度.算法MFSDS-2利用分层存储结构,不仅能更好地保存序列信息,而且可以通过与全局序列模式的对比得到当前活动的一些异常序列模式.实验结果表明,基于分层存储的算法MFSDS-2的效率比算法MSFDS-1高.  相似文献   

6.
为了实现对数据流的序列模式挖掘,提出了基于数据流的序列模式挖掘算法MFSDS-1和MFSDS-2,它们均通过调整入选度的大小来调整保存信息的粒度.算法MFSDS-2利用分层存储结构,不仅能更好地保存序列信息,而且可以通过与全局序列模式的对比得到当前活动的一些异常序列模式.实验结果表明,基于分层存储的算法MFSDS-2的效率比算法MSFDS-1高.  相似文献   

7.
研究了静态数据库当中挖掘压缩序列模式的问题,提出了一个压缩序列模式挖掘算法.该算法通过对闭序列模式全集进行划分处理,降低了序列的比对空间,并结合δ-dominant序列检测机制,有效的挖掘出了压缩序列模式集.实验表明,该算法具有较好的运行效率.  相似文献   

8.
一种序列模式的概念及挖掘算法   总被引:1,自引:1,他引:0  
介绍了一种时间序列模式的形式和概念,讨论了其相关的挖掘算法.将时间序列模式既用于具有时间关系的购买行为的分析,以揭示购买行为后面一种序列关系信息,又用于其他有时间关联的事件分析.挖掘算法由以下几部分构成建立频繁物品集,进行数据处理和转换,并生成候选子序列,通过验证后,得到长度为2,3,…的序列集合,从中选出独立最大序列即为所求.通过实例指出了该算法和传统的Aprioriall算法的不同之处.结果表明,这种序列模式在网络通信、气象分析等领域具有广阔的应用前景.  相似文献   

9.
卢海涛 《科技资讯》2014,12(17):204-204
论文阐述了基于时间序列的模式挖掘的基本概念,对基于时间序列的模式挖掘经典算法和增量挖掘、时间序列分段线性表示及相似性算法进行了相对全面的介绍,对算法的特征做了详细的论述。  相似文献   

10.
肖哲  任胜兵 《科技信息》2007,(36):69-69,101
本文阐述了序列模式的基本概念,对序列模式挖掘的一般经典算法和增式挖掘、多维模式挖掘等拓展算法进行了较为的全面介绍,列举了序列模式挖掘当前的广泛应用,讨论了研究的发展趋势及面临的挑战。  相似文献   

11.
频繁序列模式挖掘算法   总被引:5,自引:0,他引:5  
为解决从数据库中挖掘长模式和支持度较低时可能遇到计算复杂度较高的问题,提出一种新的算法--EFSPAN(Effective Frequent Sequential PAtterN mining algorithm).算法采用了深度优先挖掘策略,并将基于前缀序列格的深度优先遍历与两种高效的剪枝策略相结合.实验结果表明:新算法在模式较长和支持度较低时,能使搜索空间中60%以上的节点免被搜索;从而大大缩小了搜索空间,降低了序列模式挖掘算法的计算复杂度.  相似文献   

12.
频繁模式不能反映模式内部各项目之间的关联和相关关系,频繁关联模式挖掘与孥繁相关苎式兰苎已越来越受到人们的重视.按照相关模式定义,如果一个模式是相关模式,其超模式一定是相关模式,最小频繁相关模式挖掘将大大减少挖掘出来的数量,有利于用户分析.给出最小频繁相关模式挖掘算法,并在标准数据挖掘数据集蘑菇数据上测试,实验证明算法是正确有效的.  相似文献   

13.
该文探讨挖掘不确定性数据频繁项集,在Carson Kai-Sang Leung等人提出的一种基于树的UFPgrowth算法的基础上进行改进,提出新算法-UFP-growthT.实验表明,该算法可以有效地挖掘不确定性数据的频繁项集,且拥有高效性和伸缩性.改进后的算法在一定程度上减小了UFP-tree的大小,加快了挖掘过程...  相似文献   

14.
快速频繁序列模式挖掘算法   总被引:4,自引:1,他引:3  
为解决从数据库中挖掘长模式可能遇到较高的计算复杂度问题, 提出一种新的算法FFSPAN. 传统上, 要判断一个序列是否频繁, 需要在原数据库中判断整个序列是否频繁; 而算法FFSPAN是通过在序列数据库中寻找一个频繁项或一个频繁项集来代替寻找一个完整的频繁序列, 而且FFSPAN算法每次扫描的数据库都是迅速减小的, 这使得算法在挖掘的序列模式越长时越有效. 在标准测试数据集上的实验结果表明, FFSPAN算法非常有效.  相似文献   

15.
通过前缀序列的引入,将搜索空间划分为若干个子空间,利用模式增量技术对序贯模式进行有效搜索,并提出了项目位置索引的概念,即将原始序列数据库信息转换到项目位置索引(IPI)中,从而在搜索序贯模式时避免了复杂的多维候选序列的测试,仅需对各前缀序列对应的扩展的项目位置索引库(IPIDBs)做简单的序列数目累加操作,将复杂的高维序贯模式搜索问题巧妙地转换为一维频繁项目的搜索,降低了算法复杂度,提高了效率。  相似文献   

16.
对序列模式挖掘中的5种算法的执行过程和特点进行了研究,并对这几种算法的时间和空间执行效率进行了分析,指出这5种算法各自的使用范围,得出的结果对序列模式挖掘的应用具有一定的参考价值.  相似文献   

17.
Link patterns are consensus practices characterizing how different types of objects are typically interlinked in linked data.Mining link patterns in large-scale linked data has been inefficient due to the computational complexity of mining algorithms and memory limitations.To improve scalability,partitioning strategies for pattern mining have been proposed.But the efficiency and completeness of mining results are still under discussion.In this paper we propose a novel partitioning strategy for mining link patterns in large-scale linked data,in which linked data is partitioned according to edge-labeling rules:Edges are grouped into a primary multi-partition according to edge labels.A feedback mechanism is proposed to produce a secondary bi-partition according to a quick mining process.Local discovered link patterns in partitions are then merged into global patterns.Experiments show that our partition strategy is feasible and efficient.  相似文献   

18.
在WUM(Web Usage Mining)中挖掘序列模式的背景下,提出了一种基于server session约束的序列模式增长挖掘算法.首先,为了更好地从网站服务器日志文件中挖掘模式和发现知识,提出了一种基于server session的服务器日志文件格式.同时,引入基于server session的约束概念,利用其能够减少初始序列模式和候选项集大小的特点来减少每次扫描后缀数据库的规模,再从预处理后的日志文件中挖掘WUM的频繁访问路径的序列模式.最后通过实验证明了算法的有效性和优越性.  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号