首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到20条相似文献,搜索用时 15 毫秒
1.
传统决策树在中小型数据集的预测分类上表现优秀,但在大数据集的处理上仍然存在效率低下、准确率较低等问题.为了适应大数据集环境,国内外学术界和工业界提出了将决策树与分布式处理平台相结合的分布式决策树算法,面向大数据处理的Hadoop和Spark分布式计算系统的出现,为研究分布式决策树算法提供了新的契机.为此,面向以基于大数据系统的分布式决策树算法为研究对象,从决策树基础算法、大数据平台的分布式并行机制和大数据平台下分布式决策树实现的三个方面进行剖析,以呈现Hadoop和Spark平台下的分布式决策树算法当前研究现状,并分析未来分布式决策树的研究方向.  相似文献   

2.
基于决策树算法探讨了老年人轻度认知障碍(MCI)临床筛查的影响因素及其交互关系.结果表明:(1)主观记忆障碍、缺乏体育锻炼、语言语义流利异常和单腿平衡能力差是MCI诊断的多变量统计分析预测因素;(2)决策树临床算法在区分MCI老年人与正常老年人方面具有较高的准确率.  相似文献   

3.
主体构建和学习环境(ABLE)是IBM开发的用于支持主体建模、构建多主体系统的框架.本文改进了ABLE的决策树算法,在其中计算属性的信息增益时加入一个模糊因子,使算法能更简单、有效地学习.在UCI数据集上的测试结果表明改进后的算法在不降低精度的前提下,可以生成更简洁的决策树,特别是处理复杂的数据时,可显著降低规则数目.  相似文献   

4.
为了在提高文本分类效率和提升分类速度间进行平衡,综合考虑SVM决策树的深度、均衡度、构造方式、类内样本数、类间相似度等对分类结果的影响,提出针对海量文本多分类问题的SVM决策树构建算法.在大规模语料库上的文本分类实验表明,该算法可在一定程度上提升分类效果,同时可以大幅减少训练和测试时间,方法可行且适应性强.  相似文献   

5.
分析经典ID3型决策树挖掘算法中存在的问题,对其熵值计算过程进行改进,构建一种改进的ID3型决策树挖掘算法.重新设计决策树构建中的熵值计算过程,以获得具有全局最优的挖掘结果,并针对UCI数据集中的6类数据集展开挖掘实验.结果表明:改进后的挖掘算法在决策树构建的简洁程度和挖掘精度上,都明显优于ID3型决策树挖掘算法.  相似文献   

6.
决策树抵抗噪声的能力是启发式算法设计中的关键因素.对ID3和DoI 2种启发式算法在抵抗噪声的能力上做了对比研究.通过实验比较得出由DoI算法构建出的决策树在抵抗噪声的干扰方面与根据ID3算法构建出的决策树相比具有一定优势.  相似文献   

7.
数据流的特征是海量的、高速流动的、实时处理的.由于一些数据分布随着时间而改变,因此将这些数据流称为概念漂移.首先按照分类模型对数据流决策树进行分类,分为单分类决策树和集成分类决策树.单分类模型分为快速决策树、变异决策树和其他决策树算法.集成分类模型分为衍生快速决策树和随机决策树变体算法.其次介绍了概念漂移处理技术,包括概念漂移问题的描述、常见的概念漂移处理技术和用于解决概念漂移的决策树算法.接着介绍了增量模型决策树算法,最后对本文介绍的决策树算法进行分析总结.  相似文献   

8.
针对绝大部分多变量决策树只能联合数值型属性,而不能直接为带有分类型属性数据集进行分类的问题,提出一种可联合多种类型属性的多变量决策树算法(CMDT).该算法通过统计各个分类型属性的属性值在各个类别或各个簇中的频率分布,来定义样本集合在分类型属性上的中心,以及样本到中心的距离.然后,使用加权k-means算法划分决策树中的非终端结点.使用这种结点划分方法构建的决策树可用于数值型数据、分类型数据以及混合型数据.实验结果表明,该算法建立的分类模型在各种类型的数据集上均获得比经典决策树算法更好的泛化正确率和更简洁的树结构.  相似文献   

9.
以ID3算法为基础,提出了改进决策树ID3算法的一种新方法,而该方法建立的决策树与ID3建立的决策树在结点属性选择上具有一致性,因而建立的决策树是相同的,但效率是高的.  相似文献   

10.
将数据挖掘中的决策树与粗糙集理论进行了有机结合,提出了一种基于粗糙集技术的决策树构造算法,并将该算法应用于胶合板缺陷检测.通过粗糙集属性约简,找出造成胶合板缺陷的关键因素;再基于约简后的决策表,使用该决策树算法构建决策树,从而提取分类规则,指导决策过程.通过实验验证了,该算法可以有效对胶合板的缺陷进行检测.  相似文献   

11.
决策树分类方法是实现数据挖掘中分类任务的一种有效方法,但在大规模测试数据集上运行时其实现性能受到严重影响.本文设计和实现一种基于MapReduce架构的并行决策树分类算法.实验结果表明:基于MapReduce的决策树分类算法比同类算法在其他并行编程模型下的实现在计算节点较多的情况下能得到更优的性能.  相似文献   

12.
根据淮河某流域连续三年来的水质监测数据,结合用户兴趣度和MID3算法对ID3决策树算法进行改进,并将改进的决策树算法运用于水质评价,建立了淮河某流域水质量评价模型,实现了对水环境质量的评估和决策支持.实验结果表明,改进算法所建立的决策树精确度高、树型结构简单,生成的规则简便、准确,更加符合实际情况,对水环境质量可以作出更为客观、合理的评价,具有一定的实用价值.  相似文献   

13.
增量决策树算法及复杂度分析   总被引:5,自引:1,他引:5  
介绍了增量决策树算法的基本原理,并从实例费用和信息熵费用两个角度出发,对增量决策树算法的复杂度进行分析.通过实例说明,增量决策树算法能够构造出与ID3算法形态基本相同的决策树.  相似文献   

14.
王植  张珏 《河南科学》2023,(1):7-12
为了改进不平衡数据的分类性能,提出一种可自动确定迭代参数trail值的集成C5.0决策树算法.首先,算法引入boosting集成框架到C5.0决策树算法中,从而生成新的集成分类器;其次,算法使用网格搜索法在一定范围内自动确定trail参数的值.实验结果表明,该算法在不平衡数据上的分类性能指标G-mean和MCC上具有优势.  相似文献   

15.
决策树C4.5算法在森林资源二类调查中的应用   总被引:3,自引:0,他引:3  
C4.5算法是基于信息熵理论进行数据分类分析的经典决策树数据挖掘算法.它主要包括数据预处理、决策树生成、决策树修剪、决策树规则提取等步骤.笔者将C4.5算法应用于森林资源二类调查的数据分析中,通过对调查数据挖掘分析表明,数据挖掘在森林资源调查数据分析中具有广泛的应用前景.  相似文献   

16.
基于复合式衡量准则的决策树生成算法   总被引:4,自引:0,他引:4  
分析了多种已有的衡量准则(如信息熵准则、Twoing准则、Gini准则、MaxMinority准则、SumMinority准则),并在此基础上提出了采用复合式衡量准则的决策树生成算法.在一定程度上克服了采用单种衡量准则所带来的算法不稳健性问题,并改善了决策树的结构和分类正确率.  相似文献   

17.
在Ant-Miner算法基础上提出了一种利用蚁群算法解决分类规则挖掘的算法(ACR),设计了合理的蚂蚁选择属性及属性分区的概率公式,并对规则质量的衡量等策略进行改进,可以较好地挖掘分类规则.在标准数据集上通过与Ant-Miner算法和经典的基于决策树的C 4.5算法比较,ACR在挖掘分类规则的简单性、正确率上有较好的表现.  相似文献   

18.
提出了一种基于决策树C4.5的多示例学习算法C4.5-MI,通过拓展C4.5的熵函数和信息增益比来适应多示例学习框架.应用梯度提升方法对C4.5-MI算法进行优化,得到效果更优的GDBT-MI算法.与同类决策树算法在benchmark数据集上进行比较,结果表明,C4.5-MI和GDBT-MI算法具有更好的多示例分类效果.  相似文献   

19.
为提高决策树的适用性,以决策树在入侵检测中的应用为背景提出一种多标准的剪枝方法,使决策树程序能在参数调整后适应不同的应用. 给出了用于描述决策树不同性能的一些参量,如稳定性、复杂度、分类能力等,用户可以根据具体情况对向量各分量的权重进行调整,逐步得到满足要求的决策树. 实验结果表明,该算法能够根据入侵检测系统的具体需要,快速地构建相应的决策树,从而程序可被用于不同情况. 该方法把由程序员决定决策树变成了由用户决定决策树,程序更通用,结果更合理.  相似文献   

20.
为提高滨海区域湿地信息提取的精度,以曹妃甸地区为例,通过融合主成分分析、形状、纹理、几何、水体指数、植被指数等52个特征变量,采用Relief-F算法模型优选出20个特征变量,对比分析C5.0、CART、QUEST决策树算法在滨海区域的分类精度.研究结果表明:特征优选下QUEST决策树方法的分类精度最高,总体分类精度为86.9%,Kappa系数为0.84.基于特征优选的决策树分类精度均高于未特征优选下的决策树与未特征优化的QUEST决策树相比,在草本沼泽和泥沙质滩涂两种土地类型上,分类精度有明显提高.  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号