首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到17条相似文献,搜索用时 46 毫秒
1.
决策树分类ID3算法研究   总被引:1,自引:0,他引:1  
张桂杰  王帅 《松辽学刊》2008,29(3):135-137
分类是数据挖掘的重要内容之一,在许多领域得到广泛应用,现已有多种分类方法,其中决策树分类法在海量数据环境中应用最为广泛,本文分析了决策树分类ID3算法的原理,给出构造决策树的基本算法,指出ID3算法构造决策树的优缺点,针对ID3算法倾向于取值较多的测试属性的缺点,引入一个参数来约束属性选择,给出一种优化算法.  相似文献   

2.
以齐齐哈尔市辖区为研究区域,利用分类回归树(Classification and Regression Tree,CART)算法从训练样本数据集中挖掘分类规则,集成遥感影像的光谱特征、纹理特征和地学辅助数据建立研究区的决策树模型.用实测的GPS样本点对分类结果进行精度验证,并与最大似然监督分类方法(Maximum Likelihood Classification,MLC)进行对比.结果表明,基于CART的决策树分类结果的总精度和Kappa系数分别为82.24%和0.77,分类精度较MLC监督分类方法有明显提高,有较好的分类效果.  相似文献   

3.
文中介绍了使用核覆盖算法进行中文文本分类.研究了采取不同的特征选取方法、利用核覆盖算法进行文本分类的区别.通过实验,除互信息外的其它几种特征选取方法在核覆盖算法分类过程中均取得了较优的实验结果,可看出核覆盖算法在文本分类中是一个不错的方法.  相似文献   

4.
基于支持向量机的文本分类技术研究   总被引:2,自引:2,他引:0  
介绍了文本分类的基本过程,讨论了常用的文本分类方法如K-最近邻分类算法K-NN(K-Nearest Neighbors,K-NN)、朴素贝叶斯分类算法NB(Naive Bayesian Classifier,NB)、决策树分类算法DT(Decision Trees,DT),并探讨了基于支撑向量机SVM(Support Vector Machines,SVM)的文本分类基本原理及方法.  相似文献   

5.
文本自动分类技术是随着网络信息化而发展起来的。它的作用是将各地海量的电子资源通过网络联系在一起,实现资源共享。本文通过对自动分类技术的类型及基本概念的概述,提出了自动分类中两种重要的算法技术。  相似文献   

6.
网络智能文本分类系统的研究与实现   总被引:2,自引:0,他引:2  
介绍了文本自动分类的基本原理及相关的算法 ,提出了一种基于网络的智能文本分类系统的基本框架 ,并详细地阐述了实现它的关键技术  相似文献   

7.
随着PACS系统在我国各医院的普及,PACS数据库中存储了大量的医学图像信息,如何把这些图像进行分类来提供相似病例图片,从而为临床诊断提供辅助帮助已成为研究热点.关于医学图像的分类,已有很多学者从不同方面用不同方法进行了研究.本文使用贝叶斯决策树的方法对PACS数据库进行教据挖掘,实现医学图片的分类.贝叶斯决策树不仅能够提高分类的准确率,而且能够处理不一致,不完整数据等"脏数据",本文充分发挥了贝叶斯方法和决策树方法的优点,通过对肺癌图片进行良性、恶性分类,证明了本方法的有效性.  相似文献   

8.
一种文本分类数据挖掘的技术   总被引:7,自引:0,他引:7  
挖掘的理论和应用研究是数据挖掘领域一个新的重要分支,介绍了一种文本数据挖掘方法. 首先,论述了文本挖掘的意义和重要性,探讨了文本挖掘的定义和文本分类的一些形式,然后讨论了一个以数据预处理、特征提取、特征表示和特征匹配等文本分类的一些关键理论问题,并给出了一个基于该方法的文本分类系统的实验结果,实验结果表明了该方法的可行性.  相似文献   

9.
KNN算法是一种应用广泛的人工智能算法,在文本分类应用中,简单有效,易于实现.但是,KNN分类的时间复杂度与训练样本数量成正比,而且,训练样本分布密度的不均匀性将导致分类准确性的下降.本文在KNN算法的基础上,提出一种改进算法.算法分析了训练样本的分布密度,通过裁减高密度区域训练样本,降低样本数量,调节训练样本分布,达到提高分类准确性的目的.实验证明,基于密度的改进KNN文本分类算法在降低时间复杂度的同时,还具有较好的准确率和召回率.  相似文献   

10.
Web文本分类是Web数据挖掘的一个重要研究方向,它是在通过经验数据训练得到的分类体系下,根据网页的文本内容自动判别网页类别的过程,本文提出一种综合粗糙集与支持向量机的Web文本分类模型,利用粗糙集的属性约简方法,减少支持向量机训练数据的维数,提高Web文本分类的性能与效率.  相似文献   

11.
采用数据挖掘技术中的决策树方法,进行收视数据分析.收集大量的调查问卷作为待挖掘的样本,利用决策树经典算法C4.5,对样本集中的样本进行 学习,构造出一棵决策树.对决策树进行分析,得出电视收视分析相关的知识和规律,作为节目编制等的决策依据.  相似文献   

12.
基于文本表示的特征项权值确定方法研究   总被引:4,自引:2,他引:4  
文本表示中特征项的权值确定方法决定了文本特征的提取,在很大程度上影响了文本分类的准确率,通过系统总结常用的几种特征项权值的确定方法,并逐一比较分析和研究,提出了一种性能较好的确定方法——据位定权函数,经实验验证据位定权函数确实能够有效地提高文本分类的准确性。  相似文献   

13.
针对统计方法不能从语义理解的角度进行文本分类的问题,提出了利用概念层次网络概念知识进行文本分类的方法,包括两部分:依据概念进行特征选取以及根据类别关联度分类. 在特征选取时,通过计算概念与类别的区分度挖掘出类别核心概念,并采用类别核心概念对特征项进行精选. 依据类别核心概念相关的类别语义信息,提出了文档与类别关联度的计算方法,并根据类别关联度来判断文本类别. 实验表明,该方法可有效降低特征空间维数,在提高分类效率的同时保证了分类效果,F1值略有提高. 与SVM、KNN和Bayes分类器对比,当特征项数目较少时,该方法的F1值明显高于其他3种方法,综合分类效果与SVM相当,优于KNN和Bayes.  相似文献   

14.
商品销售管理是企业经营管理中的一个重要环节,通过建立商品促销决策的数据挖掘模型,企业可以获取有助于销售决策的大量有价值的信息,从而获得竞争优势.该文采用决策支持模型来发掘不同客户群的商品购买需求.首先对收集的历史数据进行预处理,然后采用似然比计算预测字段和目标字段的相关性,对属性进行约简,最后使用CHAID算法构建决策模型.实验结果表明,约简模型的性能降低很小,但是大大提高了运行效率和分析效率,降低了过度拟合模型的风险,具有很好的实用价值.  相似文献   

15.
随着我国现代科技的快速发展,文本分类逐渐在信息化技术与数字化技术领域得到重视。利用计算处理系统处理文本信息,能够有效提升文本分类的质量与效率,提升数据信息的利用率,从而促进信息化技术的普及。而支持向量机是处理文本内容,加强文本分类速度,并通过文档建模、中文分词、分类器评估等形式,构建出的行之有效的统计语言模型,它可以推动文本分类工作的发展。本文结合国内外研究现状,探析文本分类内涵及支持向量机原理,提出基于支持向量机的文本分类算法。  相似文献   

16.
文本分类中基于核的非线性判别   总被引:3,自引:0,他引:3  
针对文本分类问题中的特征降维问题,改进最大散度差鉴别准则,引入核变换作为前处理,使最大散度差鉴别准则可适用于更广泛的文本分类情形. 提出一种基于核的非线性鉴别方法用于文本特征抽取. 借助于核变换解决了散度差准则在用于文本分类时线性可分性较差的问题. 在最低限度减少信息损失的前提下实现了特征维数的大幅度减缩. 文本分类试验结果表明,这种非线性方法与无核的最大散度差方法相比,F1值提高了4.7%, 具有明显的效率上的优势.  相似文献   

17.
设计了一种基于VSM模型的动态文本分类器,它能针对文本的不同类别建立不同的特征子空间,各特征子空间之间相互独立,同时能将文本分类中常用的2个评估指标召回率和精确率转化为正确分类率和错分率;考察了特征子空间的维数和判定界值对这2个指标的影响.该动态文本分类器能对用户输入的文本流进行动态分类.  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号