首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到20条相似文献,搜索用时 46 毫秒
1.
借鉴邻域粗糙集处理连续型数据的优势,为解决传统谱聚类算法需要人工选取参数的问题,提出基于自适应邻域互信息与谱聚类的特征选择算法。首先,定义各对象在属性下的标准差集合与自适应邻域集,给出自适应邻域熵、平均邻域熵、联合熵、邻域条件熵、邻域互信息等不确定性度量,利用自适应邻域互信息对特征与标签的相关性进行排序。然后,结合共享近邻自适应谱聚类算法,将相关性强的特征聚到同一特征簇内,使不同特征簇内的特征强相异。最后,使用最小冗余最大相关技术设计特征选择算法。在10个数据集上选择特征个数与分类精度的实验结果,验证了所提算法的有效性。  相似文献   

2.
针对目前基于粗糙集模型的特征选择算法无法直接应用于数值型数据、必须经过离散化过程而造成决策信息丢失的问题,提出了一种基于邻域决策分辨率的特征选择算法。该算法根据邻域信息粒中决策分布与其分类能力间的关系,提出了邻域决策确定性(Nc)来衡量单个信息粒的决策分辨能力;并根据特征向量空间上所有信息粒所具有的Nc累加值,定义了邻域决策分辨率作为特征子集上决策可分辨性的量度,从而将名义型和数值型数据统一在同一特征选择算法框架下。仿真实验和实际应用的结果表明,该算法性能优于目前主流基于邻域粗糙集的特征选择方法。  相似文献   

3.
LDA主题模型是一种有效的文本语义信息提取工具,利用在文档层中实现词项的共现,将词项矩阵转化为主题矩阵,得到主题特征;然而在生成文档过程中会蕴含冗余主题。针对LDA主题模型提取主题特征时存在冗余的不足,提出一种基于邻域粗糙集的LDA主题模型约简算法NRS-LDA。利用邻域粗糙集构造主题决策系统,通过预先设定主题个数,计算出每个主题的重要度;根据重要度进行排序,将排序后重要度低的主题删除。将提出的NRS-LDA算法应用于K-means文本聚类问题上并与传统的文本特征提取算法及改进的算法进行比较,结果表明NRS-LDA方法可以得到更高的聚类精度。  相似文献   

4.
针对滚动轴承早期微弱故障识别率偏低的问题,提出一种基于EEMD、邻域粗糙集和模糊C均值聚类(FCM)算法相结合的滚动轴承特征提取方法.该方法将滚动轴承的原始信号进行EEMD分解得到若干个IMF分量,通过均方差和欧氏距离两个评价指标选取出敏感特征分量,构造原始特征数据集,对处理后的原始特征集属性进行NRS约简,剔除冗余属信息,最后将剩余属性的特征数据集作为模糊C均值聚类的输入,实现滚动轴承故障识别.为了对比本文方法对于滚动轴承的故障识别效果,分别添加了FCM、NRS-FCM和EEMD-FCM三种方法进行故障辨识,利用划分系数(PC)和划分熵(CE)对聚类结果进行评价与对比.通过实验表明:邻域粗糙集对于改进滚动轴承的故障识别效果十分明显,具有良好的应用前景.  相似文献   

5.
针对目前远程教育中个性化教学水平较低的问题,提出了一种基于粗糙集的Web学习者聚类算法,并应用粗糙集的约简方法解决了学习者特征数据中的属性冗余问题,提高了聚类算法的效率,从而提高了远程教学网站的个性化教学水平.  相似文献   

6.
为了提高模糊粗糙集特征选择算法的计算效率,在每次迭代过程中通过不断缩减样本和特征的搜索范围,提出了一种新的模糊粗糙集特征选择算法.为了减少样本的搜索范围,利用样本对决策类下近似隶属度的单调性,构建样本的筛选机制,用以筛除当前所选特征子集已保持决策类下近似隶属度的样本;为了缩减特征的搜索范围,采用特征冗余性概念,构建特征搜索机制,用以移除已被确定为冗余的特征;通过融合样本筛选机制和特征搜索准则,设计模糊粗糙集特征选择的高效算法.数值实验表明,所提算法具有高效性和有效性.  相似文献   

7.
传统的肿瘤基因选择算法挑选出的特征基因中存在大量噪声基因和冗余基因,从而对基因算法的准确性和分类精度产生影响.针对这一问题,将K-S检验与邻域粗糙集融合成为一种新的特征选择方法.首先,采用累积分布函数计算正负类样本的累积函数值和K-S检验统计量,对照显著性水平下的样本统计量,从而去除冗余基因和噪声基因;然后,使用邻域粗糙集进行约简,对比条件属性重要度得出最优约简结果;最后,对比K-S检验和两种基于K-S检验的特征选择方法得到的冗余度和分类精度,通过实验验证这种方法不仅能准确挑选出具有显著区分能力的肿瘤基因,且效率高具有可行性.  相似文献   

8.
为了更好地预处理未标记数据,大多数基于图正则的无监督特征选择算法通过构造样本的相似性矩阵来删除冗余信息并选择具有代表性的特征子集。这些方法中的大多数图都是用固定数量的近邻数来初始化,忽略了数据分布不均匀的问题。为了解决这个问题,提出了一种基于自适应邻域和自表示正则的无监督特征选择算法(Adaptive neighborhood regularized self-representation, ANRSR)来选择具有代表性和判别性的特征子集。为了保留局部内在结构,该算法将基于自适应邻域的流形正则化运用到自表示模型中,并利用了一种迭代方法来解决此优化问题。最后,选取4种经典的无监督特征选择算法,在几个基准数据集上进行了对比实验,验证所提算法能够选出具有更高聚类精度和互信息的判别性特征子集。  相似文献   

9.
介绍了粗糙集理论实现数据分类和规则推理的基本原理,并利用粗糙集理论中核及决策类覆盖的概念,提出了一个在数据集中发现没有冗余属性的最小归纳依赖关系,并简化带有不相容规则的决策系统的多层次数据挖掘算法,应用一实际的例子说明如何在数据库中发现分类规则.  相似文献   

10.
针对旋转机械故障诊断知识获取困难的问题,将邻域粗糙集和Fisher(费舍)判别法相结合,对从故障数据库中提取决策规则的方法进行了研究.首先基于邻域粗糙集理论对转子故障的时域特征属性集进行属性约简,据此达到消除冗余属性的目的,然后再依据费舍判别法对故障数据集进行故障模式识别.通过处理转子实验台数据来对该方法进行的验证以及与传统方法进行的对比情况表明:本方法在节省数据存储空间的同时还具有能够获得较准确的故障分类决策规则能力.  相似文献   

11.
数据特征空间的高维性使得学习过程耗费了相对较多的时间,而且可能影响分类性能.邻域粗糙集模型可以用来解决特征选择问题,但该模型未能描述现实存在的样本的模糊性,可能导致信息的丢失.因此,建立了一种新的单标记特征选择模型,采用两种不同的隶属度计算方法获得样本对等价类的模糊隶属度,将每个等价类中最小隶属度值作为隶属度阈值.然后利用邻域样本隶属度与阈值的关系重新定义邻域粗糙上、下近似,进而通过衡量决策属性对特征子集依赖度的大小进行特征选择.在七个公开的UCI数据集上进行了实验,实验结果表明,与已有的几种特征选择方法相对比,分类准确度得到了进一步提高,选择的特征数目明显减少.  相似文献   

12.
在开放动态环境中,在线流特征选择是降低特征空间维度的有效方法 .现有的在线流特征选择算法能够有效地选择一个较优的特征子集,然而,这些算法忽略了类别中可能存在的层次结构.基于此,提出基于层次类别邻域粗糙集的在线流特征选择算法:首先,在邻域粗糙集中引入层次最近异类的邻域关系,避免邻域粒度的选择,借助层次结构计算特征对标记的层次依赖度,推广邻域粗糙集模型以适应层次类别数据;其次,基于层次依赖度提出三个在线特征评价函数,设计了在线相关选择、在线重要度计算和在线冗余更新的层次特征选择框架;最后,在六个层次类别数据集和八个扁平单标记数据集上的实验表明,提出的算法优于现有最先进的在线流特征选择算法.  相似文献   

13.
对于数值型数据而言,邻域粗糙集模型是处理不确定信息的有效工具.现有的邻域粗糙集模型仅关注那些邻域中所有样本都属于同一个决策类的一致性情形,无法利用邻域中与多个决策类相交的边界样本所蕴含的信息.针对邻域粗糙集的这一局限性,将相容关系的极大相容块与邻域粗糙集相结合,选取样本邻域内的最大等价块作为最小的信息粒,通过重新定义邻域粗糙集的上下近似和属性重要度等概念,建立了一种基于极大相容块的邻域粗糙集模型.该模型可在更小的信息粒度下将原来边界样本转化成一致性样本来增大正域.运用前向贪婪策略构建了相应的属性约简算法.在七个公开的UCI数据集上的对比实验验证了提出模型的有效性.  相似文献   

14.
为改进数据分类的效果,基于粗糙集理论实现数据分类和规则推理的基本原理,利用粗糙集理论中核及决策类覆盖的思想,提出了一个在数据集中发现没有冗余属性的最小归纳依赖关系,简化带有不相容规则的决策系统的数据挖掘算法。通过PL/SQL演示了挖掘分类规则的过程,结果表明基于粗糙集分类算法的有效性。  相似文献   

15.
李恒宾 《科学技术与工程》2012,12(21):5149-5153,5162
提出了一种模糊聚类、粗糙集理论与神经网络集成的混合智能故障诊断方法。引入聚类有效性函数和点分布密度函数。对模糊c-均值聚类算法进行改进,形成了自适应模糊聚类算法并依据该算法将连续的故障特征值离散化。应用粗糙集理论处理离散化的故障诊断数据。采用基于信息熵的方法,约简冗余的故障特征。依据约简结果构建神经网络,采用遗传算法优化网络的权值和阈值。将该方法用于柴油机气门故障诊断,并与普通神经网络进行对比。结果表明,该方法提高了故障诊断的正确率。  相似文献   

16.
人脸表情特征选择是人脸表情识别研究领域关注的一个热点。基于量子遗传算法与邻域粗糙集理论,文章提出一种新的人脸表情特征选择方法(Feature Selection based on Neighborhood Rough Set Theoryand Quantum Genetic Algorithm,简称FSNRSTQGA),以邻域粗糙集理论为基础,定义了最优特征集的适应度函数来评价表情特征子集的选择效果;并结合量子遗传算法进化策略,提出了一种表情特征选择方法。Cohn-Kanade表情数据集上的仿真实验结果表明了该方法的有效性。  相似文献   

17.
借鉴基于正则回归的无监督并行正交基聚类特征选择法和最大互信息系数,提出正交基低冗余无监督特征选择法.该方法在正交基下选择具有判别能力的特征,可用最大互信息系数矩阵选择低冗余性的特征子集. 4个图像数据集上的实验结果表明:该方法选择的特征子集可以提高聚类准确率.  相似文献   

18.
利用邻域粗糙集处理数值型数据,可以解决经典粗糙集不能直接处理数值型数据的问题,改进后的变精度邻域粗糙集可以增强抗噪声的能力。但变精度邻域粗糙集的属性约简有不同于邻域粗糙集的特性,需要考虑每个决策类的下近似分布。文中提出可以遵循平均错误率来约简属性,减少计算规模。实验证明,使用UCI数据集与其它算法进行了比较,该算法可以获得理想的结果。  相似文献   

19.
采用标志气体分析法对煤自燃火灾预报时存在特征维数较高、特征之间存在冗余及人为划分温度段的不合理性等问题,文中提出基于粗糙集和聚类的采空区煤自燃火灾预报方法。即使用粗糙集对原始样本去除冗余和特征维数约简,再用聚类方法对约简后的特征进行聚类得到各温度段的特征中心,并使用模式识别的方法,确定出煤自燃标志气体特征其与温度段特征中心的相似性,从而实现采空区遗煤自燃状态的识别和早期预报。  相似文献   

20.
特征选择是一项重要的数据预处理技术,其目的是在不降低数据分类精度情形下选择一个特征子集,从而对原数据集达到降维的效果,同时也提高学习算法的性能.在邻域粗糙集模型中,传统方法构造出的对象邻域粒未考虑数据的分布问题,使得邻域粒存在一定的误差.首先通过方差来刻画数据的分布,然后根据数据分布提出一种改进的邻域粒,这种改进的邻域粒能够自适应数据的分布,有着较好的优越性,最后将改进邻域粒与邻域模糊熵结合,提出一种特征重要度的评估方式,并给出对应的特征选择算法.实验结果表明,新提出的特征选择算法在特征选择结果、时间消耗和特征子集的分类精度方面都更具一定的优越性.  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号