共查询到19条相似文献,搜索用时 78 毫秒
1.
针对语义情感知识的文本情感分析的局限性,本文提出情感项区分极性可信度的文本情感分类方法.首先,基于核心谓词结构提取修饰主题的情感项.接着,利用改进的互信息方法计算情感项可信度,选取其中可信度前N的情感项.然后,利用改进的词频-逆向文件频率(TF-IDF)算法标记前N个情感项的正或负倾向符号.最后,基于基因表达式编程分类技术和谭松波博士提供的语料集,利用训练集训练分类模型,并使用测试集检验分类精度,实验结果表明本文提出的方法具有良好的效果. 相似文献
2.
3.
根据词条聚合和决策树原理,提出了一种文本分类的新方法.决策树分类方法具有出色的数据分析效率和容易抽取易于理解的分类规则等优势,但只能应用于维数较低的特征空间.本方法将与各个类别相关程度相似的词条聚合为一个特征,有效地降低了向量空间的维数,然后再使用决策树进行分类,从而既保证了分类精度又获得了决策树易于抽取分类规则的优势. 相似文献
4.
本论述采用藏语三级切分体系对藏文文本进行分词和词性标注,并借助手工建立的藏文情感分析用词表,与已有的特征选择方法相结合提取情感特征,用相似度分类算法进行藏文文本的情感分类,达到了较好的分类效果. 相似文献
5.
在文本分类中,数据规模过大或文本分布不均匀对传统KNN算法的准确率和效率具有重要影响。为了解决该问题,文章提出一种基于粗糙KNN(k-nearest neighbor)算法的文本分类新方法。首先引入粗糙集中的上下近似概念定义各类文本的上下近似空间,将文本向量空间分为核心和混合2大区域;然后改进传统KNN算法的隶属度函数;再针对不同的文本区域,采取差异化的分类策略以提高分类的效率和准确率。实验表明,基于粗糙KNN算法的文本分类方法在提高分类准确率的同时,分类的效率也有很大提高。 相似文献
6.
提出一种改进的结合情感词典的主动贝叶斯情感分类方法(SLAB).为了证明提出方法的有效性,选用康奈尔影评数据集和互联网电影资料库(IMDB)数据集作为实验数据,并与基于不确定性采样策略的主动学习方法进行比较.结果表明:文中提出的方法在较少的标注训练集下,能够取得更高的分类准确率,一定程度上解决了基于不确定性采样策略的主动学习方法中的误差累积问题. 相似文献
7.
大数据时代,数据负载使得人们从互联网中获取有效信息的难度越来越大,单维度用户与系统的交互行为已经无法进行精确地推荐,而用户在系统中对物品的评论信息常常能够表达用户的情感倾向和兴趣偏好.利用自然语言处理的ALBERT模型结合BiLSTM神经网络来挖掘用户对物品评论文本中的情感倾向,将用户的情感倾向进行二分类并数值化代入到... 相似文献
8.
一种基于改进互信息的文本分类方法 总被引:1,自引:0,他引:1
用改进的互信息公式进行特征选择,通过三种文本分类方法验证了改进的公式具有较高的准确率、召回率和F1值,从而证明改进的互信息公式的有效性. 相似文献
9.
传统的互信息特征选择方法受边缘概率的影响较大,可能产生稀有词的概率评估分高于常用词的评估分,从而导致倾向于选择低频词条的现象.为此,在分析了几种传统的特征提取方法基础上,通过引入分散度及平均词频两个参数,将互信息方法与特征的词频相关联,从而使互信息的分类更加准确.实验结果表明,该方法使分类效果更好. 相似文献
10.
文本分类中特征选择方法的比较和改进 总被引:1,自引:1,他引:1
考察了文档频率DF、互信息MI、CHI统计、CC统计四种不同的特征选择方法,并结合K近邻算法进行分类精度上的比较.为消除MI对低频词的倚重,提出一种DF与MI结合的特征评价函数,并验证了这种组合特征选择方法的有效性. 相似文献
11.
针对数据挖掘中的文本分类问题,提出了一种基于遗传算法和信息熵的文本分类规则抽取算法Genet-ic-Miner(简称GM),该算法的目标是在数据集中发现分类规则。首先利用信息熵生成初始种群,然后利用优化的遗传算法抽取相应规则。采用六个标准的公共领域的数据集比较了GM与其它两个非常著名的同类算法Ant-Miner和CN2,实验结果表明,无论是预测准确性和规则的简单性,GM都明显优于Ant-Miner和CN2,并且该算法能大大提高对知识的理解力。 相似文献
12.
提出并实现了一种结合BP神经网络和遗传算法的文本分类算法,根据遗传算法能够快速优化网络权重以及摆脱BP算法局部极点困扰的能力,提出一种改进的遗传算法确定网络拓扑结构和训练网络的方法.最后对设计的分类器进行了开放性测试,实验结果表明该分类器显著地提高了文本分类的查全率和查准率. 相似文献
13.
情感文摘旨在提取出文本中具有明显倾向性的情感信息,同时尽可能使得句子与句子之间的衔接连贯通顺.由于极性强度不一样,评论者表达观点的情感强弱就不一样,导致情感信息也不一样.提出了一种新的方法来度量情感文摘中的情感信息量,引入了极性强度概念,并利用点交互信息的原理,综合考虑其与评论者、评价对象、评价短语三者之间的关系.实验结果表明,新方法与未考虑极性强度的方法相比,评价指标ROUGE-2提升了2.21%,ROUGE-SU4提升了2.01%,ROUGE-SU9提升了2.45% 相似文献
14.
杨丽玲 《吉林师范大学学报(自然科学版)》2014,(4):133-135
文中介绍了使用核覆盖算法进行中文文本分类.研究了采取不同的特征选取方法、利用核覆盖算法进行文本分类的区别.通过实验,除互信息外的其它几种特征选取方法在核覆盖算法分类过程中均取得了较优的实验结果,可看出核覆盖算法在文本分类中是一个不错的方法. 相似文献
15.
在统计双语词典的基础上,提出一种特征加强的多语言文本分类方法.在执行文本分类时,考虑到其他语言的训练文本,使得多种语言的文本集合中均存在训练文本,放松了MLTC的要求.特征加强是一种交叉检查过程,即获取两种语言所有特征的卡方统计后,通过语言中相关特征的辨识力,再次对语言的特征辨识力进行评估,以提高分类的可信度.实验选择汉语或英语作为目标语言.实验结果表明:提出的方法具有更高的分类精度,且对训练集规格的敏感度更低. 相似文献
16.
文本特征选择是自然语言处理中的关键问题。针对文本特征的高维性和稀疏性问题,在过滤式特征选择算法文档-逆文档评率(term frequency-inverse document frequency, TF-IDF)的基础上,提出了用遗传算法对文本特征进行优化选择,使其最大程度地贴合后续的文本分类算法,在保证文本分类精确度的同时,降低特征维度以缩减预测时间。实验显示,该算法与单一的过滤式文本特征选择算法相比,能够有效减少所选文本特征数量(即降低特征维度),能有效提高文本的分类能力。 相似文献
17.
针对短文本具有稀疏性强和文本长度较小等特性, 为更好地处理短文本分类问题, 提出一个基于集成神经网络的短文本分类模型. 首先, 使用扩展词向量作为模型的输入, 从而使数值词向量可有效描述短文本中形态、 句法及语义特征; 其次, 利用递归神经网络(RNN)对短文本语义进行建模, 捕获短文本内部结构的依赖关系; 最后, 在训练模型过程中, 利用正则化项选取经验风险和模型复杂度同时最小的模型. 通过对语料库进行短文本分类实验, 验证了所提出模型有较好的分类效果, 且该分类模型可处理变长的短文本输入, 具有良好的鲁棒性. 相似文献
18.
针对BERT模型领域适应能力较差,无法解决训练数据类别数量不均衡和分类难易不均衡等问题,提出一种基于WBBI模型的服务文本分类方法。首先通过TF-IDF算法提取领域语料中的词汇扩展BERT词表,提升了BERT模型的领域适应性;其次,通过建立的BERT-BiLSTM模型实现服务文本分类;最后,针对数据集的类别数量不均衡和分类难易不均衡问题,在传统焦点损失函数的基础上提出了一种可以根据样本不均衡性特点动态调整的变焦损失函数。为了验证WBBI模型的性能,在互联网获取的真实数据集上进行了大量对比试验,实验结果表明:WBBI模型与通用文本分类模型TextCNN、BiLSTM-attention、RCNN、Transformer相比Macro-F1值分别提高了4.29%、6.59%、5.3%和43%;与基于BERT的文本分类模型BERT-CNN、BERT-DPCNN相比,WBBI模型具有更快的收敛速度和更好的分类效果。 相似文献
19.
基于改进分类模型的文本分类系统实现 总被引:1,自引:0,他引:1
吕佳 《重庆师范大学学报(自然科学版)》2009,26(2):79-83
提出一种基于改进的分类模型的文本分类系统来实现文本的自动分类.针对传统的特征提取算法不能很好区分特征词在类内和类间分布情况的缺陷,该系统利用方差对该算法作了改进,用改进的特征提取算法量化各个特征词的权重,为了降低特征向量的维数,采用为每个类建分类器的分类模型,利用遗传算法来修正各个类特征词的权重,直到为每个类训练出能够代表本类的特征向量,最后用这些类的特征向量进行分类.通过在同一数据集上进行对比实验,说明本文提出的改进分类模型的文本分类系统是正确可行的. 相似文献