首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到18条相似文献,搜索用时 156 毫秒
1.
文章用GOOGLE开源的Word2Vec工具把藏文文本《贤者喜宴》经过分词后的语料作为输入,将文本中的词映射到一个K维空间,利用词汇的上下文信息将词转变为词向量.Word2Vec工具再通过学习得到一个向量模型,每一个词都用一个独特的词向量来表示.训练文本数据构造一个词表,然后学习词的向量表示.词向量能够捕获许多语言的规律,从而得出词与词之间的距离即相似度.进一步通过高频词汇作为输入,通过训练即可输出与高频词汇距离最近的词汇,以高频词和与其相近的词汇作为重要信息去预测文本的大致语义.实验结果表明基于Word2Vec训练模型的准确率和召回率都很高.  相似文献   

2.
通过对目前自然语言处理领域中基于深度学习的词向量表示方法对不同文本语料文本表达的有效性进行分析,将主流词向量训练方法用于不同的文本语料集,包括英文维基百科语料、新闻语料、论坛语料和Web语料进行训练,并采用三种评价指标:余弦相似度平均差、斯皮尔曼等级相关和米克罗夫类比方法对训练出的文本词向量表达方法进行比较.实验结果表明,针对上述四种语料,词向量能够实现对文本的有效表示,但各个语料训练出的词向量的通用性不同,其中维基百科语料训练的词向量的通用效果最好.  相似文献   

3.
基于词向量空间模型的中文文本分类方法   总被引:4,自引:0,他引:4  
大多文本分类方法是基于向量空间模型的,基于这一模型的文本向量维数较高,导致分类器效率难以提高。针对这一不足,该文提出基于词向量空间模型的文本分类方法。其主要思想是把文本的特征词表示成空间向量,通过训练得到词-类别支持度矩阵,根据待分文本的词和词-类别支持度矩阵计算文本与类别的相似度。实验证明,这一分类方法取得了较高的分类精度和分类效率。  相似文献   

4.
针对传统法条推荐方法知识利用不足的问题,结合预训练BERT模型,提出了一种基于司法领域法律条文知识驱动的法条推荐方法。首先基于BERT预训练模型对法条知识和案件描述分别进行表征,并基于双向LSTM对案件描述文本进行特征提取,然后基于注意力机制提取融合法条知识的案件描述文本特征,最终实现法条智能推荐。该方法在法研杯公共数据集上,法条推荐F1值达到0.88,结果表明,融合法条知识的BERT模型对法条推荐具有显著提升作用,并且可以有效地解决易混淆法条推荐问题。  相似文献   

5.
主流句子分类算法采用单一词向量表示模型获得文本表示,导致了对文本的映射能力不足.对此,通过融合多种词向量的文本表示以提高分类的准确率.针对多核学习在融合不同核函数时,常规的核函数系数寻优方法存在的训练时间长、难以求得局部最优解等问题,提出了一种新的核函数系数寻优方法,该方法基于参数空间分割与广度优先搜索不断逼近核系数的最优值.以支持向量机(support vector machine,SVM)为分类器,在7个文本数据集上进行了分类实验.实验结果表明,多核学习分类效果明显优于单核学习,并且所提出的寻优方法在训练次数少于常规方法时也能获得了好的分类效果.  相似文献   

6.
在基于深度学习的文本情感分类研究领域中,目前传统的模型主要是序列结构,即采用单一的预训练词向量来表示文本从而作为神经网络的输入,然而使用某一种预训练的词向量会存在未登录词和词语语义学习不充分的问题。针对此问题,提出基于并行双向门控循环单元(gated recurrent unit,GRU)网络与自注意力机制的文本情感分类模型,利用两种词向量对文本进行表示并作为并行双向GRU网络的输入,通过上下两个通道分别对文本进行上下文信息的捕捉,得到表征向量,再依靠自注意力机制学习词语权重并加权,最后对两个通道的输出向量进行向量融合,作为输入进入全连接层判别情感倾向。将本文模型与多个传统模型在两个公共数据集上进行实验验证,结果表明本文模型在查准率、查全率、F1值和准确率等性能指标上相比于双向门控循环单元网络模型、双向长短时记忆网络模型和双向门控循环单元网络与自注意力机制的单通道网络模型均有所提升。  相似文献   

7.
单词向量化是自然语言处理领域中的重要研究课题之一,其核心是对文本中的单词建模,用一个较低维的向量来表征每个单词.生成词向量的方式有很多,目前性能最佳的是基于神经网络语言模型生成的分布式词向量,Google公司在2012年推出的Word2vec开源工具就是其中之一.分布式词向量已被应用于聚类、命名实体识别、词性分析等自然语言处理任务中,它的性能依赖于神经网络语言模型本身的性能,并与语言模型处理的具体任务有关.本文从三个方面介绍基于神经网络的分布式词向量,包括:经典神经网络语言模型的构建方法;对语言模型中存在的多分类问题的优化方法;如何利用辅助结构训练词向量.  相似文献   

8.
针对医疗信息系统中传统科室推理方法存在的计算效率低下、推荐效果欠佳与知识库难于维护等问题,提出了基于词向量句子相似度量的医疗科室推荐方法.该方法采用深度学习工具构建医疗知识库词向量模型,以词向量代替语义词典检索或词频统计来实现医疗问答对的相似度量,建立基于句子相似度量的医疗科室推荐框架.通过专业医疗在线问医平台真实问答数据的实验,结果表明,与传统科室推理方法相比较,该方法具有更高的推荐准确率与工程可行性.  相似文献   

9.
针对维吾尔语命名实体识别存在无法关注词序列依赖关系等问题,提出一种基于迁移学习的联合深度模型(TBIBC).首先通过BERT(Bidirectional Encoder Representations from Transformers)预训练中文数据集生成具有语义信息的词向量,再将词向量序列通过空洞卷积神经网络(IDCNN)进行膨胀操作以减少神经元层数和参数,输出向量输入到双向门控循环单元(BiGRU)进行上下文语义信息提取,然后通过CRF层得到最优标签序列.模型采用共享深度神经网络隐藏层的方法将训练好的中文实体识别模型迁移到维吾尔语模型上.结果表明,该模型的准确率为91.39%,召回率为90.11%,F1值达到90.75%,能显著提升维吾尔语命名实体识别性能.  相似文献   

10.
基于正交投影的BiLSTM-CNN的情感特征抽取方法旨在从文本中获取带权重的中性词向量,得到具有更高区分度的情感特征,为文本情感分类提供有力的技术支持.传统的深度学习模型会忽略关键局部上下文信息中的特殊意义词,导致获取的情感特征不够丰富.针对这一问题,本文提出一种基于正交投影的BiLSTM-CNN情感特征抽取方法.首先,将中性词向量投影到情感极性词的正交空间中,得到加权中性词向量,同时通过CNN深度学习模型抽取文本关键语义;然后,利用BiLSTM-Attention模型和带权重的中性词向量,从提取出的关键语义中学习可增强句子情感的语义特征,使文本在情感分类时更具判别性.实验结果表明本文所提出的情感特征抽取方法可以获取更完整的情感特征,从而显著提高文本情感分类的准确率.  相似文献   

11.
中国区际法律冲突既表现为不同法系的不同法域的法律之间的冲突,也表现为不同社会制度下不同法域之间的法律冲突和相同社会制度下不同法域之间的法律冲突,还表现为它是在国内没有统一的最高司法机关加以协调的法律冲突,并且各法域之间的法律冲突内容复杂,既有一般法律适用上的冲突,也有国际条约适用上的冲突。解决中国区际法律冲突的途径主要有区际冲突法途径、统一实体法途径以及统一实体法途径与区际冲突法途径相结合的途径。  相似文献   

12.
案件罪名预测任务是基于文本数据去预测案件所属罪名.针对现有方法在相似罪名和长尾数据集上表现不佳的问题,提出了一种基于图注意力网络的案件罪名预测方法CP-GAT(charge prediction based on graph attention network).该方法首先使用司法文书数据集中的案例事件描述文本和案例对应的法条信息建立异质图结构数据,构建后的异质图包含两种类型的节点(词节点、案例节点),两种类型的边(词节点与词节点相连的边,词节点与案例节点相连的边).在基于法律文本构建后的异质图上使用图注意力网络进行图特征提取,最后将得到的特征向量输入到罪名预测的分类器中,得到案例所属的罪名.在CAIL2018法律数据集上的实验结果表明,基于图注意力网络的罪名预测方法优于对比实验使用的方法,准确率和宏观F1值分别达到了95.2%和66.1,验证了提出的方法有利于提升案件罪名预测任务的性能.  相似文献   

13.
为进一步提高文本相似度计算的准确性,提出基于句向量的文本相似函数(part of speech and order smooth inverse frequency, PO-SIF),从词性和词序方面优化了平滑反频率(smooth inverse frequency, SIF)计算方法,SIF算法的核心是通过加权和去除噪声得到句向量来计算句子相似度。在具体计算时,一方面通过增加词性消减因子调节SIF句向量计算权重参数,获得带有词性信息的句向量,另一方面通过将词序相似度与SIF句向量相似度算法进行线性加权优化句子相似度得分。实验结果表明,增加词性和词序的方法可以提升算法准确率。  相似文献   

14.
商标侵权赔偿数额的认定一直是商标侵权案件司法审判中的难点和争议点。对商标侵权诉讼司法实践案例的实证研究发现,审判实践中存在适用法定赔偿的案件比率过高、在侵权数额认定方面缺乏法定赔偿计算方法、赔偿范围过窄、权利人举证困难等问题。建议通过建立法定赔偿的量化标准体系,适用比例原则,加强行政执法与司法保护衔接,减轻权利人举证责任负担,扩大商标侵权的赔偿范围等策略,完善商标侵权赔偿数额认定制度。  相似文献   

15.
民生是法治建设的价值目标,法治为民生提供切实保障,民生保障法治化是构建和谐社会的必然要求。我国民生法治建设取得了较大成就,但由于立法供给的不足、执法的失范、司法救助渠道的阻滞,民生保障法治化的发展仍遭遇重重困境。加强法治建设、夯实民生保障的法治根基,是保障民生的基础工程。完善民生保障法治系统要求健全立法、严格执法和公正司法。  相似文献   

16.
针对现有的中文文本情感分析方法不能从句法结构、上下文信息和局部语义特征等方面综合考量文本语义信息的问题,提出一种基于特征融合的中文文本情感分析方法.首先,采用Jieba分词工具对评论文本进行分词和词性标注,并采用词向量训练工具GloVe获取融入词性的预训练词向量;然后,将词向量分别作为引入Self-Attention的BiGRU和TextCNN的输入,使用引入Self-Attention的BiGRU从文本的句法结构和文本的上下文信息两个方面综合提取全局特征,使用TextCNN提取文本的局部语义特征;最后,将全局特征和局部语义特征进行融合,并使用Softmax进行文本情感分类.实验结果表明,本文方法可以有效提高文本情感分析的准确率.  相似文献   

17.
论农民法律意识的现代化   总被引:2,自引:0,他引:2  
农村法治建设是我国依法治国的一个重要方面 ,但受传统法律观念、立法及司法机构的设置、执法与司法运行状况的影响和制约 ,我国农民的法律意识落后 ,突出表现在以情代法 ,权力至上 ,族规家法神圣等观念根植于农民的思想中 ,在社会生活中发生纠纷时厌诉避诉。要培养农民的现代法律意识 ,应从完善农业和农村方面的立法 ,加强农村的执法和司法 ,协调习惯法与国家法之间的关系 ,深入普法等方面入手  相似文献   

18.
民法法源中的非制定法法源是指虽未经国家有关机关制定,但经国家认可和保障的调整人与人之间关系的行为准则,如习惯、判例、学说等。对民法的形式渊源中的几类非制定法法源进行了详细的论述.通过结合司法实践论证其法源性地位,旨在促进我国民法法源的开放化、多元化,为司法审判提供更充分的依据,最终更好地解决民事纠纷,维护社会秩序的稳定。  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号