排序方式: 共有18条查询结果,搜索用时 31 毫秒
1.
中医古文献蕴藏着丰富的临床经验,是古代中医在行医过程中对临床诊疗的经验性总结,体现了中医学形成和发展的理论框架和思想基础.然而这些宝贵的临床经验不仅量大,而且分散在不同的文献中,使得中医从业者手工很难快速全面地获取它们,文献检索工具也只能提供文档级别的信息筛选,无法为这种细粒度的信息获取提供支持.此外,古汉语相对于现代汉语的不同特点也限制了主流文本分析工具的使用效果.为此本文提出面向临床经验获取的中医古文献信息抽取任务,用于识别古文献中描述临床经验的文本片段,手工标注了样本数据用于这种抽取模型的训练和测试,并设计了基于深度学习的序列标注器用于完成该任务.考虑到标注数据量小可能带来的过度拟合问题,本文引入对抗训练和虚拟对抗训练来增强模型的泛化能力.一系列充分的实验验证了模型的有效性,表明利用信息抽取技术从古文献获取中医临床经验具有可行性,为这一新的信息抽取任务提供了有希望的研究基线和可复用的标注数据集. 相似文献
2.
中文姓名识别是信息抽取的一个重要研究内容,同时也对自然语言处理的其他应用具有重要意义.本文针对中文姓名构成的一般规律和特点,提出了一种姓氏用字驱动的统计与规则相结合的混合中文姓名识别算法,该算法以姓氏用字为线索,通过对前后文中汉字串成词的可能性的评价来进行姓名识别.对所提出的算法用144 K文本进行了实验测试,验证了它的有效性. 相似文献
3.
本文利用来自NASA的CCMP风场资料、来自ECMWF(欧洲中期天气预报中心)的ERA-40海浪资料、来自NOAA的SST资料,对南海-印度洋海域的风、浪、海温等海洋水文要素的季节特征进行了深入统计分析,为防灾减灾、海洋水文保障等提供参考。研究发现:(1)该海域海表风速的最强区域是南印度洋西风带,年平均风速在8-11m/s,北印度洋存在三个大值区:索马里附近海域、孟加拉湾、南海,海浪场分布特征与风场分布特征一致。(2)南印度洋6级以上大风出现频率整体高于北印度洋;北印度洋存在3个6级以上大风的相对高频海域:索马里附近海域、孟加拉湾、南海。2.5m以上波高出现的频率与6级以上大风出现频率的分布特征大体一致。(3)该海域的SST表现出较大的季节性差异。 相似文献
4.
抽取式阅读理解是自然语言处理的重要任务,需要机器在阅读理解自然语言文本的基础上,从中抽取给定问题的答案(输入文本中的片段),并在问题不可回答时拒绝回答.这种不可回答情况的存在使机器阅读理解更具有挑战性,特别是在输入文本含有似是而非文本片段时,现有模型很容易将这样的片段混淆为问题答案,进而错误判断问题的可回答性.为了进一步提高抽取式机器阅读理解模型的效果,本文将SQuAD 2.0数据集中的似是而非答案看成对抗样本,将其既作为答案文本片段抽取的正例,也作为问题可回答性的负例,在现有模型答案交叉熵损失的基础上增加排序损失.在SQuAD 2.0上进行的实验表明,本文方法可以提高现有模型的阅读理解能力,明显提升可回答性判断及答案文本片段抽取的效果. 相似文献
5.
基于延迟决策和斜率的新词识别方法 总被引:1,自引:0,他引:1
采用词典分词时会遇到未登录词的识别问题.本文提出一种新的中文新词识别方法,用于全文信息检索系统索引的建立.在索引切分过程中遇到无法切分字串时,暂存为未切分串,并生成统计信息.待未切分串达到一定数量时,再利用生成的统计信息结合斜率(加速度)的方法来切分暂存的未切分串.切分的结果可以进入索引,对于出现频率高的切分片段可以提取加入词典. 相似文献
6.
领域词典作为中文信息处理的基础,在各个领域都有着重要的应用.而人工构建领域词典不仅工作量大,而且缺乏时效性.因此,自动构建领域词典成为目前研究的重点,而构建领域词典的关键是从领域语料中自动抽取领域术语.本文以金融领域作为切入点,提出了根据登录词前后邻接关系计算邻接词之间的双条件概率自动识别领域术语.实验证明,本文提出的算法不仅能够有效地提取新术语,同时在小语料和低词频情况下也能取得较好的效果. 相似文献
7.
方面级情感分析旨在识别出句子中显式提及的方面及其情感极性,是细粒度情感分析中的重要任务.现有使用序列标注进行方面级情感分析的方法存在当方面(aspect)由多个单词构成时,每个单词的情感极性可能不一致,而基于跨度(span)的方法存在因方面标签和情感标签混合而导致的标签异质问题,同时现有的研究忽略了文本中方面-情感极性对之间的相互关联.为了解决上述问题,受关系抽取技术的启发,本文将方面-情感极性对抽取视作一元关系抽取问题,其中方面看成论元,其对应的情感极性作为关系,通过序列解码捕捉方面-情感极性对之间的关联.本文在3个数据集上进行了一系列实验来验证模型的有效性,实验结果表明,其性能超过了现有的最佳模型. 相似文献
8.
融合表情符号图像特征学习的微博情感分类 总被引:2,自引:0,他引:2
表情符号作为一种新兴的网络图形化语言,由于能够直观地表达用户的情感和态度,因此在社交平台被广泛使用。现有的利用表情符号进行微博情感分类的研究主要考虑表情符号的文本特征,这样的做法不能很好的捕捉表情符号之间更细粒度的联系,并无法适应表情的不断发展与变化。针对现有研究存在的问题,本文提出了一种基于卷积自编码器的表情图像特征学习的微博情感分类模型。该模型通过卷积自编码器捕捉的表情符号的图像特征,然后将图像的嵌入表达融入到微博的文本特征中,再利用多层感知机进行情感分类。该模型分别在中文和英文微博的数据集上和现有的方法进行了对比,实验证明,本文的方法优于现有的方法,并且在新表情和跨语言环境下的泛化能力更强。 相似文献
9.
现有Text2SQL方法严重依赖表名和列名在自然语言查询中的显式提及,在同物异名的实际应用场景中准确率急剧下降.此外,这些方法仅仅依赖数据库模式捕捉数据库建模的领域知识,而数据库模式作为结构化的元数据,其表达领域知识的能力是非常有限的,即使有经验的程序员也很难仅从数据库模式完全领会该数据库建模的领域知识,因此程序员必须依赖详细的数据库设计文档才能构造SQL语句以正确地表达特定的查询.为此,本文提出一种利用词典扩展数据库模式信息的Text2SQL方法,该方法从数据库表名和列名解析出其中的单词或短语,查询词典获取这些单词或短语的语义解释,将这些解释看成是相应表名或列名的扩展内容,与表名、列名及其他数据库模式信息(主键、外键等)相结合,作为模型的输入,从而使模型能够更全面地学习数据库建模的应用领域知识.在Spider-syn和Spider数据集上进行的实验说明了所提出方法的有效性,即使自然语言查询中使用的表名和列名与数据库模式中对应的表名和列名完全不同,本文方法也能够得到较好的SQL翻译结果,明显优于最新提出的抗同义词替换攻击的方法. 相似文献
10.
目前RSS成为互联网界的热门,如何高效并且合理地对RSS搜索任务进行调度也成了业界关注的问题.为解决上述问题,本文提出了基于访问频率和更新频率的最近最新访问算法,主要工作包括:(1) 分析了现有调度算法的不足;(2) 提出了基于访问频率的历史考察算法;(3) 在历史考察算法基础上提出最近最新访问算法;(4) 做了详尽的实验,实验结果证明,新的RSS调度算法较朴素调度算法更能区分RSS的重要度,最快调度速度提高了6倍. 相似文献