首页 | 本学科首页   官方微博 | 高级检索  
     检索      

基于统计分布与集合论的文本分类方法
引用本文:邓擘,樊孝忠,杨立公.基于统计分布与集合论的文本分类方法[J].北京理工大学学报,2006,26(7):589-592.
作者姓名:邓擘  樊孝忠  杨立公
作者单位:北京理工大学,计算机科学技术学院,北京,100081
基金项目:高等学校博士学科点专项科研项目
摘    要:指出基于TfIdf的常用文本特征提取方法在文本分类问题中的缺陷,进而提出使用特征词的分布状态、词频和文本频三者相结合的方式提取文本特征的观点,给出了计算特征词权重的新方法,提出了新的文本分类方法. 试验表明,该方法能够最大限度保留文本的特征,并且可有效避免向量空间模型中的维数灾难问题,能应用于大规模文本分类.

关 键 词:文本分类  特征词  词频  文本频  统计分布  统计分布  集合论  文本分类  分类方法  Set  Theory  Technology  Statistical  Based  Text  Classification  大规模  应用  分类问题  维数灾难  空间模型  向量  特征词权重  试验  计算  文本特征  特征提取
文章编号:1001-0645(2006)07-0589-05
收稿时间:2005-12-22
修稿时间:2005-12-22

A Method of Text Classification Based on Statistical Technology and Set Theory
DENG Bo,FAN Xiao-zhong and YANG Li-gong.A Method of Text Classification Based on Statistical Technology and Set Theory[J].Journal of Beijing Institute of Technology(Natural Science Edition),2006,26(7):589-592.
Authors:DENG Bo  FAN Xiao-zhong and YANG Li-gong
Institution:School of Computer Science and Technology, Beijing Institute of Technology, Beijing 100081, China
Abstract:Points out the limitations of general text feature extraction method based on TfIdf in problems of text classification,and presents the standpoint that combines the term distribution characteristic,term frequency and document frequency to extract the text feature,thus giving a new method to compute term's weight,and a new way of text classification.Experiment showed that the method can keep the text's feature to a maximum,and avoid the problem of dimensional disaster in VSM effectively,so it can be applied in problems of large scale text classification.
Keywords:document classification  term  term frequency  document frequency  statistical distribution
本文献已被 CNKI 维普 万方数据 等数据库收录!
点击此处可从《北京理工大学学报》浏览原始摘要信息
点击此处可从《北京理工大学学报》下载免费的PDF全文
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号