首页 | 本学科首页   官方微博 | 高级检索  
相似文献
 共查询到20条相似文献,搜索用时 62 毫秒
1.
提出一种基于网页分类和网页加权的网民聚类算法,其基本思想是:先以各个网民对每个网页的点击量为依据,通过模糊等价矩阵聚类法对网页进行分类,并根据网页内容与深度确定网页的加权,即给每个网页一个分数,最后根据这个加权分数再次对网民进行聚类,即使用两次模糊等价矩阵聚类.  相似文献   

2.
WEB网页超链接路径的选择在网站制作和站点维护中具有重要的作用。由于HTML等标记语言对网页超链接的规定与HTTP协议传送网页到浏览器时赋予的路径之间没有很好协调,网页制作与站点维护时链接路径没有正确选择,就会导致网页有时打不开.本文对多层目录下网页链接路径的选择提供了方法,为网页制作、网站维护提供参考。  相似文献   

3.
为了解决现有的钓鱼网页分析方法,往往基于页面的文本特征,而忽略了页面的结构特征的问题,提出基于文档对象模型(document object model,DOM)结构聚类的钓鱼检测方法,其关键在于如何快速有效地计算网页的相似度。首先对获取的页面进行DOM结构解析,构建DOM树层次标签向量以刻画网页的结构特征;然后重新定义DOM树距离的概念,通过不同DOM树之间的距离来度量网页间的相似度;最后采用划分聚类思想实现网页的聚类。一系列的仿真实验表明,方法具有较高的召回率与精确率,运行时间也较短。  相似文献   

4.
同一个站点的大部分网页拥有几乎相同的DOM标签树,处理后的标签树作为一个模板,该站点的所有网页只保留这个模板中叶子节点包含的内容,由此可以实现这个站点的所有网页的净化。首先对一个站点内的一组样本网页提取内容块树,针对每个树统计每个标签节点包含的文本字数,同级节点只保留字数最多的一个,从而生成单边子树UST;然后把这组UST合并,同级节点中出现次数最多的即为重要内容节点,把这些节点串起来就构成重要单边子树PUST;最后比对每个父节点与子节点之间的字数,当比值超过一个阈值时则删除子节点以下的所有节点,从而生成该站点的重要单边子树SPUST。这个SPUST就是该站点的网页净化模板。  相似文献   

5.
基于聚类的智能网页推荐系统研究   总被引:1,自引:0,他引:1  
设计了一种智能网页推荐系统的架构,其中包括数据预处理、聚类分析和网页推荐3个子系统,可以根据网站的访问日志来对用户进行自动分类,进而对网站的新用户在线提供网页推荐。提出了路径间距离的计算方法,进而研究了聚类子系统的结构,并通过对微软网站中用户访问日志的仿真实验,说明了所述方法的有效性。  相似文献   

6.
针对网页信息内容丰富且结构复杂,难以准确挖掘的问题,采用中心聚类和语义特征相互融合的方法.利用中心聚类算法确定样本最终的聚类中心,根据每个词在网页中出现的频率和词的上下文语义,构造一个网页-词语的权重映射矩阵,并将语义特征作为中心聚类相似性的判断依据,完成网页文本信息的挖掘.实验结果表明:利用该方法对网页文本进行挖掘,在时间增加不多的情况下,可以获得更高的召回率和准确率.  相似文献   

7.
谢江 《科技信息》2010,(3):41-41,11
在网络时代的今天,不同类型,不同内容,不同结构的网站浩如烟海,而网站建设所面临的一个主要问题是:如果能够深入了解用户的浏览兴趣和浏览习惯、预测用户的浏览路径,就可以通过修改网页结构来提高用户的浏览效率,从而提高网站的访问量和访问效率。前人采用基于Markov链用户浏览预测模型的方法对用户的浏览路径进行预测,其缺点是不能确切反应出用户所感兴趣的网页类别,以及用户在不同类别间访问跳转的联系,本文试图通过首先将网页分类,从而基于“网页类”再对用户的浏览进行预测,可以达到了解用户对不同类别网页访问习惯的目的,从而提高网站开发设计的质量。  相似文献   

8.
Nutch的网页更新预测方法采用的是邻比法,相关更新参数需要人为设定,不能自适应调整,无法应对海量网页更新的差异性.为解决这个问题,提出动态选择策略对Nutch的网页更新预测方法进行改进.该策略在网页更新历史数据不足时,通过基于MapReduce的DBSCAN聚类算法来减少爬虫系统抓取网页数量,将样本网页的更新周期作为所属类其他网页的更新周期;在网页更新历史数据较多时,通过对网页更新历史数据进行泊松过程建模,较准确地预测每个网页的更新周期.最后在Hadoop分布式平台下对改进该策略测试.实验结果表明,优化后的网页更新预测方法表现更优.  相似文献   

9.
对网页PageRank算法的改进   总被引:19,自引:0,他引:19  
分析了著名搜索引擎Google采用的PageRank算法,指出其偏重旧网页,忽视专业站点以及对网页中的超链接评估不恰当等不足之处。改进算法考察了网页日期这一重要因素,并重新计算网页中超链接对网页的影响。网页结构中蕴涵着丰富的信息,在href,title等标记中文字对网页主题有重要作用,利用结构标记可以辅助判断网页的主题内容。试验结果表明,采用改进的算法可以提高判断网页重要性的准确度。  相似文献   

10.
网页分类器设计的核心是对原始分类数据集进行分类规则挖掘,本文提出了一种结合链接结构聚类的混沌粒子群网页分类规则获取算法.算法将聚类和分类结合起来进行分类规则提取:首先用基于K均值的聚类算法对一部分有代表性的链接结构数据聚类,进行类别自动标注,形成训练集;再用混沌粒子群算法对已标注类别的数据提取分类规则.实验结果表明,这种模式充分发挥了基于链接的分类方法受人为因素干扰最小的优点,减少了人工标注类别的工作量,同时提高分类的准确率和效率.  相似文献   

11.
 把Web页面作为永久对象进行数据存储,利用永久对象的机制存储分解所得的Web页面对象及其成分对象潜在的好处是使用它们的Web页面不用改变源代码就可以把对象从一个数据存储向另一个数据存储转移.同时,这种机制也给Web页面对象的存储和再存储提供了灵活的框架.  相似文献   

12.
介绍了JavaBean的概念,详述了定义Bean和生成Bean实例的方法,用具体实例来说明如何设置和获得Bean的属性以及在JSP页面设计过程中如何使用JavaBean,最终达到了简化页面的目的。  相似文献   

13.
基于语义Web的网页推荐模型   总被引:4,自引:1,他引:4  
如何使用语义 Web技术构建网页推荐模型是一个有着广泛应用前景的研究课题。语义 Web下的网页用本体标注 ,该模型自动采集被标注网页上的语义信息 ,利用网页中的标注信息和相应的本体概念对网页进行分类 ,将分类结果存放在数据库中。同时 ,在这个模型下 ,用户的兴趣存放在DAML (DARPA agent markup language)格式的文件中。通过用户兴趣和网页类别的匹配 ,就能够给用户推荐需要的网页 ,在推荐网页时 ,该模型还采用支持向量机用于分类用户。实验结果显示了该模型比传统的网页推荐模型准确率更高  相似文献   

14.
探讨并展示了超级链接对象—NextLink的强大功能 ,提出了基于信息数据文件制作上下页超级链接并进行维护的新方法。  相似文献   

15.
利用Delphi的MSHTML-TLB.pas开发了一个具有自动查找Web页面上所有链接的简单网络浏览器.详细介绍了该浏览器的程序实现的方法和过程,包括如何实现Delphi中MSHTML-TLB.pas类的加入、浏览器界面的设计以及具体的程序的实现.  相似文献   

16.
基于网页分块的Shark-Search算法   总被引:1,自引:0,他引:1  
Shark-Search算法是一个经典的主题爬取算法. 针对该算法在爬取噪音链接较多的Web页面时性能并不理想的问题, 提出了基于网页分块的Shark-Search算法, 该算法从页面、块、链接的多种粒度来更加有效的进行链接的选择与过滤. 实验证明, 改进的Shark-Search算法比传统的Shark-Search算法在查准率和信息量总和上有了质的提高.  相似文献   

17.
介绍了开发基于JSP动态网页技术的Web站点分页显示处理程序的一种优化解决方案,即采用模型-视图-控制器(MVC)程序设计模式结合合理的分页逻辑,此方案减轻了服务器负荷,有效地改善了Web信息系统分页显示程序的可维护性.  相似文献   

18.
基于URL类型优先级的入口页面查询算法   总被引:1,自引:0,他引:1  
入口页面(主页)查询结果只有一个,并且用户的查询词常常是简短的页面名称,由于它要求更高的精准度,一般认为是较为困难的. 依据语言模型分析,挖掘出对中文入口页面(entry page)检索有意义的查询域作为基准检索的内容域,同时考虑到非内容网页优先级(URL type等)特征的重要性,建立综合内容域和非内容网页特征的检索模型. 通过URL类型优先级(URL type prior)的概率统计,发现入口页面和其相关的子页面之间存在比较大的联系. 据此提出基于相关子页面的入口页面提取算法PERS(page extracted from relevant sub page). 对比实验数据表明,PERS算法对检索的性能有较大提高.  相似文献   

19.
介绍了用DreamweaverUltraDev来实现动态网页的优点 ,并给出实例剖析 .  相似文献   

20.
提出一种新的基于用户访问路径分析的页面推荐模型.该模型采用在线处理方式,利用增量图划分方法形成页面聚类,依此生成动态页面推荐.模型以Apache模型的形式实现,可适用于大型商业网站以及内容更新频繁的网站.试验结果表明,该模型具有较好的整体性能.  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号