豆搜网 文档下载 文档下载导航
设为首页 | 加入收藏
搜索 请输入内容:  
 导航当前位置: 文档下载 > 所有分类 > 管理科学文献综述2
侵权投诉

管理科学文献综述2

Web日志挖掘方法的研究

摘要:随着Internet/Intranet技术的发展及普及,Web上的数据信息越加丰富,怎样更加有效的利用网络资源变得非常重要。Web日志挖掘就是通过挖掘Web日志文件,找出浏览者的兴趣、访问习惯和偏好路径,得到用户访问Web页面的模式。Web日志挖掘的步骤有三个:数据预处理、模式识别和模式分析。通过Web日志挖掘,提高Web站点性能,理解用户意图。改进Web站点设计,挽留老客户,挖掘潜在的新客户。

关键词:数据挖掘;Web日志挖掘;序列模式挖掘;

1、数据挖掘

数据挖掘是从大量的、不完全的、有噪声的、模糊的、随机的数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。数据挖掘技术是人们对数据库技术不断研究和开发的结果,是继宽带网络之后的又一个技术热点。自1989年出现以来,经过十多年的发展,数据挖掘技术已趋于成熟,并已投入商业应用。世界上比较有影响的典型数据挖掘系统有:S P S S公司的Clementine,IBM公司的IntelligentMiner,SGI公司的SetMiner,SAS公司的EnterpriseMiner, RuleQuestResearch公司的See5,还有CoverStory、EXPLORA、KnowledgeDi scoveryWorkbench、DBMiner、Quest等。知名的GartnerGroup的一次高级技术调查将数据挖掘和人工智能列为“未来3~5年内将对工业产生深远影响的五大关键技术之首”。

2 、Web数据挖掘和Web日志挖掘

随着Intemet/Intranet技术的发展,Web上的数据信息越加丰富,怎样更加有效的利用网络资源变得非常重要。Web数据挖掘(Web mining)就是从www资源上抽取信息(或知识)的过程,是对www资源中(Web文档和Web活动中)抽取蕴涵的、未知的、有潜在应用价值的模式的过程。它通过反复使用多种数据挖掘算法从观测数据中确定模式或合理模型,是将数据挖掘技术和理论应用于对WWW资源进行挖掘的一个新兴的研究领域。然而,由于Web数据量的庞大,杂乱,以及信息源的动态性,要找出有用的信息是很困难的。所以,Web对有效的资源和知识发现有很大的挑战性。目前有许多基于索引的Web搜索引擎可以完成对Web的搜索。例如,Yahoo!,AltaVista,“美国在线”等。但每种搜索引擎在对Web资源进行查找和搜索时还存在着或多或少的局限性。

在Web数据挖掘研究领域中,根据挖掘对象的不同,Web数据挖掘分为3类,l!pWeb内容挖掘(Webcontent mining)、Web结构挖掘(Web structuremining)和Web使用记录挖掘(Webusage mining)。有些时候,由于Web内容挖掘和Web结构挖掘的对象都是Web上的原始数据,Web结构挖掘也可以看作是Web内容挖掘的一部分。所以,Web数据挖掘也可以分成两大类:Web内容挖掘和Web使用记录挖掘。Web日志挖掘是Web数据挖掘中的一个最为重要和繁荣的子子领域,是对Web使用记录挖掘的一种方法,(如图1 Web日志挖掘的层次)。Web站点的日志记录了浏览者的浏览行为,通过对Web日志最为重要和繁荣的子子领域,是对Web使用记录挖掘的一种方法,(如图1 Web日志挖掘的层次)。Web站点的日志记录了浏览者的浏

- 1 -

第1页

TOP相关主题

热门文档

站点地图 | 文档上传 | 侵权投诉 | 手机版
新浪认证  诚信网站  绿色网站  可信网站   非经营性网站备案
本站所有资源均来自互联网,本站只负责收集和整理,均不承担任何法律责任,如有侵权等其它行为请联系我们.
文档下载 Copyright 2013 doc.docsou.com All Rights Reserved.  闽ICP备15022310号-9  闽公网安备 35021102001881号  email
返回顶部