Google的秘密PageRank彻底解说中文版
索引
前言
PageRank 的基本概念
怎样求得 PageRank
实际应用时的问题
Namazu 上的实际安装实验
对 PageRank 的个人见解
参考文献
附录:「guguru?/gouguru?
★(2003/7/1) 拙著『Namazu系统的构筑和活用』已作修订。 详情请看介绍页面 。
★(2003/5/20) 与 Google 有关的在线新闻报道一览(日语)已被分离到 另一张页面() 。
★(2001/2/28) Namazu 的索引中使用的计算 PageRank 的 Perl 脚本 prnmz- 公开下载。
最近,搜索引擎非常引人注目。Google 是基于现担任 CEO 的 Larry Page 和担任总经理的 Sergey Brin (2001年2月)在就读于美斯坦福大学研究生院时所开发的搜索引擎的一种检索服务。Google 从1998年9月开始服务,但Netscape Communications 在GOOGLE的测试阶段就开始与其合作,美国Yahoo公司也从2000年6月起将默认搜索引擎(美国Yahoo不能检索时作为增补的搜索引擎)由原先合作的 Inktomi 转换为了 Google。日语版 GOOGLE在2000年9月正式登场,现已被Biglobe (NEC)所采用。 (注:2001年4月 Yahoo JAPAN 和***@NTFTY,7月索尼,2002年1月Excite也相继与Google建立了协作关系)。
Google 被评价的优点不仅仅在于去除无用的(广告)标语构成单一页面的功能、独自的 Cache 系统、动态制成摘要信息、为实现高速检索而设置的分散系统(数千台规模的Linux群集器)等,而其中最大的优点正是它检索结果的正确性。一种能够自动判断网页重要性的技术「PageRank是(网页等级)」就是为此而设计的一种技术。 本文的目的就是以尽可能浅显易懂的语言来说明 PageRank 系统的概要和原理。
以下是 PageRank 的一篇基础文章。
Lawrence Page, Sergey Brin, Rajeev Motwani, Terry Winograd, 'The PageRank Citation Ranking: Bringing Order to the Web', 1998,
为了更高效地计算 PageRank,以下是改良以后的一篇论文。
Taher H. Haveliwala, 'Efficient Computation of PageRank', Stanford Technical Report, 1999,
另外,以下是 PageRank 的演示用资料(PowerPoint)。
Larry Page, 'PageRank: Bringing Order to the Web',
(已失效)
接下来就对这两篇文章(另加一篇资料)进行基本说明。 首先,用简单的例子来解说 PageRank 的概念,再归结到使用超链接关系的排序系统来解决大规模疏松疏矩阵的特性值的问题。然后我们会接触一些在现实世界中应用基本模型时出现的问题和对应方法。接下来,为了探讨是否能够作为「个人化 PageRank」使用,进行对免费全文检索系统 Namazu 的安装实验并对其结果进行阐述。最后发表我对 PageRank 的个人见解。
另外,为了能够理解以下的说明内容,需要大学基础课程程度的数学知识(尤其是线形代数)。然而为使文科生也能够顺利读下去,尽可能地不用算式来说明问题,同时,为了加入笔者个人的见解,没有加入像原文那么多的算法和数字,也存在许多不够严密和欠正确的地方,事先在次声明。具体内容请参照原文。
PageRank(TM) 是美注册商标。
2. PageRank 的基本概念
PageRank 是基于「从许多优质的网页链接过来的网页,必定还是优质网页」的回归关系,来判定所有网页的重要性。
在以下冗长的说明中,许多部分大量地使用了专业用语,会造成理解上的困难。这一章虽然准备集中于定性而简单的解说,但是,即使如此也会有怎么也不明白的时候,此时只要能够理解「从许多优质的网页链接过来的网页,必定还是优质网页
」这一思考方法也就非常得可贵了。因为在所有几个要点中,这个是最重要的思考方法。
关于PageRank
PageRank,有效地利用了 Web 所拥有的庞大链接构造的特性。 从网页A导向网页B的链接被看作是对页面A对页面B
Google的秘密 来自淘豆网m.daumloan.com转载请标明出处.