联享懂营销的专业网站设计制作公司

百度对网站页面收录的原理

2022-09-29 围观热度 692技术推荐

      通过几期前面内容的介绍,大家应该大致了解了搜索引擎的工作方式,下面我们来介绍页面收录的原理。页面收录原理经过修改“页面收录流程”能够把握放慢网站被收录的办法,从而改善搜索引擎收录的数目。假设把一个网站页面组成的页面看作是一个有向图,沿着页面中的链接,依照某种特定的战略对网站中的页面停止遍历。

      不停地从URL列表中移出曾经拜访的URL,同时提取原始页面中的URL的消息,再将URL分为域名及外部URL两大类,同时判定URL能否被拜访过,递归地扫描URL列表,直至耗尽一切URL资源为止,如图所示。

搜索引擎收录页面的工作原理


      在搜索引擎中要获取相对重要的页面,就涉及到了搜索引擎的页面收录方式。页面收录方式是指搜索引擎抓取页面时所使用的战略,目的是为了能在互联网中挑选出绝对主要的消息。假设使用相同的抓取战略,搜索引擎在异样的工夫内能够在某一网站中抓取到更多的页面资源,则会在该网站停止更长的工夫,收录的页面数自然也就多了。因而,加强对搜索引擎页面收录方式的熟悉,有益于为网站树立敌对的构造,进步被收录的数目。搜索引擎收录页面的方式主要有“广度优先”、“深度优先”及“用户提交”(用户提交暂时不讲)三种。

      1.广度优先如果把整个网站看做一棵树,首页就是根,每个页面就是叶子。广度优先是一种横向的页面抓取方式,先从树的较浅层开始抓取页面,直接抓完同层次的所有页面后才进入下一层。因此,在对网站进行优化时,应该把网站相对重要的信息展示在层次比较浅的页面上(如在首页推荐一些热门的内容)。反过来,通过广度优先的抓取方式,搜索引擎就可以首先抓取到网站中相对重要的页面。首先,蜘蛛从网站的首页出发,抓取首页上所有连接指向的页面,形成页面集合A,并分析出A中所有页面中的链接,再跟踪这些链接抓取下一层的页面,形成页面集合B。就这样递归地从浅层页面中解析出链接,再延伸到深层页面,直到满足某个设定的条件才停止抓取进程,如图所示。

广度优先抓取流程


2.深度优先与广度优先的抓取方式相反,深度优先首先跟踪浅层页面中的某一连接后逐步抓取深层页面,直到抓完最深层的页面才返回浅层页面再跟踪另一链接,继续向深层页面抓取,这是一种纵向的页面抓取方式。使用深度优先的抓取方式,搜索引擎可以抓取到网站中较为隐蔽、冷门的页面,这样就能满足更多用户的需求。首先,搜索引擎会抓取网站的首页,并提取首页中的链接,再沿着其中的一个连接抓取到页面A-1,同时获取A-1中的链接并抓取页面B-1,获取B-1中的来链接并抓取页面C-1,如此不断地重复,满足到某个条件后,再从A-2抓取页面及链接,如图所示。

深度优先抓取流程



  • 7x24

    全国售后支持123

  • 14

    14年行业服务经验

  • 26

    全国售后支持

  • 200

    超百人设计、研发团队

  • 2

    服务企业客户2万家

  • 9

    连续9年守合同重信用企业

关于我们
广州联享信息科技有限公司成立于2011年,是成熟的企业互联网解决方案服务商。致力于帮助每个企业实现互联网智能经营。截止目前,联享科技在全国设有26家分公司,拥有员工200余人,总公司现设有客服事业部、运营事业部、网络事业部、行政事业部四大职能部门...
联享科技已覆盖互联网主要城市
目前总部设立于广州,并在深圳、上海、北京、杭州、长沙、武汉、郑州、石家庄等全国26座城市设有分公司及30余家核心城市代理,更多城市正在筹建中,敬请期待

Copyright © 2007-2022 联享信息科技有限公司(a020.cn)版权所有

常年法律顾问:广东梵意律师事务所 周乙飞律师(主任)