如何提高spider抓取网站?提高spider抓取策略(2)

    站长原创 wuya 50次浏览 已收录 0个评论

    关于很多seo都对【如何提高spider抓取网站?提高spider抓取策略(2)】这些问题都比较迷茫。没有比较权威的解释,今天无涯SEO给大家详细解释一下【如何提高spider抓取网站?提高spider抓取策略(2)】,希望能帮助到大家。

    上一篇文章中,给大家简单介绍了提高spider抓取网站策略的两大方法,另外还有五个策略接着给分享给大家。

    如果没有浏览上篇文章,可以通过以下链接查看:

    【如何提高spider抓取网站?提高spider抓取策略(1)】

     

    提高spider抓取策略有哪些?

    三、多种URL重定向的识别

    为了让spider能够对多种URL重定向的识别,重定向分别有三类:HTTP 30x重定向、Meta refresh重定向和JS重定向。百度目前也支持Canonical标签。

     

    四、抓取优先级调配

    想让搜索引擎抓取网站全部页面,是没有百分百的。所以需要在抓取系统设计抓取优先级调配。

    抓取优先级调配包含:宽度优先遍历策略、PR优先策略、深度优先遍历策略等等。根据实际情况结合多种策略使用完善抓取效果。

     

    五、重复URL的过滤

    网站出现重复的URL过多,会引发被降权。

    重复页面可以使用301重定向,在服务器端对标准URL进行定义。把不标准的URL都301重定向到标准的URL上。

     

    六、暗网数据的获取

    暗网数据指的是搜索引擎无法抓取的数据。主要因为网站上的数据都在网络数据库中,spider很难抓取中获得完整内容;其次网络环境和网站本身不符合规范等问题,导致搜索引擎无法抓取。

    解决暗网数据的问题,可以通过百度站长平台数据提交的方式来解决。

     

    七、抓取反作弊

    Spider在抓取过程中会抓取到低质量页面或者是被黑的页面。通过分析URL特征、页面的大小等等原因,完善的抓取反作弊。

    【相关SEO小知识】

    SEO网站优化SEOER,每天都要时刻关注百度蜘蛛有没有来抓取网站,抓取了网站哪些内容,没有抓取网站哪些内容,再没有抓取的页面上观察调整网站的问题。

    想要提高爬虫抓取频率可以从几个方面着手,简单介绍提高spider抓取网站的策略。

     

    提高spider抓取策略有哪些?

    一、抓取友好性:抓取压力调配降低对网站的访问压力

    带宽造成访问压力大,会直接影响网站的正常用户访问,为了不影响网站的正常用户访问,又能让spider抓取有价值性的页面。

    1、IP压力控制

    如果一个域名下存在多个IP,或者是多个域名下对应同一个IP,需要根据IP和域名多种条件进行压力调配控制。也可以在站长平台中使用压力反馈工具,人工调配对网站的抓取压力,这样spider会优先根据站长的要求进行抓取压力控制。

    2、站点的抓取速度

    如果在同一个站点,抓取速度控制有两类:第一类,一段时间内的抓取频率;第二类,一段时间内的抓取流量。同一个站点在不同的时间内抓取的速度是不同的,根据站点的类型来设置。

     

    二、常用抓取返回码示意

    1、404:“NOT FOUND”,表示该网页已经失效,通常在库中删除,spider如果发现这条URL是不会抓取的。

    2、503:“Service Unavailable”,表示该网页暂时不能访问。网页返回503状态码,百度spider不会直接删除这条URL,再访问多次的情况下,网页如果恢复正常,就能正常抓取。如果继续返回503,才会认为是失效链接,从库中删除。

    3、403:“Forbidden”, 表示该网页目前禁止访问。如果生成的是新的URL,spider是暂时不会抓取,也是会再访问多次;如果是被收录的URL,不会直接删除,短期内同样反复访问几次。如果网页正常访问,则正常抓取;如果仍然禁止访问,那么这条URL也会被认为是失效链接,从库中删除。

    4、301:“Moved Permanently”, 表示该网页重定向到新的URL。如果站点需要更换域名、站点改版的情况下,需要设置301重定向,也可以在站长平台上网站改版工具提交,有效减少网站的流量损失。

    关于如何提高spider抓取网站?提高spider抓取策略(2)这个问题和抓取|重定向|策略相关的内容,相信本文已经介绍的非常清楚了。希望帮助到大家,并关注一下无涯。
    http://www.zhengzhou888seo.com
    【广告】:更多SEO问题,如果你在zhengzhou888seo.com上找不到解决的方法,随时加站长QQ :894974231
    乐意能帮助到您。
    【作者花名】:红莲
    【发布时间】:2019年04月09日 22时17分59秒
    【超级管理员】:白马啸西风
    【共有多少大侠阅过】:352
    【本文SEO奥义关键词】:
    抓取|重定向|策略


    学海无涯 , 版权所有丨如未注明 , 均为原创丨转载请注明如何提高spider抓取网站?提高spider抓取策略(2)
    喜欢 (0)
    发表我的评论
    取消评论
    表情 加粗 删除线 居中 斜体 签到

    Hi,您需要填写昵称和邮箱!

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址