如何提高spider抓取网站？提高spider抓取策略（1）_威海佰年网络技术有限公司_网站建设_软件开发_私有云_商标注册_公众号_小程序_APP_物联网

如何提高spider抓取网站？提高spider抓取策略（1）

威海Spider 威海Spider
1830

SEO网站优化SEOER，每天都要时刻关注百度蜘蛛有没有来抓取网站，抓取了网站哪些内容，没有抓取网站哪些内容，再没有抓取的页面上观察调整网站的问题。

想要提高爬虫抓取频率可以从几个方面着手，简单介绍提高spider抓取网站的策略。

提高spider抓取策略有哪些？

一、抓取友好性：抓取压力调配降低对网站的访问压力

带宽造成访问压力大，会直接影响网站的正常用户访问，为了不影响网站的正常用户访问，又能让spider抓取有价值性的页面。

1、IP压力控制

如果一个域名下存在多个IP，或者是多个域名下对应同一个IP，需要根据IP和域名多种条件进行压力调配控制。也可以在站长平台中使用压力反馈工具，人工调配对网站的抓取压力，这样spider会优先根据站长的要求进行抓取压力控制。

2、站点的抓取速度

如果在同一个站点，抓取速度控制有两类：第一类，一段时间内的抓取频率；第二类，一段时间内的抓取流量。同一个站点在不同的时间内抓取的速度是不同的，根据站点的类型来设置。

二、常用抓取返回码示意

1、404：“NOT FOUND”，表示该网页已经失效，通常在库中删除，spider如果发现这条URL是不会抓取的。

2、503：“Service Unavailable”，表示该网页暂时不能访问。网页返回503状态码，百度spider不会直接删除这条URL，再访问多次的情况下，网页如果恢复正常，就能正常抓取。如果继续返回503，才会认为是失效链接，从库中删除。

3、403：“Forbidden”，表示该网页目前禁止访问。如果生成的是新的URL，spider是暂时不会抓取，也是会再访问多次；如果是被收录的URL，不会直接删除，短期内同样反复访问几次。如果网页正常访问，则正常抓取；如果仍然禁止访问，那么这条URL也会被认为是失效链接，从库中删除。

4、301：“Moved Permanently”，表示该网页重定向到新的URL。如果站点需要更换域名、站点改版的情况下，需要设置301重定向，也可以在站长平台上网站改版工具提交，有效减少网站的流量损失。

来源：搜外网

Public @ 2010-03-31 16:22:35

Baiduspider的user-agent是什么？

威海Spider 威海Baiduspider
2025

Baiduspider的user-agent是： Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

Public @ 2023-06-18 22:50:04

【官方说法】只需两步，正确识别百度蜘蛛（User-Agent）

威海Spider 威海Baiduspider
1572

经常听到开发者问，百度蜘蛛是什么？最近百度蜘蛛来的太频繁服务器抓爆了！最近百度蜘蛛都不来了怎么办？还有很多站点想得到百度蜘蛛的IP段，想把IP加入白名单，但IP地址范围动态变化不固定，我们无法对外公布。那么如何才能识别正确的百度蜘蛛呢？今日干货带你轻松两步正确识别百度蜘蛛：一、查看UA信息如果UA信息不对，可以直接判断为非百度搜索的蜘蛛。目前UA分为移动、PC、和小程序三个应用场景，这三个渠道UA

Public @ 2014-05-26 15:38:36