Categories


Tags


【院长帮帮忙】页面无用时间信息导致网页不被爬虫抓取(第一期)

在【院长帮帮忙】栏目露过面的站点是编织汇(www.bianzhihui.com),该站点通过反馈中心反馈页面内容迟迟不被抓取,经百度工程师追查,原来是因为页面上的无用时间信息——没有想到是不是?同学们快来看看这个案例吧。也想让院长帮助追查吗?快来看看这里!

站点求助:现象

编织汇网站内容发布后几个礼拜都未曾收录。案例如下:

http://www.bianzhihui.com/t/6717(教程详细页面举例)

http://www.bianzhihui.com/u/12306 (用户页面举例)

http://www.bianzhihui.com/h/154 (编织花样页面举例)

我们已将这些url放入sitemap,并使用了百度统计的集成的JS推荐,但是未曾有改善。

站点求助:自查

根据反馈中心的回复,使用抓取异常工具诊断:未发现异常

院长出手,内部追查

工程师结论: spider抓取很及时,但因为该网站没有设置内容产出时间,网站底部却有个老旧时间日期,导致spider误以为网页内容老旧(具体策略较复杂,在此不做赘述)。建议增加页面内容产生时间,去掉没有必要的时间信息

*以上为旧页面截图,“2014年9月9日”对时间识别造成干扰。

站点总结:

1,网页上切忌勿乱加时间,如我们网站的(始于2014年9月9日)这种时间是一个大忌

2,网页内容尽可能加上产出时间,也就是发布时间

3,百度site的结果时间和权重并无太多关系

4,跟百度沟通的时候,一定要条例清晰,证据确凿。自身的问题一定要先排查准确。

来源:百度搜索资源平台 百度搜索学堂


Public @ 2015-07-21 15:22:04

网络爬虫(Spider)

网络爬虫(Spider)是一种自动化程序,用于通过互联网收集和抓取网页信息。它模拟人类在浏览器中的操作,自动访问网站并抓取其中的信息。爬虫的主要作用是帮助用户快速地获取海量数据,例如网页内容、图片、音频、视频等,并将它们存储在一个本地数据库中,以供后续处理和分析。在人工获取数据耗时费力的情况下,网络爬虫的应用可以大大提高数据抓取效率,以及提高数据处理的准确与可靠性。

Public @ 2023-06-02 04:00:09

搜索引擎蜘蛛对于网站抓取是否很智能?如何引导蜘蛛?

尽管搜索引擎在不断的升级算法,但是终究其还是程序,因此我们在布局网站结构的时候要尽可能的让搜索引擎蜘蛛能看的懂。每个搜索引擎蜘蛛都有自己的名字,在抓取网页的时候,都会向网站标明自己的身份。搜索引擎蜘蛛在抓取网页的时候会发送一个请求,这个请求中就有一个字段为User-agent,用于标识此搜索引擎蜘蛛的身份。例如Google搜索引擎蜘蛛的标识为GoogleBot,百度搜索引擎蜘蛛的标识为Baidu

Public @ 2020-07-03 16:22:36

【院长帮帮忙】地域类站点,这个问题一定要注意!(第八期)

最近院长收到一个地方站较多的网站反馈站点问题,网站在搜索北京XX网的情况下,搜索结果下却出现大量这个网站的其他地方站,这是什么问题呢?工程师问题追查:首先,百度对网站的收录没有问题,而以上情况的产生,是因为网站的移动适配错误造成的。以上网站的移动适配,将全部的地方站类似xuzhou.abc.com,在移动端适配指向都是3g.abc.com,举例来说徐州站,对应的移动站地址实际是3g.abc.com

Public @ 2014-08-13 15:22:06

【院长帮帮忙】第三期:无效搜索结果页是个祸害

上一期在【院长帮帮忙】里露面的是和讯网,由于他们的服务器限制外网访问,造成主动推送失败。本期这个站点的SEO负责人希望不要暴露身份,院长同意了。我们来看看无效搜索结果页是如何祸害站点、尤其是新站点的吧。也想让院长帮助追查吗?快来看看这里!站点求助:现象B2B新站上线有一个月,一开始的时候收录还是不错的,在百度里直接搜索网站名能排到首页第5位的样子,但是在百度站长平台认证了我们的站,修改了一下rob

Public @ 2010-09-15 15:22:03

更多您感兴趣的搜索

0.444397s