Categories


Tags


【院长帮帮忙】页面无用时间信息导致网页不被爬虫抓取(第一期)

在【院长帮帮忙】栏目露过面的站点是编织汇(www.bianzhihui.com),该站点通过反馈中心反馈页面内容迟迟不被抓取,经百度工程师追查,原来是因为页面上的无用时间信息——没有想到是不是?同学们快来看看这个案例吧。也想让院长帮助追查吗?快来看看这里!

站点求助:现象

编织汇网站内容发布后几个礼拜都未曾收录。案例如下:

http://www.bianzhihui.com/t/6717(教程详细页面举例)

http://www.bianzhihui.com/u/12306 (用户页面举例)

http://www.bianzhihui.com/h/154 (编织花样页面举例)

我们已将这些url放入sitemap,并使用了百度统计的集成的JS推荐,但是未曾有改善。

站点求助:自查

根据反馈中心的回复,使用抓取异常工具诊断:未发现异常

院长出手,内部追查

工程师结论: spider抓取很及时,但因为该网站没有设置内容产出时间,网站底部却有个老旧时间日期,导致spider误以为网页内容老旧(具体策略较复杂,在此不做赘述)。建议增加页面内容产生时间,去掉没有必要的时间信息

*以上为旧页面截图,“2014年9月9日”对时间识别造成干扰。

站点总结:

1,网页上切忌勿乱加时间,如我们网站的(始于2014年9月9日)这种时间是一个大忌

2,网页内容尽可能加上产出时间,也就是发布时间

3,百度site的结果时间和权重并无太多关系

4,跟百度沟通的时候,一定要条例清晰,证据确凿。自身的问题一定要先排查准确。

来源:百度搜索资源平台 百度搜索学堂


Public @ 2015-07-21 15:22:04

如何让 sogou spider 不抓我的网站

有以下几种方式可以让 sogou spider 不抓取你的网站: 1. 使用 robots.txt 文件。在网站根目录下添加 robots.txt 文件,并加入以下代码: User-agent: Sogou Disallow: / 这将告诉 Sogou 爬虫不要访问网站的任何页面和文件。 2. 使用 meta 标签。在网站的头部添加以下 meta 标签: 这将告诉所有的搜索引擎爬虫不

Public @ 2023-04-18 21:00:23

百度Spider升级HTTPS抓取公告

8月份百度Spider升级了对HTTPS数据的抓取力度,HTTPS数据将更快被Spider抓取到。如网站还在做HTTPS的改造,且网站数据未搭建好,建议网站采取以下措施,避免Spider抓取,以免造成网站流量损失1、把HTTPS的协议封掉,可把443端口关掉;2、做HTTPS到http的301;3、建议站点在改HTTPS没改造好之前,不要提供超链接指向,以免被Spider抓到HTTPS。4、针对一

Public @ 2011-03-28 15:38:47

【院长帮帮忙】移动适配不稳定、不生效,可能是这些原因造成的!(第五期)

一、网站页面有跳转,适配不稳定站点反馈他们移动端的适配不稳定,移动展示的页面去预期效果不符;经查是站点在下载页面对机型进行了自适应,页面会根据机型跳转,所以移动端的展现不稳定;解决方案:1、建议站点将机型识别功能放置在下载按钮中,根据机型给予不同下载地址,而不是给予不同的下载页面;2、将pc-m的适配规则固定,不要一种pc页面指向多种移动页面;二、适配规则的混淆站点咨询为什么他们的适配规则老是不生

Public @ 2016-10-22 15:22:05

【院长帮帮忙】移动适配不稳定、不生效,可能是这些原因造成的!(第五期)

1. 布局使用了绝对定位 如果布局使用了绝对定位,那么在不同的设备上,元素的位置和大小会发生变化,从而导致移动适配不稳定或者根本无法生效。建议使用相对定位或者flex布局。 2. 使用了固定宽度和高度 在移动适配时,应该使用相对单位(如rem或者百分比),而不是固定宽度和高度。如果使用了固定宽度和高度,那么在不同的设备上,元素的大小会发生变化,从而导致移动适配不稳定。 3. 没有考虑不同的

Public @ 2023-06-24 11:50:16

更多您感兴趣的搜索

0.507275s