Categories


Tags


建立符合搜索抓取习惯的网站

编者按:前两周简要地给大家介绍了搜索抓取系统工作原理,根据该工作原理今天简要介绍一下如何建立网站是符合搜索引擎抓取系统习惯的。

1、简单明了的网站结构

Spider抓取相当于对web这个有向图进行遍历,那么一个简单明了结构层次分明的网站肯定是它所喜欢的,并尽量保证spider的可读性。

(1)树型结构最优的结构即“首页—频道—详情页”;

(2)扁平首页到详情页的层次尽量少,既对抓取友好又可以很好的传递权重。

(3)网状保证每个页面都至少有一个文本链接指向,可以使网站尽可能全面的被抓取收录,内链建设同样对排序能够产生积极作用。

(4)导航为每个页面加一个导航方便用户知晓所在路径。

(5)子域与目录的选择相信有大批的站长对此有疑问,在我们看来,当内容较少并且内容相关度较高时建议以目录形式来实现,有利于权重的继承与收敛;当内容量较多并且与主站相关度略差时建议再以子域的形式来实现。

2、简洁美观的url规则

(1)唯一性网站中同一内容页只与唯一一个url相对应,过多形式的url将分散该页面的权重,并且目标url在系统中有被滤重的风险;

(2)简洁性动态参数尽量少,保证url尽量短;

(3)美观性使得用户及机器能够通过url即可判断出页面内容的主旨;

我们推荐如下形式的url:url尽量短且易读使得用户能够快速理解,例如使用拼音作为目录名称;同一内容在系统中只产生唯一的url与之对应,去掉无意义的参数;如果无法保证url的唯一性,尽量使不同形式的url301到目标url;防止用户输错的备用域名301至主域名。

3、其他注意事项

(1)不要忽略倒霉的robots文件,默认情况下部分系统robots是封禁搜索引擎抓取的,当网站建立后及时查看并书写合适的robots文件,网站日常维护过程中也要注意定期检查;

(2)建立网站sitemap文件、死链文件,并及时通过百度站长平台进行提交;

(3)部分电商网站存在地域跳转问题,有货无货建议统一做成一个页面,在页面中标识有无货即可,不要此地区无货即返回一个无效页面,由于spider出口的有限性将造成正常页面无法收录。

(4)合理利用站长平台提供的robots、sitemap、索引量、抓取压力、死链提交、网站改版等工具。

如果大家对搜索抓取还有别的疑问,大家可以到[学堂同学汇][学习讨论] 《建立符合搜索抓取习惯的网站》讨论帖中发表自己的看法,我们的工作人员会关注这里并与大家进行探讨。

来源:百度搜索资源平台 百度搜索学堂


Public @ 2021-12-30 16:12:04

什么是网站树状结构?

树状结构不是指的URL的层次,而是指的网站的结构,SEO优化网站结构一般来说网站结构为树状结构比较吸引搜索引擎喜欢,根目录下以目录形式分成多个产品分类,再每个产品分类放置属于这个分类的产品页面。举个例子:当你进入图书馆的时候,会看到图书馆以学科的内容分成几大类,每一大类下分许多小类,每一小类下再分子小类。最后,每一种书都可以分到某一个类目下,每一个类目都有一个类号 。同理搜索引擎希望网站的类目都是

Public @ 2019-12-22 16:12:10

IIS网站服务器性能优化指南

Windows Server自带的互联网信息服务器(Internet Information Server,IIS)是架设网站服务器的常用工具,它是一个既简单而又麻烦的东西,新手都可以使用IIS架设一个像模像样的Web站点来,但配置、优化IIS的性能,使得网站访问性能达到最优状态却不是一件简单的事情,这里我就介绍一下如何一步一步的优化你的IIS服务器。服务器端环境,我们以Windows Serve

Public @ 2018-05-18 15:16:31

网站结构优化:所谓F型结构是指什么

F型结构是一种常见的网站界面设计,通过网页访问热点分析,发现用户在第一次访问网页时会按照“F”型的阅读习惯,即先从左上角开始扫视,然后向右扫过,最后再向下扫过,这样就形成了一个“F”型的阅读路径,网站的设计就要根据这个阅读路径进行布局和排版,以便更好地吸引用户和展示内容。常见的实现方式包括将重要的信息和内容放在左上角和顶部区域,使用有吸引力的图片和标题,适量使用粗体和高亮字体突出关键内容等。

Public @ 2023-06-04 16:00:09

网站架构对SEO的影响

2011年第一文,在这里祝大家新年快乐,今天卢松松就归纳下之前所有网站的架构对SEO的影响,有许多网友问过重复的问题,我在这里归总一下。在以后的日子里,我还将不断优化本站提供的模板下载,在符合SEO的同时,更加兼顾模板的性能问题,为本站模板用户创造出高访问量网站模板优化。一:W3C标准对SEO的影响。我们看到每个网页的源文件(右键查看源文件),几乎每个网站最顶部都有以下代码:<!DOCTYP

Public @ 2010-08-23 16:12:06

更多您感兴趣的搜索

0.131092s