Categories


Tags


金字塔算法模型初识

Web3.0的到来后基于互联网营销模式层出不穷,seo就是其中一块炙手可热的领域。本人对百度算法跟踪研究已近5年的时间,我主要从事的是算法逆向,也就是通过一些相关指标来判断百度排名规则。

在叙述百度算法之前我先讲一下我在前不久之前看到百度搜索研发部博客中的一篇文章《浅谈网页搜索排序中的投票模型》里面叙述了美国的选举制度,这其实就是百度的其中一种投票体系的原型,我是这么认为的。用一张简单的图来阐述一下整个过程:

金字塔算法模型初识

看了上图我相信大家都应该明白,排序的残产生应该是在“总数据库”和百度服务器之间发生的变化,百度蜘蛛会采集很多内容回来,全部存放入总服务器,总服务器通过规则判断筛选后最终在web服务器上放出页面给出排序,其实就是在“总数据库”发生了一些列的算法变化。当然我这边阐述的内容中的各个服务器和名称全部是我个人定义,但基本的逻辑应该是如此的,按照数据分析的原则:数据收集——数据处理——数据分析仪——数据展现,其实就很能概括百度这一行为。

虽然百度一方面做着推广竞价,一方面又希望给广大用户一个良好的检索体验,可能很多seoer又恨又爱,但是根据官方的各种文本我们还是姑且相信百度搜索研发部门还是希望给用户一个好的检索体验。

说到了这里我不得不用一张图来给大家展示一下,什么是金字塔模型:

金字塔算法模型初识

看了这图后,可能有限人应该会有质疑,这很像漏斗原理,对!没错,就跟漏斗原理很像,但是没用金字塔来的励志,大家都希望能够获得金字塔最高峰。

排序筛选过程又是如何的呢?我们引用一下百度搜索研发部文章内的一段内容:

“系统里有n个网页,有m个特征(页面质量、页面内容丰富度、页面超链、文本相关性等)对n个网页有不同的打分,如何根据这些特征的”投票“,选出最适合放在第一位的网页呢?

从选举的例子中,我们可以得到的几个启示:

1. 设计算法时,要避免出现“赢者通吃”带来的信息丢失问题。

2. 不要因为某几个特征特别好,就把某个网页排到最前,或者因为某几个特征特别差,就把某个网页抛弃。

3. 最合适放在首位的网页不一定是在每个特征上都最好,而应该是能够兼顾所有特征,综合表现最好的那个。

4. 搜索引擎使用者对搜索结果的点击行为,可以看成是对搜索结果进行的“投票”,这样的“投票”信息的使用方式,也要注意考虑是否会带来选举过程中出现的种种不合理。

以上提到的种种选举方案,仅仅是对“多候选人单职位的”的情况进行讨论,而搜索引擎面对的问题,则更类似于“多候选人排序”的情况,也即:

系统里有n个网页,有m个特征(页面质量、页面内容丰富度、页面超链、文本相关性等)对n个网页有不同的打分,如何根据这些特征的“投票”,决定n个网页的顺序?

而这个“多候选人排序”问题,是有一个“不可能的民主”的理论的,该理论的大意是,“合理”的民主应该满足3个条件:

1. 如果选民都认为A比B好,那么最终结果应该也是A比B好

2. 没有“独裁者”,也即,不存在这样一个人,无论别人怎么排序,最终结果的排序都和这个人的排序一致

3. 无关因素独立性,也即,在第一次投票完成后,A排在B前面,现在进行第二次投票,如果所有人都没有改变自己投票中A和B的相对顺序,那最终结果应该也是A在B前面

而通过数学的证明,可以得出结论:如果某种选举方式满足条件1和3,则必然不满足2,也即必然存在“独裁者”。

根据“不可能的民主”理论,和搜索引擎结合起来看,似乎搜索引擎很难给出一个合理的网页排序,但是搜索引擎和投票又似乎有所不同,有两个角度可以破解

1. 认为条件3过于强,需要弱化。

2. 也许在网页排序问题上,真的存在这样一个“独裁特征”,这个“独裁特征”从目前看来,最适合的应该就是“用户满意度”了,按照用户的满意程度来排序网页,就是最合理的网页排序。如何衡量“用户满意度”呢?这就是我们一直在努力的。“

相信大家阅读了这段内容后应该深有体会,百度算法和选举制有很大的雷同之处。那么我们做为逆向研究的方向是先从数据展现本身研究得出数据分析原则,这个是一项长期计划,因为我们必须对数以亿计的网站进行分析后才可以得出结论,而事实证明百度排序规则中不仅仅只有一条算法规则,会有多重规则。

前期我也已经开发出一个基于关键词的简单分析程序:

这个工具主要是辅助作用,之前讨论的选举制度主要针对的外链的有效性,而此工具的主要内容是针对相关性,也就是搜索结果最后的排序规则中的先后排序规则。当然这个工具还是处于毛胚状态,很多指标都还是没有加进去,后期大家可以一起参与这份研究,把一些相对比较重要的指标加进去便于我们的研究更加的完善。

如果你是纯粹做一个seoer我觉得到这里,你也可以停止阅读这份研究,因为事实证明,你只要获得最后排序的相关算法即可完成工作,通过此工具你已经能够轻松的获得什么样的密度情况下可以优先获得排名。倘若你在做价值数万的关键词,我觉得你可以继续往下看,因为这里就会讲到选举制度中的外链。

选举制度中的外链其实应该是放在最前面的,因为这是相对比较民主的一次选举,不像上述的内容相关性一样,内容相关性的选举应该是属于百度内部选举制度,是属于第二次选举,而外链选举是属于第一次选举,网站通过外链来证明自己的同时,证明自己被认可。

说到这里我想到站长很头疼的一个问题,也就是什么样的外链才算是真实有效的?很多seo工作者或多或少应该已经建了不少外链,但是实际效果不得而知。

但是你通过选举制度,你可以排除以下几类人选:

1.剥夺政治权益的。进百度黑名单的。

2.政治地位低下的。此站本身质量低下的。

3.无选举权的。也就是不在收录范围内的。

4.与选举无关的。什么叫与选举无关?这里其实包含了这么几个意思,一是说此站内容相关性不高,二是说此站不是真心选举你的,甚至是不认识你。这也是百度近期的回复中多次提及的内容“真心推荐”。

如果你已经理解了选举制度,相信到这里你会变的相对比较明朗,但是你要非常的清楚去认识一件事情也就是什么样的选举?选举制度可以一次性全员投票,也可以级级选举。

所以说对于外链的建设,本身也是一个选举与被选举的规则,百度官方很有可能近期也会放出外链查询工具,告诉你什么外链有用什么外链没用,我也会在下一期的时候给出相应的工具或者是判断方案。

来源:左倾观测站投稿,原文链接。

来源:月光博客


Public @ 2020-06-20 16:17:26

网站降权如何恢复排名?

为什么想到写这个主题呢?中午发朋友圈刚好有朋友问到,所以就再来写一写,希望给一些新入门SEO的朋友多了解下。在说恢复排名方法前,小编再多说几句:1、文中的“试试”,真的是试试做,不能百分百保证恢复;2、本标题里没有写“快速”恢复排名二字,正规SEO没有快速一说;3、一般三五年以上老SEO,一般不会去问为什么降权,因为大多心里有数;4、现在做SEO的心态都太急了,或者说有的又太把SEO当救命稻草了;

Public @ 2013-08-11 15:38:19

用户行为方式影响搜索排名的猜想

前两天看到一个报道,Google会根据用户是否点击广告,调整广告显示方式。在Google搜索结果中,最上面通常有一两个浅兰色背景的Adsense广告。如果用户一直不点击这些广告,Google就会把上面的广告拿掉,只显示右边的广告。我试了半天也并没看到这个效果,应该还处在实验中。这是又一个Google跟踪用户行为方式的例子。以前就谈过Google很有可能通过工具条等方式收集用户行为方式,并调整排名结

Public @ 2010-03-23 16:12:13

为什么搜索链接可以搜到网站,但搜索网站名称,却找不到?

搜索网站链接可以搜索到,指的是如下方式:image.有时候搜索链接可以搜到网站,但搜索网站名称,却找不到,这是为什么呢?1、如果网站名称是比较常见的词汇,如:xx人才招聘网、xx论坛  这样的词竞争比较大,前几页就没那么容易可以排上来。2、可以尝试搜索下网站多个内页的标题,完整地搜索下。如下:image.如果链接被收录的内页完整标题大部分还是搜索不到,那说明网站还几乎没权重。可能原因是:

Public @ 2009-04-11 16:18:37

浅谈SEO和搜索引擎

时下,SEO盛行,不管黑帽白帽灰帽什么的,还是各种帽子混合戴的,最近几年,SEO之风大行其道。有人说,SEO那是在和搜索引擎斗智斗勇;有人说,SEO是在追随搜索引擎的脚步,都是为了用户体验。搜索引擎对待SEO的态度我们暂且认为正如他们官方所说的,支持白帽,反对黑帽。究竟是什么,我们也不知道。在SEO如此盛行之下,搜索引擎自然是对SEOER的各种操作做了各种对应的规则算法,至于是哪些规则算法,我也不

Public @ 2011-10-05 16:14:28

更多您感兴趣的搜索

0.411139s