飓风算法针对的是内容采集、拼接和低质聚合。对老站来说,寻找改进空间的核心不是继续堆旧页面,而是先找出哪些内容属于采集或拼凑、哪些页面已经失去用户价值,再决定清理、改写还是合并。判断起点可以很简单:从流量最高和收录最多的栏目中各抽10个页面,逐篇问三个问题——内容是否由本站原创或深度加工、是否解决了具体问题、用户停留后是否还需要返回搜索。只要有一项明显为否,这个页面就进入了待处理清单。
老站流量下滑时,容易把所有问题都归因于算法。更稳妥的做法是先做一次分离检查:
这里的判断依据是:飓风算法处理的是内容层面的问题,抓取、索引、排名是不同环节。一个页面没流量,可能是没被收录,也可能是被收录但没有排名,还可能是排名有了但用户不点。把这三类混在一起,改进动作就会失焦。
老站常见的高风险页面有四类:直接复制其他站点内容的页面、把多篇文章拼接成一篇的页面、只改标题不改正文的页面、由程序批量生成且没有人工审核的聚合页。可以用下面的步骤做一次小范围盘点:
如果某个页面的正文与外部来源高度一致,且没有加入本站的数据、案例、步骤或判断,那么它被判定为低质采集内容的可能性就较高。反过来,如果页面虽然引用了外部信息,但加入了可执行的步骤、对比依据或适用条件,它更接近深度加工内容,不一定要删除。
找到高风险页面后,不要一律删除。可以按下面的条件做选择:
判断结果可以这样验收:处理后的页面在四周内重新被抓取,索引状态正常;站内重复标题数量下降;用户从搜索结果进入后的跳出行为没有恶化。这里不承诺固定见效时间,因为抓取和重新评估需要周期,不同站点的抓取预算也不同。
老站寻找改进空间,最终要形成一份可以复查的清单,而不是一次性的感觉。清单至少包含四列:页面地址、风险类型、处理动作、复查日期。风险类型可以写成“采集”“拼接”“低质聚合”“内容过时”。处理动作可以写成“删除”“改写”“合并”“保留观察”。复查日期用来确认动作是否执行、页面是否重新被抓取。
一个可执行的短例子:假设某老站有一个“行业资讯”栏目,其中30个页面由程序抓取外部摘要生成,每个页面只有三行文字。第一步,把这30个页面导出;第二步,逐篇检查是否有本站补充的评论、数据或步骤;第三步,对没有补充的页面执行删除或合并;第四步,对保留的页面补充至少一段本站判断,并说明适用条件。这个例子的前提是站点确实存在这类页面,不能把假设当成真实项目成果。
不要一次性改完整站。先选一个内容量在20到50个页面之间的小栏目,按上面的清单完成一轮清理和改写,记录处理前后的索引数量、展示数量和用户停留情况。等这一轮能稳定复查后,再把同样的方法扩展到下一个栏目。这样做的原因是,老站的改进空间往往分散在多个栏目里,小范围验证能帮你确认哪类处理动作真正适合当前站点,再决定是否放大。