抓取、索引和排名是三个先后不同的环节:抓取是搜索引擎发现并下载页面,索引是判断页面是否值得存入可检索的数据库,排名是用户搜索时从已索引内容中挑选并排序。判断问题时,先确认页面有没有被抓取,再确认有没有被索引,最后才看某个词下的排名。把这三步混在一起,最容易把“没排名”误判成“被惩罚”,或把“没索引”误判成“内容质量差”。
面对一个页面表现不佳,可以按顺序问三个问题。第一,搜索引擎是否知道这个网址存在?第二,它是否把该网址收录进可搜索的结果?第三,针对目标查询,它是否把该网址排在前列?
这三层的判断依据不同。抓取看日志和入口,索引看收录状态,排名看查询结果和效果数据。任何一层没通过,都不应该直接跳到下一层下结论。
抓取成功不等于索引成功。搜索引擎可以频繁访问一个页面,但仍然决定不把它放进索引。常见原因包括内容与已有页面高度重复、页面价值判断不足、技术结构让正文难以提取,或者页面被设置为不索引。
反过来,索引也不等于排名。一个页面被收录,只说明它具备参与排序的资格。用户搜索某个词时,搜索引擎还要比较大量已索引页面,结合查询意图、内容匹配度、链接关系和用户体验信号给出顺序。索引是入场券,排名是比赛结果。
可以做一个简单检查:如果站点查询显示网址已收录,但目标词下找不到,问题在排名层;如果站点查询显示未收录,但日志里有爬虫访问,问题在索引层;如果日志里没有爬虫访问,问题在抓取层。这个判断顺序能避免在错误环节反复调整。
三层问题的修复代价不同,选择顺序也不同。
适用条件是:你手里至少有一个明确网址和一个明确目标查询。如果连这两个都没定,先不要谈排名,先把要观察的页面和词固定下来。
假设你发布了一篇新文章,三天后搜标题找不到。可以按下面步骤排查:
<meta name="robots" content="noindex">,以及canonical是否指向了其他网址。这个顺序的判断结果是:抓取问题改入口,索引问题改页面状态,排名问题改内容与竞争策略。三者不能互相替代。
选一个你正在关注的网址和一个目标查询,按“日志→索引状态→排名位置”的顺序记录一次现状。只记录事实:有没有爬虫访问、有没有被索引、目标词下有没有出现。把这三项写清楚后,你就知道下一步该修哪一层,而不是同时改标题、改内容、改链接却不知道问题出在哪里。