抓取、索引和排名是三个前后衔接但彼此独立的环节。抓取是搜索引擎发现并读取页面;索引是把读取到的内容存入可供检索的数据库;排名是用户搜索时,系统从已索引内容中挑选并排序结果。页面没有被抓取,就谈不上索引;没有被索引,就不会出现在自然搜索结果中;已被索引,也不等于能排在前面。定位问题时,先确认卡在哪一环,再决定优化方向。
假设你负责一个企业博客,新发布了一篇产品选型指南。三天后,用站点品牌名加文章标题搜索,找不到这篇文章。此时不要直接判断“排名不好”,因为排名的前提是页面已经被索引。可以按下面顺序收集证据:
site:加具体文章网址查询。如果返回该网址,说明它已进入索引;如果没有返回,可能是未索引,也可能只是该查询方式没有展示,需要结合其他证据。200表示可正常访问,404表示页面不存在,5xx表示服务器错误。持续返回错误会阻碍抓取和索引。<meta name="robots" content="noindex">标记。这个标签会明确要求搜索引擎不要索引该页。它和nofollow不同,后者针对链接跟踪,不直接阻止当前页面被索引。robots.txt是否屏蔽了该目录或该网址。被屏蔽后,搜索引擎可能无法抓取页面内容,自然难以建立索引。如果以上检查都正常,页面也已出现在site:查询结果中,但目标搜索词下排名很靠后或没有排名,问题才进入排名环节。此时要比较的是内容相关性、页面主题集中度、外部链接、用户互动信号以及竞争页面强度,而不是继续修改抓取设置。
抓取环节关注搜索引擎能否访问页面。可观察服务器日志中的爬虫请求、抓取频次、响应状态码,以及robots.txt是否放行。常见错误是把“服务器日志里没有记录”直接等同于“页面被封禁”,实际上还可能是页面刚发布、内链太少、站点整体抓取预算有限,或爬虫尚未再次访问。
索引环节关注页面是否被存入可检索库。可观察site:查询、索引状态报告(如果所用工具提供)、页面是否被规范标签指向其他网址。常见错误是看到“已抓取—尚未索引”就认定内容质量差,实际原因可能是页面重复、内容太薄、规范标签选错,或站点整体可信度不足。需要逐项排除,而不是只改标题。
排名环节关注特定查询下的位置和展现。可观察目标词的自然结果位置、标题和描述是否被改写、点击率与展现量变化。常见错误是把排名波动全部归因于算法更新,却忽略页面改版、竞争对手新增内容、搜索意图变化等更直接的原因。
200、无noindex、robots.txt放行:问题更可能在索引环节,检查规范标签、重复内容和内链。404或5xx:先修复可访问性,抓取和索引都无从谈起。robots.txt屏蔽了该网址:抓取被阻止,索引通常也无法完成。需要确认是有意屏蔽还是配置错误。noindex:这是明确的“不要索引”指令。如果本意是允许索引,应移除该标签并等待重新抓取。这张表的用法是:先用最直接的证据确定环节,再进入该环节的优化,而不是同时修改标题、描述、内链和服务器配置。一次只改一个变量,后续才能判断哪项调整真正起了作用。
第一,被抓取不等于被索引。搜索引擎读取了页面,仍可能因为内容重复、质量判断、规范标签指向他处而不将其纳入索引。第二,被索引不等于有排名。一个页面可以存在于索引中,但对某个具体查询没有进入可见结果,或者只在不常见的长尾查询下出现。把这两组关系分开,才能避免用“排名差”去解释一个其实尚未被索引的页面。
下一步,选一个你怀疑有问题的具体网址,按上面的顺序记录四项证据:网址查询结果、HTTP状态码、robots.txt放行情况、页面是否有noindex。四项证据齐了,再判断该修抓取、修索引,还是进入排名优化。