抓取、索引和排名是三个先后不同、可以分别失败的环节。区分它们最可靠的方法不是猜,而是按顺序取证:先确认搜索引擎是否来过并取走了页面,再确认页面是否进入可检索的索引,最后才看它在某条查询下处于什么位置。只要前一步没有证据,后一步的异常就不能归因于排名。
要查的是服务器日志或搜索引擎提供的抓取统计,而不是搜索结果页面。查法:在日志中筛选该搜索引擎的抓取代理,观察目标 URL 的响应状态码、抓取时间和抓取频次。结果说明:出现 200 表示抓取成功;出现 5xx 说明服务器当时出错;出现 403 或 429 说明被拒绝或限流;完全没有记录,说明该搜索引擎尚未抓取这个 URL,此时讨论索引和排名都为时过早。
适用条件是你能拿到日志或有验证过的站点后台数据。如果两个渠道都拿不到,只能把抓取状态标为“未知”,不能默认它已经抓过。
要查的是该 URL 是否处于可被检索的状态。查法:用 site: 限定该 URL 做一次查询,再配合页面本身的 <meta name="robots">、X-Robots-Tag 响应头和 robots.txt 逐项核对。结果说明:能查到该 URL,说明它至少进入了可检索集合;查不到则有多种解释,可能是尚未索引、已被移除、被 robots 规则挡住,也可能只是该查询没有触发它,不能只凭一次查询断定“没被索引”。
更稳的做法是同时看搜索引擎提供的索引状态说明与日志中的抓取结果,两者一致时结论才可靠。若日志显示抓取成功、页面又允许索引,但长期查不到,应优先检查内容是否与已有页面高度重复、是否被规范化指向了别的 URL。
要查的是某个具体查询、某个地区、某种设备下的位置。查法:固定查询词、地区、语言和设备,在无个性化干扰的条件下记录目标 URL 出现的位次,并隔一段时间重复同样的记录。结果说明:位次波动属于正常现象;如果同一查询下目标 URL 从未出现,而其他页面出现,说明问题更可能在页面与查询的相关性上,而不是抓取或索引。
这里要分清网页搜索、平台推荐和付费广告:付费广告的展示位置由投放设置决定,与自然排名不是一回事,不能用广告位次推断自然表现。
site: 查询并对照后台索引信息。查不到时列出至少两种可能原因,逐一排除,不要只认一种解释。把“搜不到”直接等同于“没被索引”,是最常见的误判。搜索结果不显示某 URL,可能只是该查询没有匹配到它。反过来,把“能被搜到”等同于“排名好”,也不成立,能检索到只说明它进入了索引集合。
另一个边界是时间:抓取到索引、索引到稳定排名都可能存在延迟,单次观测不足以定论。假设某页面今天被抓取、明天查不到,这既可能是尚未完成索引,也可能是被规则挡住,需要按上面的清单逐项验证,而不是直接判定为降权。
下一步:挑一个你正在关注的具体 URL,按清单顺序记录抓取、可索引性、索引状态和排名四组证据,再根据第一个出现否定结果的环节决定优化方向。