核对抓取限制,核心是确认搜索引擎到底能不能、愿不愿意抓取你的产品页。最直接的做法是:先用抓取工具模拟访问,再对照robots.txt、页面meta robots、X-Robots-Tag和服务器返回状态码,逐项确认没有拦截。下面这份清单按顺序执行,适合第一次接触这个问题时快速定位起点。
打开浏览器访问站点根目录下的 /robots.txt,找到 User-agent 段和对应的 Disallow 规则。
Disallow。Disallow: / 会屏蔽整站,Disallow: /*?sort= 这类通配可能屏蔽带参数的筛选页。在浏览器打开产品页,查看源代码中的 <meta name="robots">。再用命令行或抓包工具查看HTTP响应头里是否含 X-Robots-Tag。
noindex、nofollow、noarchive 等指令。noindex 表示即使能抓取也不索引,这是收录失败最常见的原因之一;nofollow 只影响链接追踪,不等于页面不能被索引。使用搜索引擎官方提供的抓取测试工具,或通过 curl 指定常见搜索引擎爬虫的User-Agent请求产品页。
curl -I -A "Mozilla/5.0 (compatible; Googlebot/2.1)" https://你的域名/产品页,观察状态码与响应头。200 表示可正常抓取;301/302 要看最终落点是否为目标页;403/429 可能是服务器或防火墙拦截;503 多为临时不可用。若返回内容与用户看到的不同,可能是服务端按UA做了差异化输出。有些产品页需要登录、选择地区或带特定参数才能看到完整内容,这类限制会直接影响抓取。
逐项记录:robots.txt是否放行、meta/X-Robots-Tag是否含noindex、模拟抓取状态码、登录与地区限制。四项都通过,说明抓取限制不是收录问题的主因,应转向内容质量、内链和重复页面排查。任意一项不通过,先修复该项再复测。
修改前后比较时,要考虑季节、搜索需求变化和数据采集差异,不要用单日数据判断效果。下一步:选一个未被收录的产品页,按上述清单逐项打勾,把不通过的项作为第一优先修复对象。