SEO技巧-怎样核对抓取限制:多人协作可执行清单

📍 WDQWDWQD987AAAAA:216.73.216.195
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /690f0ea26f21.html
📄

SEO技巧-怎样核对抓取限制:多人协作可执行清单

核对抓取限制,目标是确认搜索引擎能抓到什么、抓不到什么,以及限制是人为设置还是技术故障。多人协作时,把“谁查、查什么、结果代表什么”写清楚,能减少返工。下面按检查项给出可执行清单,每项包含要查什么、怎么查、结果说明什么。

先查 robots.txt 是否放行了目标路径

要查什么:目标页面路径是否被 Disallow 规则挡住,规则是否误伤整站或整目录。

怎么查:打开站点根目录下的 robots.txt,逐条读 User-agent 与 Disallow。用搜索引擎官方提供的 robots.txt 测试工具,输入具体 URL 验证。不要只看文件开头,通配符和结尾规则往往在后面。

结果说明什么:若测试显示“被屏蔽”,说明抓取限制来自 robots 规则,需要改规则后重新验证。若显示“允许”,robots 不是原因,继续查下一项。注意:robots.txt 只约束合规抓取,不等于页面一定被收录。

再查页面级 robots 元标签与响应头

要查什么:页面 HTML 里是否有 <meta name="robots" content="noindex"> 或 nofollow;HTTP 响应头是否带 X-Robots-Tag。

怎么查:查看页面源代码的 <head> 部分,搜索 robots。用命令行查看响应头,例如 curl -I 页面地址,看是否返回 X-Robots-Tag: noindex。模板批量生成时,重点查页头模板和服务器配置。

结果说明什么:出现 noindex 表示该页被明确要求不进入索引,属于主动限制。若只有 nofollow,页面仍可能被抓取,但链接权重传递受限。响应头与元标签冲突时,更严格的一方通常生效,需以实际抓取测试为准。

确认是否存在登录、付费或地域访问限制

要查什么:目标内容是否必须登录、付费或特定地区 IP 才能看到。

怎么查:用未登录浏览器、无痕窗口访问同一 URL,对比登录后的内容差异。若页面主体在登录后才出现,抓取工具看到的往往是登录墙或空壳。地域限制可用不同地区的网络环境测试,但要注意合规。

结果说明什么:若未登录状态只能看到提示文字,说明抓取受到访问权限限制。此时要判断:是内容本就不该公开,还是应该给搜索引擎提供可抓取的公开版本。后者需要产品与开发共同决定,不是单靠 SEO 改标签能解决。

检查服务器返回状态与抓取频率限制

要查什么:服务器是否返回 403、429、503,或对同一 IP 限速。

怎么查:用 curl -I 或浏览器开发者工具看状态码。429 表示请求过多,403 表示拒绝访问,503 表示服务暂不可用。查看服务器访问日志中搜索引擎爬虫的响应分布,统计 2xx、3xx、4xx、5xx 比例。

结果说明什么:大量 429 或 503 说明抓取被频率或稳定性限制,可能是防护策略过严或服务器容量不足。403 可能是防火墙、CDN 或安全插件拦截。要区分“已经定位的原因”和“可能原因”:日志显示某爬虫全部 403,才能说拦截已定位;只看到少量 403,还需继续排查。

用抓取工具做一次可交付的验证记录

要查什么:把上述检查结果整理成一份可交接的记录,避免不同人重复排查。

怎么查:按以下步骤执行:

  1. 列出需要核对的 URL 清单,标注优先级。
  2. 对每个 URL 记录 robots.txt 测试结果、页面 robots 标签、响应头、HTTP 状态码、未登录可见性。
  3. 用搜索引擎官方抓取测试工具提交单个 URL,记录返回的抓取状态与阻塞原因。
  4. 把“已定位原因”和“待验证假设”分两栏写,附上检查时间和执行人。

结果说明什么:如果同一 URL 在多项检查中都显示允许,但抓取测试仍失败,问题可能在服务器稳定性、DNS 或 CDN 层,需要开发介入。记录中要写清适用条件,例如“该结论仅对未登录桌面版有效”。

下一步:挑一个代表性 URL,按上面五项做成表格,交给开发或运维确认可改动范围。改动前后对比时,考虑季节、搜索需求变化和数据采集差异,不要用单日数据下结论。

图1 图2

nginx