区分 robots 文件设置正常与异常,核心看三点:文件能否被公开访问、语法是否被正确解析、限制结果是否符合你的本意。正常结果是目标抓取方按规则放行或屏蔽了指定路径,异常结果则是文件读不到、规则写错,或屏蔽范围超出预期,导致该收录的页面被挡在门外。
在浏览器中打开你的域名根目录下的 robots.txt 地址,观察返回内容。这一步只验证文件是否公开可读,不代表搜索引擎一定已经采用。
如果站点有多个子域或测试环境,要分别检查,不能只看主域。
robots.txt 的常见语法错误包括:把 Disallow 写成 Dissallow、路径缺少开头的斜杠、用通配符时超出支持范围、在规则行中间加注释。判断方法是逐行核对字段名、冒号和路径。
正常与异常的对比依据如下:
/admin/,写成 Disallow: /admin/ 属于正常;写成 Disallow: admin/ 可能不按预期匹配。Disallow: / 再加 Allow,顺序和支持范围不同,结果可能相反。User-agent 段,要确认目标抓取方落在哪一段,而不是只看第一段。这里的关键判断是:规则是否精确指向你希望限制的路径。限制过宽会挡住正常页面,限制过窄则等于没挡。
不要只凭肉眼判断。可以按下面步骤做一次实际核查:
适用条件是:你已经有明确想放行和想屏蔽的路径清单。若清单本身模糊,先整理清单,再谈正常或异常。判断结果是:测试显示“允许”的页面确实是你想公开的,测试显示“屏蔽”的页面确实是你不想被抓取的。
robots 文件设置正常,不等于页面一定被收录;设置屏蔽,也不等于页面一定从索引中消失。抓取限制和索引移除是两件事。一个页面被 robots 屏蔽后,仍可能因为外部链接等原因出现在搜索结果中,只是摘要信息可能受限。
复查时重点看:
如果发现异常来自规则过宽,处理方式是缩小屏蔽路径,再重新测试;如果异常来自文件无法访问,先恢复文件可读,再检查服务器配置和重写规则。
整理一份当前 robots 规则与目标路径的对照表,逐条标注“想放行”或“想屏蔽”,然后用抓取测试工具逐条验证。对照表里出现无法判断归属的路径时,先按放行处理,确认页面价值后再决定是否屏蔽。