检查一份 robots.txt 写法是否正确,动手前至少要准备好四类信息:站点真实 URL 结构、需要放行或屏蔽的具体路径、目标搜索引擎对语法的支持情况,以及修改后的验证与回滚方式。缺少其中任何一项,检查都会变成凭感觉判断。
检查 robots.txt 的最终交付物通常是一份可上线的规则文件,外加一份说明:哪些路径被允许、哪些被禁止、依据是什么。围绕这个结果,需要准备的资料包括:
这些资料的作用是让每一条规则都能对应到一个真实 URL,而不是凭印象添加。
检查时常见的分歧是:用 Disallow 屏蔽路径,还是用 Allow 在已屏蔽目录中开一个口子。两者适用条件不同。
Disallow: /assets/ 之后需要 Allow: /assets/css/。此时要确认目标搜索引擎是否支持 Allow 指令,并注意规则匹配按最长路径优先。判断方法是:先问“这个路径是否必须被抓取”。必须抓取就放行,不必抓取就屏蔽,两者都不确定时先保持现状,不要贸然改动。
准备好资料后,按以下顺序核对,可以避免大部分低级错误:
robots.txt,子目录中的同名文件无效。Disallow: / 且没有对应的 Allow 例外。Sitemap: 行使用完整 URL,且该地址可以访问。其中“整站误封”是最需要优先排查的一项,一旦上线,影响范围最大。
规则写完后,验证环节需要明确谁来做、用什么方式做。可执行的做法是:
需要提醒的是,robots.txt 的抓取限制不等于可靠的索引移除。如果页面已被收录,仅靠屏蔽抓取通常无法让它从搜索结果中消失,这种情况需要配合其他移除手段,并分别核查各搜索引擎的支持情况。
下一步建议先把当前线上 robots.txt 完整保存一份作为回滚基线,再对照上面的检查项逐条核对,确认无误后再提交修改。