要回答“检查前需要准备哪些信息”,核心是先把 robots.txt 的现状、目标与影响范围整理清楚。你需要准备四类材料:当前 robots.txt 的完整内容、站点希望抓取和禁止抓取的路径清单、各路径对应的实际 URL 示例,以及可验证这些 URL 返回状态与页面用途的工具或记录。没有这些信息,直接改文件很容易误封重要页面,也无法判断某条规则是否真的生效。
先获取线上正在使用的 robots.txt,而不是本地草稿。检查项如下:
https://你的域名/robots.txt,再用命令行 curl -I https://你的域名/robots.txt 查看状态码和内容类型。注意,robots.txt 的抓取限制不等于可靠的索引移除。即使禁止抓取,已收录的 URL 仍可能出现在搜索结果中,因为索引移除需要额外的机制。
写 robots.txt 之前,先列出你希望搜索引擎抓取和不抓取的目录、文件类型或具体页面。每一条都要有真实 URL 作为验证样本。
Disallow: / 会阻止整站抓取,除非你确实希望如此。路径匹配是前缀式的,Disallow: /admin 也会影响 /admin-guide 这类页面,需要逐条核对。站点地图不保证收录,它只是发现 URL 的辅助手段。把站点地图写进 robots.txt 可以帮助搜索引擎找到它,但不能替代对可抓取性的判断。
不同搜索引擎对 robots.txt 的指令支持并不完全一致。准备信息时,要明确你关注的是哪个搜索引擎,并分别核查。
Allow、Sitemap、通配符 * 和结尾符 $。curl 获取文件后人工比对路径匹配结果。HTTPS 不保证安全无漏洞或排名提升,它只表示连接加密。准备信息时不要把 HTTPS 与 robots.txt 的抓取控制混为一谈。
在原有项目上改进 robots.txt,属于变更操作。检查前应准备好当前版本、拟修改内容、修改原因和回滚方式。
curl 确认返回内容与预期一致。判断结果时,以“目标 URL 是否仍可被抓取”和“禁止路径是否确实被覆盖”为准,而不是只看文件是否上传成功。下一步,你可以先完成第一项检查:获取当前 robots.txt 的完整原文和状态码,再与你的允许、禁止清单逐条比对。