网站上线后,搜索引擎爬虫最先访问的文件往往就是根目录下的 robots.txt。这份文本文件相当于给爬虫画出的"参观路线图",哪些页面可以抓取、哪些目录必须绕行,全靠它来声明。一套合理的 robots.txt 配置,不仅能保护后台数据不被索引,还能把爬虫的抓取精力引导到高质量内容上,直接影响网站的收录效率和搜索排名表现。
robots.txt 必须保存在站点根目录,例如 https://yourdomain.com/robots.txt,文件命名区分大小写,推荐使用 UTF-8 无 BOM 编码。每条规则独占一行,行末切忌残留空格或隐藏字符。要写出靠谱的规则,首先要吃透下面几个核心参数。
除了以上基础指令,很多人还会顺手加入 Sitemap 行,告知爬虫网站地图的地址。下面是一个常见的组合配置:
User-agent: *
Disallow: /admin/
Allow: /admin/public/
Sitemap: https://yourdomain.com/sitemap.xml
这段规则的意思是:全站默认可抓取,唯独 /admin/ 目录被屏蔽,但其中的 /admin/public/ 子目录作为特例放行。这里藏着最典型的坑:一款爬虫若不认识 Allow 指令,它只会看到 Disallow 的存在,于是 /admin/public/ 对这类爬虫仍然是不可进入的状态。
不同站点的业务诉求差异很大,robots.txt 的内容也五花八门。这里整理了三套最常见的配置模板,基本能满足绝大多数普通网站的日常需求,你可以直接复制后替换成自己的目录结构。
对于内容型博客或者刚上线的品牌官网,通常巴不得所有页面都被搜索引擎收录。此时只需写下一行极简规则:
User-agent: *
Disallow:
事实上,把这行 Disallow 彻底删掉,效果完全相同。最该警惕的是手误写成 Disallow: /,这等于给所有爬虫都上了锁,收录数量会在一夜之间归零。修改之后,记得去各搜索引擎的站长工具里用抓取测试功能复核一遍,确认规则真实生效。
如果你不想让某个特定的搜索引擎抓取站点,只需要给该爬虫单独写一条规则:
User-agent: Bingbot
Disallow: /
这种写法只约束 Bingbot 这一款爬虫,对其他搜索引擎的抓取策略毫无影响。需要留心的是,爬虫的 User-agent 名称必须拼写准确,比如谷歌是 Googlebot、百度是 Baiduspider,拼错任何一个字母都会导致规则失效。
有些网站需要隐藏某个功能目录,但其中的某个子路径又希望对外可见。这个时候就需要依赖于 Allow 的优先级:
User-agent: *
Disallow: /private/
Allow: /private/demo/
绝大多数主流搜索引擎在遇到冲突规则时,会优先采用更具体路径对应的指令,因此 /private/demo/ 通常可以被正常抓取。但请务必在实际部署前用抓取测试工具逐条验证,因为个别爬虫对优先级处理方式并不同于主流搜索引擎。
robots.txt 写错之后的故障表现往往是隐蔽的,比如收录量缓慢下滑、某个页面明明提交了却迟迟不更新。以下错误值得对照自查。
一套好用的 robots.txt 配置,不是在追求规则越多越好,而是遵循几个基本准则。
第一,把规则写得越具体越好。能用具体文件名解决的,就不要用目录级别的屏蔽;能用具体目录解决,就不要去动根路径。这样能最大限度降低误伤其他正常页面的可能性。第二,保持文件简洁清晰,每条规则只服务一个目的,避免在同一个文件里堆叠大量相互交叉的限制条件。第三,定期复查,随着网站结构调整和页面改版,当初写在文件里的规则很可能已经不再适用,至少每隔一个季度就要重新审视一遍。
会。robots.txt 本身就是公开文件,任何人都能直接访问看到内容。如果把后台目录、登录接口等敏感路径写进 Disallow,实际上等于在向别人指路。因此只需要在 robots.txt 里声明需要拦截爬虫的目录,真正的安全防护必须依赖服务端权限控制与登录校验,绝不能只靠 robots.txt 来保护敏感数据。
没有统一的时间表。搜索引擎爬虫通常有各自固定的抓取频率,有些爬虫几小时内就会重新读取,有些则可能需要几天甚至更久。你可以在搜索引擎的站长工具后台手动请求抓取 robots.txt,这会显著缩短等待时间,但最终的生效时长仍然完全由爬虫方决定,无法人为精确控制。
绝大多数原因出在文件路径、编码格式或指令语法上。首先确认文件是否位于域名根目录且文件名完全小写;其次检查保存时的编码是否为 UTF-8,避免 BOM 头混入文件开头;最后逐行检查每条规则是否合法,比如 Disallow 后面有没有漏掉空格。如果以上都排查过仍然无效,建议使用搜索引擎的 robots 测试工具抓取一次网页,查看返回的具体解析结果,能快速定位问题所在。
robots.txt 虽然只是一个小小的文本文件,却掌控着爬虫与网站之间的沟通入口。配置得当,它能帮网站把有限的抓取预算集中到关键页面上,提升整体收录质量;配置失误,则可能带来收录骤减甚至站点被完全忽略的严重后果。建议你花十分钟检查一遍当前站点的 robots.txt 文件,对照本文提到的常见错误逐项排查,并且务必在修改后利用搜索引擎官方的抓取测试工具确认每条规则都按照预期生效。这一份基础的日常维护工作,往往能避免日后许多麻烦。