robots.txt 是放在网站根目录下的一个纯文本文件,用来告诉搜索引擎的爬虫哪些地址可以抓、哪些不要抓。它体积很小,作用却不小:写对了能帮爬虫把抓取预算花在真正重要的页面上,写错了则可能让整站从搜索结果里消失。
文件放在哪、名字怎么写
这个文件必须放在站点的根目录,文件名固定为 robots.txt,且只有这一个位置有效,子目录下的同名文件不会被识别。文件里由若干条记录组成,每条记录以爬虫标识开头,用来指定规则适用的对象,后面跟着允许或禁止的路径指令。多条记录可以共用同一组规则,具体写法要看站点使用的爬虫标识。
几条最常用的规则
想允许全部抓取,禁止项后面留空即可;想禁止抓取某个目录,就把该目录路径写在禁止项后面。需要注意的是,路径是区分大小写的,禁止项表示"不要访问以该字符串开头的地址"。此外,可以在文件里声明站点地图的位置,方便爬虫顺藤摸瓜找到全部页面。
允许与禁止怎么配合
当同一个目录下只有少数几个地址需要放开时,可以先用禁止项拦住整个目录,再用允许项把需要的地址单独放出来。规则匹配遵循"路径写得越具体越优先"的原则,所以先写宽泛的禁止、再写具体的允许,顺序上更符合预期。调试阶段可以把规则拆得细一些,稳定之后再合并简化。
最容易踩的几个坑
最常见的是把禁止项写成一条斜杠加星号,这一条等于让爬虫不要抓取任何页面,整站会逐步从搜索结果的索引中退出。其次是拿 robots.txt 当保密手段——被它拦下的地址只是不被抓取,文件本身是公开的,任何人输入路径都能看到,反而等于把不想公开的目录列了出来。真正涉及安全的目录,应当靠权限控制来保护。第三是把规则写得过于零碎,今天封这个、明天封那个,时间一长连自己都记不清原因,建议在文件里写清备注。
改完要验证
修改 robots.txt 之后,建议用搜索平台提供的抓取测试工具验证一下效果,确认重要页面没有被误伤。对于大型改版,还应把旧地址的跳转和新文件一起规划,避免过渡期出现大面积抓取失败。
关于冉冉科技
江苏冉冉信息科技有限公司(品牌"冉冉科技")成立于2017年,位于江苏省常州市新北区,是一家从事互联网信息服务、电子商务应用与企业应用系统开发的技术服务企业。公司业务涵盖网站建设、网页设计、SEO优化、竞价包年、域名注册、虚拟主机、企业邮箱、整合营销及企业形象策划等,以"只做有效果的网络营销"为服务主张,累计完成三千余起网站建设与服务。

冉冉科技

商务咨询