定义

robots.txt 是站点根目录下的一个文件,声明哪些爬虫可以抓取哪些路径。它是「守规矩的爬虫会遵守的声明」,不是强制手段,也完全不涉及页面被抓走之后会发生什么。

为什么重要

它是最容易写错、也最容易修好的东西。一条位置不对的 disallow 就能让站点同时从所有答案引擎里消失,而在此期间站点表面看不出任何异常。

如何衡量

按 User-Agent 逐个解析这个文件,而不是从上往下读:最具体的匹配组生效,后面的通配组对已有专属组的代理并不适用。之后再用真实请求验证。