定义
robots.txt 是站点根目录下的一个文件,声明哪些爬虫可以抓取哪些路径。它是「守规矩的爬虫会遵守的声明」,不是强制手段,也完全不涉及页面被抓走之后会发生什么。
为什么重要
它是最容易写错、也最容易修好的东西。一条位置不对的 disallow 就能让站点同时从所有答案引擎里消失,而在此期间站点表面看不出任何异常。
如何衡量
按 User-Agent 逐个解析这个文件,而不是从上往下读:最具体的匹配组生效,后面的通配组对已有专属组的代理并不适用。之后再用真实请求验证。
两者在技术访问与内容质量上重叠;但 GEO 衡量的是答案本身——品牌是否被点名、被推荐、被引用——而不是排名位置。
保持问题集稳定并按固定频率复测,再做同口径比较;同时改问题和频率会让结果失去可比性。
不等于。页面可能只是作为背景被引用,而真正被推荐的是竞品;两者使用独立口径报告。
草稿可以由 AI 生成,但发布的每一篇都经过人工审阅 —— 没有内容会自动上线。
有重叠但不相同。两者都奖励清晰可信的内容;但只有一边的衡量标准是「模型是否在答案里点名你」。
来自产品里衡量的真实做法 —— 官网的说法和工作台里的数字指的是同一件事。