简答:Gemini 这边没有需要放行的爬虫,也没有可查的日志行。开关是 Google-Extended,一项使用控制;除此之外你做的都是常规的抽取功课,作用在 Google 已经拿到的页面上。
是声明,不是抓取
Google 文档说明 Google-Extended 决定已被抓取的内容能否用于训练 Gemini 模型、以及在 Gemini Apps 与 Vertex AI 中为回答提供 grounding,同时明确不影响 Google 搜索的收录与排名。因为它管的是使用而不是抓取,它被遵守时你的日志里不会出现任何请求。你这一侧没有任何东西可验证。
实际后果是:把这个决定和它的理由写在 robots.txt 里那条规则旁边。一年后读这个文件的人不会记得哪一行是有意为之。然后在真正可观察的地方衡量效果——在固定问题集上看 Gemini 的提及率与引用率,与没有施加此类控制的引擎作对照。
另一个值得知道的代理
Google 还文档化了 Google-CloudVertexBot:它在站点所有者自行请求时抓取站点,用于构建 Vertex AI Agent。只有当你用自己的内容构建 Agent 时才相关——它不是通用检索代理,除此之外封掉它没有任何代价。
什么能推动 Gemini 的回答
既然索引与搜索共用,可优化的面就是抽取而不是访问:
- 标题写成人真实会问的问句,一个标题一个问题。
- 答案在标题下第一句,并点明主语。
- 想被准确陈述的事实用结构化数据——它仍然是让一条事实在抽取时不走样的最便宜方式。
- 写明确日期,因为 grounding 更青睐能被放进时间线的内容。
Gemini 这边你控制的是声明和页面。中间发生的事你控制不了也看不到——所以衡量要建在答案侧,否则就是盲飞。