闸门 1 robots.txt
闸门 2 爬虫 UA + WAF
闸门 3 渲染后内容
闸门 4 Meta 指令
核心能力
AI 可抓取性 帮助团队看清什么。
检查四道访问闸门:robots.txt、真实爬虫身份、JS 空壳内容和 meta 指令。
01
爬虫身份探测
以 GPTBot 等爬虫身份真实请求网站,并使用浏览器对照组。
02
JS 空壳检测
发现初始 HTML 几乎没有可用正文的页面。
03
Meta 阻断检测
检查可能阻断索引或摘要的页面级指令。
工作方式
让每个结果始终连接证据与行动。
产品会解释结果、保留来源语境,并明确下一次复盘。
01
不只解析 robotsrobots.txt 放行,不代表 WAF 真的允许爬虫访问。
02
使用对照请求区分爬虫被拦与网站本身不可访问。
03
检查可读正文确认爬虫收到的响应中确实包含关键事实。
测量规则
AI 可抓取性遵守的规则
功能清单很容易抄,数字背后的规则抄不了。下面每一条都在产品里真实生效,其中多数是先犯过一次错才加上的。
| 规则 | 为什么有这条 |
|---|---|
| 用真实 User-Agent 实测访问,而不是从 robots.txt 推断。 | robots.txt 写着放行,但前面的 CDN 规则或防火墙对这些 UA 返回 403,实际就是封锁,而文件会一直宣称相反的事。 |
| 返回 200 但正文为空,记为失败而不是通过。 | 多数 AI 爬虫不执行 JavaScript。内容要等客户端渲染才出现的页面,对它们就是空壳,而你自己的分析工具永远不会告诉你。 |
| 代理探测的同时跑一组浏览器对照。 | 没有它,一个单纯宕机的站点和一个封锁 AI 代理的站点看起来一模一样。拆掉对照组,检查工具就开始制造假警报。 |
| 「没抓到」绝不报成「不存在」。 | robots.txt 抓取超时,说明不了它是否存在。把这两种状态合并,体检就会让站长去修一个本来没问题的东西。 |
示例产品证据
从汇总指标下钻到原始问题。
示例数据展示正式项目的证据层级。
可见度证据
最近 30 天 AI 可见度 34% +4%
被提及问题 10/29 +2
声量份额 31% +4%
被引页面 27 +9
购买问题 品牌状态 证据
适合小户型的模块化沙发 缺口 竞品被引用
2000 美元内最耐用的可水洗沙发 已提及 商品页
适合家庭的低 VOC 沙发 被推荐 指南与评价
相关内容
继续了解
FAQ
关于AI 可抓取性的问题
该功能会在公开官网上自动运行吗?
不会。官网只负责说明能力;用户进入 App 并确认项目范围后,才开始正式数据采集。
快照结果可以进入该工作流吗?
可以。有效快照可被认领为初始样本,但 Onboarding 仍需确认市场、竞品与正式监测问题集。
所有指标都能在不同 AI 引擎间直接比较吗?
核心答案状态可以标准化,但引用、搜索辅助与答案格式仍需保留引擎特定证据。
数据多久更新一次?
按套餐允许的频率运行,监测额度在账号层面共享。告警需要连续两轮确认,避免把模型采样抖动变成误报。
能看到 AI 的原始回答吗?
可以。每个结果都能下钻到产生它的那条回答,逐问题、逐模型查看,并附带该回答里的引用。
某个模型不可用时会怎样?
该次运行标记为 partial,不会被悄悄补上。其余引擎照常完成,缺口在结果里保持可见。