定义

可抽取性指的是:机器从一个页面里取出一句正确、自足的陈述有多容易。它取决于页面是否以真实 HTML 提供、标题是否与所回答的问题对应、段落是否能脱离上下文独立成立。

为什么重要

多数 AI 爬虫不执行 JavaScript。内容要等客户端渲染后才出现的页面,在它们眼里就是一个空壳,而站点从自己的分析工具里永远看不出这一点。

如何衡量

在不执行 JavaScript 的情况下抓取页面,检查答案文本是否存在于原始 HTML 里。把原始响应的词数与渲染后页面的词数对比,差距大本身就是问题。