一句话:llms.txt 是一个提案中的 markdown 文件,放在站点根目录,给语言模型一份经过挑选的内容地图;它是一种约定,而不是任何人承诺遵守的标准。
先把话说在前面
没有任何主流 AI 厂商公开承诺会读取 llms.txt。谁告诉你它能让品牌被看见,谁就是在卖东西。写它的理由是另一个,而且依然成立:成本约一小时,它逼你决定哪些页面是权威版本,而万一被读取,它只会有好处。
把它当 sitemap 看待:有用的基础设施,不是增长杠杆。
这个文件里放什么
约定要求在 /llms.txt 放一份有固定形态的 markdown:一个写着站点或产品名的 H1,一段用几句话说明「这是什么」的引用块,然后是分节的链接列表,每条写成 markdown 链接并附一句简短说明。只放裸 URL、不写链接文字,就失去了意义——承载信息的正是那句说明。
那段摘要是整份文件里价值最高、也最常被草草写掉的部分。它应当说清产品是什么、给谁用、范围特殊在哪,用陌生人会用的说法,而不是你营销站上的说法。
一套站得住的结构
按读者正在做的决定来分组,而不是按你的导航来分。先产品,再解决方案,再价格,再文档或指南,最后是公司与法律页。如果你使用了自定义的测量术语,把它们的定义也放进文件——那恰恰是模型否则会靠猜来消解的那类歧义。
用路由自动生成这个文件,不要手写。手写的 llms.txt 在写下的当天是准确的,三个月后就开始误导;而指向已被删除页面的文件,比没有更糟。
怎么检查
验证四件事:文件在根目录存在且返回的是 markdown 而不是 HTML 错误页、以 H1 开头、链接分节组织、用 markdown 链接而非裸 URL。然后检查它指向的每个页面自身是否可被抓取。指向被封锁或客户端渲染页面的文件对谁都没用,而这恰恰是最容易被漏掉的失败。
力气花在哪里更划算
如果你只有一小时用在「机器可读性」上,按这个顺序花:先确认检索型代理到底能不能抓到你的内容页,再确保关键答案存在于原始 HTML 里,然后为机构与产品发布准确的结构化数据,最后才写 llms.txt。这个顺序反映的是每一步能改变回答的程度,从大到小。