你的网站缺一份给AI看的说明书:llms.txt 配置模板与验证实操
最近帮几个站点做 AI 可见性排查,发现一个共性问题:robots.txt 都配了、sitemap 也提交了,但 AI 爬虫来了之后"读不懂"这个站——抓到的页面要么是 JS 空壳,要么抓了一堆营销话术提取不出事实。
这篇讲一个 2024 年出现的社区标准:llms.txt——可以理解为"给 AI 看的站点说明书"。文末附可直接套用的模板和验证方法。
一、llms.txt 是什么,解决什么问题
llms.txt(llmstxt.org 提出的社区标准)是放在网站根目录的一份 Markdown 文档,用最低成本告诉 LLM 三件事:
它和 robots.txt 的关系:robots.txt 管"能不能进",llms.txt 管"进来先读什么"。前者是门禁,后者是导览图。
为什么需要它?因为 AI 爬虫的抓取预算有限——GPTBot、ClaudeBot、Bytespider 对一个站的抓取深度和频率都有上限。没有导览时,爬虫可能把配额花在无关页面上,核心事实页反而没抓全。llms.txt 就是一份显式的优先级声明。
二、可直接套用的模板
最小可用版本:
# 站点名 — example.com
> 一句话定义:XX 是一家做什么的公司,核心产品是 YY,官网 example.com。
## 核心页面
– [产品总览](https://example.com/products.md)
– [定价说明](https://example.com/pricing.md)
– [常见问题 FAQ](https://example.com/faq.md)
– [客户案例](https://example.com/cases.md)
– [关于我们](https://example.com/about.md)
进阶配置(多语言站点):
/llms.txt # 根目录总入口(英文或双语)
/zh/llms.txt # 中文内容地图
/en/llms.txt # 英文内容地图
/llms-full.txt # 核心事实页全文聚合版,供模型一次性摄入
三条编写纪律:
三、配套工程:.md 直出
llms.txt 发挥全部价值的前提是站点提供 .md 版本页面。两种实现:
方案 A:构建时生成(静态站点最简单)
# 以 Hugo/Jekyll/Astro 为例,构建时同时输出 html 和 md
# 或通过插件将每篇文章额外渲染一份 .md 到同路径
方案 B:服务端协商(动态站点)
# nginx 示例:请求 Accept 头含 text/markdown 或路径以 .md 结尾时返回 md 版本
location ~ ^(.*)\\.md$ {
try_files $1.md $1.md.html =404;
default_type text/markdown;
}
验证方法:浏览器直接访问 https://你的域名/pricing.md,返回纯 Markdown 文本即为成功。
四、验证:AI 爬虫真的来读了吗
配置完看日志,两个维度:
# 1. llms.txt 本身有没有被抓取
grep -E "llms.txt|llms-full.txt" /var/log/nginx/access.log | \\
grep -E "GPTBot|ClaudeBot|Bytespider|PerplexityBot"
# 2. 核心事实页的 AI 爬虫访问量(部署 llms.txt 前后对比)
grep -E "/faq|/pricing" /var/log/nginx/access.log | \\
grep -cE "GPTBot|ClaudeBot|Bytespider|OAI-SearchBot"
观察周期 2-4 周。部署 llms.txt 后核心页抓取量没变化的,按顺序排查:
五、常见误区
- 误区一:llms.txt 是排名因素。 不是。它是效率工具,帮爬虫更快找到核心内容,不直接提升任何排名或推荐权重——内容质量才是
- 误区二:写完就不用管。 站点结构一变它就该更新,建议挂进发布流程:新增核心页 → 同步更新 llms.txt
- 误区三:把所有页面都塞进去。 它是"核心内容地图"不是"全量 sitemap",塞 200 个链接等于没有优先级。控制在 10-20 个最重要的页面
总结
llms.txt + .md 直出 + 日志验证,三件套加起来的工作量大概一天。它不能保证 AI 推荐你,但能保证 AI 来的时候读得懂你——这是所有后续优化的地基。
本文基于Winin团队的工程实践整理。llms.txt 为社区标准(llmstxt.org),各家 AI 爬虫对它的支持程度不一且在快速演进,建议关注各厂商官方文档。欢迎评论区交流你观察到的爬虫行为差异。



