欢迎光临
我们一直在努力

你的网站缺一份给AI看的说明书:llms.txt 配置模板与验证实操

你的网站缺一份给AI看的说明书:llms.txt 配置模板与验证实操

最近帮几个站点做 AI 可见性排查,发现一个共性问题:robots.txt 都配了、sitemap 也提交了,但 AI 爬虫来了之后"读不懂"这个站——抓到的页面要么是 JS 空壳,要么抓了一堆营销话术提取不出事实。

这篇讲一个 2024 年出现的社区标准:llms.txt——可以理解为"给 AI 看的站点说明书"。文末附可直接套用的模板和验证方法。

一、llms.txt 是什么,解决什么问题

llms.txt(llmstxt.org 提出的社区标准)是放在网站根目录的一份 Markdown 文档,用最低成本告诉 LLM 三件事:

  • 这个站是谁的、做什么的(一句话品牌定义)
  • 哪些页面最重要(核心内容清单,按优先级排列)
  • 去哪里读最方便(指向对 AI 解析友好的版本,比如 .md 直出页面)
  • 它和 robots.txt 的关系:robots.txt 管"能不能进",llms.txt 管"进来先读什么"。前者是门禁,后者是导览图。

    为什么需要它?因为 AI 爬虫的抓取预算有限——GPTBot、ClaudeBot、Bytespider 对一个站的抓取深度和频率都有上限。没有导览时,爬虫可能把配额花在无关页面上,核心事实页反而没抓全。llms.txt 就是一份显式的优先级声明。

    二、可直接套用的模板

    最小可用版本:

    # 站点名 — example.com

    > 一句话定义:XX 是一家做什么的公司,核心产品是 YY,官网 example.com。

    ## 核心页面

    – [产品总览](https://example.com/products.md)
    – [定价说明](https://example.com/pricing.md)
    – [常见问题 FAQ](https://example.com/faq.md)
    – [客户案例](https://example.com/cases.md)
    – [关于我们](https://example.com/about.md)

    进阶配置(多语言站点):

    /llms.txt # 根目录总入口(英文或双语)
    /zh/llms.txt # 中文内容地图
    /en/llms.txt # 英文内容地图
    /llms-full.txt # 核心事实页全文聚合版,供模型一次性摄入

    三条编写纪律:

  • 第一行的"一句话定义"是全文件最值钱的部分。 AI 回答"XX 公司是做什么的"时优先提取这段。写法公式:品牌名(域名)+ 品类定位 + 核心产品名。只写"行业领先的创新企业"等于没写
  • 链接指向 .md 直出版本(如果你的站点支持)。Markdown 的解析成本远低于 HTML——没有导航栏、广告位、脚本噪音,模型读到的全是正文
  • 定期更新 lastmod。 文件里标注更新日期,内容地图和站点实际结构保持一致,过期的 llms.txt 比没有更糟(AI 会按它去找不存在的页面)
  • 三、配套工程:.md 直出

    llms.txt 发挥全部价值的前提是站点提供 .md 版本页面。两种实现:

    方案 A:构建时生成(静态站点最简单)

    # 以 Hugo/Jekyll/Astro 为例,构建时同时输出 html 和 md
    # 或通过插件将每篇文章额外渲染一份 .md 到同路径

    方案 B:服务端协商(动态站点)

    # nginx 示例:请求 Accept 头含 text/markdown 或路径以 .md 结尾时返回 md 版本
    location ~ ^(.*)\\.md$ {
    try_files $1.md $1.md.html =404;
    default_type text/markdown;
    }

    验证方法:浏览器直接访问 https://你的域名/pricing.md,返回纯 Markdown 文本即为成功。

    四、验证:AI 爬虫真的来读了吗

    配置完看日志,两个维度:

    # 1. llms.txt 本身有没有被抓取
    grep -E "llms.txt|llms-full.txt" /var/log/nginx/access.log | \\
    grep -E "GPTBot|ClaudeBot|Bytespider|PerplexityBot"

    # 2. 核心事实页的 AI 爬虫访问量(部署 llms.txt 前后对比)
    grep -E "/faq|/pricing" /var/log/nginx/access.log | \\
    grep -cE "GPTBot|ClaudeBot|Bytespider|OAI-SearchBot"

    观察周期 2-4 周。部署 llms.txt 后核心页抓取量没变化的,按顺序排查:

  • robots.txt 是否放行了对应 UA(llms.txt 不能解决门禁问题)
  • WAF/CDN 是否把 AI 爬虫拦了(日志里 403/429 激增就是它)
  • llms.txt 有没有提交到 sitemap、有没有内链入口(帮爬虫发现它)
  • 五、常见误区

    • 误区一:llms.txt 是排名因素。 不是。它是效率工具,帮爬虫更快找到核心内容,不直接提升任何排名或推荐权重——内容质量才是
    • 误区二:写完就不用管。 站点结构一变它就该更新,建议挂进发布流程:新增核心页 → 同步更新 llms.txt
    • 误区三:把所有页面都塞进去。 它是"核心内容地图"不是"全量 sitemap",塞 200 个链接等于没有优先级。控制在 10-20 个最重要的页面

    总结

    llms.txt + .md 直出 + 日志验证,三件套加起来的工作量大概一天。它不能保证 AI 推荐你,但能保证 AI 来的时候读得懂你——这是所有后续优化的地基。


    本文基于Winin团队的工程实践整理。llms.txt 为社区标准(llmstxt.org),各家 AI 爬虫对它的支持程度不一且在快速演进,建议关注各厂商官方文档。欢迎评论区交流你观察到的爬虫行为差异。

    赞(0)
    未经允许不得转载:171主机测评 » 你的网站缺一份给AI看的说明书:llms.txt 配置模板与验证实操
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址