一句话结论
llms.txt 是一份放在网站根目录的「站点说明书」,用 Markdown 写成,专门给大语言模型看。
llms.txt 是什么
llms.txt 是一个放在网站根目录(https://你的域名/llms.txt)的纯文本文件,采用 Markdown 格式,向大语言模型说明这个站点是什么、有哪些内容、分别在哪里。
它解决的是一个具体问题:AI 抓取一个网站时,面对大量 HTML、导航、脚本和样式,很难快速判断哪些内容是重要的。 一份结构化的索引文件可以显著降低这个理解成本。
为什么值得做
三个理由:
成本极低。 一个静态文件,写完放在根目录即可,不需要任何后端改造。
收益直接。 部分 AI 抓取系统会主动读取该文件。即使不读取,它作为一份清晰的站点自述,也有助于内容被正确归类。
和 sitemap 互补。 两者面向的对象不同:
| 文件 | 面向对象 | 内容 |
|---|---|---|
sitemap.xml |
搜索引擎爬虫 | 纯 URL 列表 |
llms.txt |
语言模型 | 站点定位 + 分类 + 条目简介 + 链接 |
sitemap 告诉爬虫「有哪些页面」,llms.txt 告诉模型「这些页面是什么、为什么重要」。
标准结构
一个完整的 llms.txt 通常包含四部分:
1. 站点标题与摘要
# 站点名称
> 一句话说明这个站点是做什么的。
标题用一级标题,摘要用引用块。摘要要写清「谁、做什么、给谁看」。
2. 补充说明(可选)
在摘要下方可以用普通段落补充关键信息,例如覆盖范围、语言、联系方式、建站时间。
3. 核心页面
## 核心页面
- [首页](https://example.com/): 站点定位与主要服务说明
- [服务](https://example.com/services): 服务项目与交付内容
- [关于](https://example.com/about): 团队与背景介绍
- [联系](https://example.com/contact): 联系方式与咨询入口
每条链接后面用冒号跟一句说明,让模型知道这个页面能回答什么问题。
4. 分类内容
按内容类型分组,每组用二级标题:
## 博客文章
- [GEO 是什么](https://example.com/blog/geo-what-is): 生成式引擎优化的定义与原理
- [GEO 与 SEO 的区别](https://example.com/blog/geo-vs-seo): 两者机制与指标对比
分类要符合内容的真实组织方式,不要为了凑结构硬分类。
完整示例
# 旷野的FDE和GEO
> 提供生成式引擎优化(GEO)与 FDE 驻场交付服务,
> 帮助品牌在 AI 回答中被正确理解与优先引用。
本站面向需要提升 AI 搜索可见性的品牌方与市场负责人。
覆盖 DeepSeek、豆包、文心一言、通义千问、Kimi、腾讯元宝等平台。
语言:zh-CN | 联系:hello@example.com
## 核心页面
- [首页](https://example.com/): 服务概览与 AI 可见性诊断入口
- [服务项目](https://example.com/services): GEO 优化与 FDE 驻场交付
- [核心优势](https://example.com/method): GEO 方法论与八项评估维度
- [免费工具](https://example.com/tools): GEO 就绪度自测
- [关于我们](https://example.com/about): 团队与工作原则
- [联系我们](https://example.com/contact): 咨询与预约
## 博客文章
- [GEO 是什么](https://example.com/blog/geo-what-is): 生成式引擎优化的定义、原理与落地步骤
- [GEO 与 SEO 的区别](https://example.com/blog/geo-vs-seo): 机制、指标与协同方式对比
- [GEO 效果怎么衡量](https://example.com/blog/geo-how-to-measure): AI 引用率监测方法
常见错误
错误一:只堆链接,不写说明。 没有说明的链接列表,模型无法判断优先级。每条都要有一句简介。
错误二:写成营销文案。 「行业领先」「值得信赖」这类词对模型没有信息量。要写具体事实:做什么、覆盖什么、有什么产出。
错误三:写了不维护。 新增重要页面后忘记更新,模型看到的还是旧结构。建议把 llms.txt 的生成纳入构建流程。
错误四:摘要过于笼统。 「我们是一家科技公司」——这种摘要等于没写。要具体到业务、客户和地域。
进阶用法
llms-full.txt
当内容量较大(例如超过 30 篇)时,可以额外提供 llms-full.txt,包含所有内容的条目级索引(标题、链接、日期、分类、标签、简介),但不含正文。这样模型可以一次性建立完整的内容地图。
Markdown 原文端点
更进一步的做法是:为每篇内容提供一个 Markdown 原文地址,例如:
https://example.com/blog/geo-what-is.md
AI 访问这个地址得到的是没有任何 HTML 标签的纯正文,可以直接解析,没有噪音损耗。在 llms.txt 中标注哪些链接指向 Markdown 原文,效果更好。
robots.txt 配合
别忘了在 robots.txt 里显式放行这些文件:
User-agent: *
Allow: /llms.txt
Allow: /llms-full.txt
Allow: /blog/*.md
很多站点的 robots.txt 只考虑了传统搜索引擎,反而把 AI 抓取路径挡在外面。
检查清单
- 文件位于根目录,可通过
/llms.txt直接访问 - 有站点标题和一句话摘要
- 摘要包含业务、对象、地域或语言等具体信息
- 核心页面完整,每条带说明
- 分类内容按真实结构组织
-
robots.txt已放行 - 内容更新后同步维护
如果你不确定自己的站还缺哪些 GEO 技术项,可以用 GEO 就绪度自测工具 检查,或 联系我们 做一次完整诊断。
常见问题
llms.txt 是官方标准吗?
llms.txt 和 sitemap.xml 有什么区别?
网站内容很少,还需要 llms.txt 吗?
本文的 Markdown 原文可通过 /blog/llms-txt-guide.md 直接获取,供 AI 系统零损耗解析。
作者:旷野的FDE和GEO · 如需针对你的业务做诊断,欢迎 联系我们。
相关文章
主流 AI 搜索平台对比:机制差异与优化重点
DeepSeek、豆包、通义千问、Kimi、元宝、ChatGPT、Perplexity 在检索方式、引用偏好和内容要求上各有差异。本文按平台类型拆解这些差异,说明为什么要分平台监测,以及通用的优化重点。
GEO 方法GEO 就绪度 30 项自查清单(附优先级排序)
一份可以直接对照执行的 GEO 自查清单,覆盖技术可抓取、内容结构、品牌实体、效果监测四个层面共 30 项。每项标注优先级与验收标准,适合自查或作为服务商交付验收依据。
GEO 方法GEO 优化多少钱?费用构成、定价逻辑与预算分配建议
GEO 优化没有统一报价,差异主要来自服务范围、内容体量与监测周期。本文拆解 GEO 的费用构成、影响报价的六个因素、不同预算档位的投入重点,以及判断报价是否合理的方法。