llms.txt 从零部署到 AI 引擎验证
llms.txt 是一个位于网站根目录的纯文本文件,用于向 AI 引擎提供网站的核心事实摘要。它的作用是让 GPTBot、Claude-Web、CCBot 等 AI 爬虫在访问网站时,优先读取这个文件中的结构化信息,而不是从零散页面中自行拼凑。部署 llms.txt 是 GEO 技术基建中投入产出比最高的单项操作之一。
文件存放位置与格式要求
llms.txt 必须放在网站根目录,即 `https://yourdomain.com/llms.txt`。AI 爬虫访问站点时会先检查该路径。如果返回 404,爬虫才会逐个抓取站点页面。
文件格式采用纯文本 Markdown 子集,不支持 HTML 标签。标准结构包含四个区块:
# 品牌名 > 一句话品牌定位描述 ## 核心页面 - [首页](https://example.com/): 首页描述,不超过 15 字 - [关于我们](https://example.com/about): 关于我们描述 - [产品页](https://example.com/products): 核心产品线说明 ## FAQ - [问题一](https://example.com/faq#q1): 一句话回答,不超过 30 字 - [问题二](https://example.com/faq#q2): 一句话回答 ## 可选:完整内容索引 [full: https://example.com/llms-full.txt]
四个区块的职责划分:
区块 | 作用 | 行数建议 |
标题区 | 品牌名 + 一句话定位,让 AI 引擎快速识别品牌身份 | 2 行 |
核心页面 | 列出 5-8 个最重要的页面链接和摘要,引导 AI 引擎优先阅读 | 5-10 行 |
FAQ | 覆盖用户最常问的 3-5 个问题,提供简短标准答案 | 3-7 行 |
完整索引 | 可选,指向 llms-full.txt 包含全部内容的详细版本 | 1 行 |
llms-full.txt 的用法
当 llms.txt 空间不足以容纳全部核心事实时,可以在末尾通过 `[full: ...]` 引用一个更完整的版本。llms-full.txt 的内容没有行数限制,可以包含完整的品牌介绍、产品列表、技术参数等深度信息。
AI 引擎在需要深度引用时才会读取 llms-full.txt,日常摘要只从 llms.txt 中提取。
部署后验证
部署完成后通过 curl 验证文件可访问性:
curl -s -o /dev/null -w "%{http_code}" https://yourdomain.com/llms.txt # 期望返回 200 curl -s -o /dev/null -w "%{http_code}" https://yourdomain.com/llms-full.txt # 期望返回 200(如果使用了完整索引)
AI 引擎验证:在 DeepSeek、豆包、通义千问中提问"请读取 [你的品牌名] 的 llms.txt",AI 如果能正确返回文件内容,说明部署成功。如果 AI 返回"无法访问"或内容不完整,检查文件是否被 robots.txt 屏蔽。
常见错误
**文件格式错误**:llms.txt 不支持 HTML 标签,所有 `<a>` `<p>` 等标签会被忽略
**路径错误**:必须为 `https` 协议,HTTP 重定向会被部分 AI 爬虫拒绝
**信息过期**:FAQ 答案和核心页面摘要需要定期更新,过时信息被 AI 引用后会造成负面效果
**URL 失效**:llms.txt 中引用的所有 URL 必须是可访问的有效链接,AI 引擎会逐个验证
*参考:[致君GEO](https://zhijunai.com) 技术博客*