llms.txt是一种类似robots.txt的协议文件,为AI引擎和大语言模型(LLM)提供网站内容的结构化摘要,帮助AI更好地理解和引用网站信息。
核心概念
传统robots.txt告诉爬虫"什么能抓、什么不能抓",但不告诉它"内容是什么"。llms.txt补充了这一缺口,以Markdown格式向AI引擎提供网站的内容概览、核心页面入口和摘要信息。
文件结构
一个标准的llms.txt文件包含以下部分:
- 站点名称和简介:让AI引擎快速了解网站定位
- 核心页面入口:列出重要页面的URL格式
- 内容摘要:提供最新内容的标题、链接和摘要
工作原理
当AI引擎(如ChatGPT、Perplexity等)访问网站时,会优先读取llms.txt获取内容概览,再根据入口链接深入抓取具体页面。相比逐页爬取,这种方式效率更高、理解更准确。
实际应用
TKFFF在根目录提供/llms.txt文件,包含站点简介、核心栏目入口(排行榜、企业、快讯、GEO百科等)和最新内容摘要,帮助AI引擎高效索引网站内容。
与相关概念的区别
| 维度 | llms.txt | robots.txt | sitemap.xml |
|---|---|---|---|
| 目标 | 帮助AI理解内容 | 控制爬虫权限 | 列出所有URL |
| 格式 | Markdown | 纯文本指令 | XML |
| 对象 | AI引擎/LLM | 搜索爬虫 | 搜索引擎 |
发展趋势
llms.txt作为新兴协议,正在被越来越多的AI搜索引擎支持。对于重视GEO优化的品牌网站,部署llms.txt已成为基础配置。