llms.txt:给 AI 修的专用门
robots.txt 管「不许抓」,llms.txt 管「欢迎读」。五百多个词条、二十多卷、一次计数互斥事故,和「自证新鲜」的设计。
搜索引擎时代,每个网站门口都挂着 robots.txt,告诉爬虫哪里能去、哪里不能去。AI 检索时代,门口多了一种新告示:llms.txt——一份专门给大模型看的站点说明,告诉他这家站是什么、结构长什么样、全文在哪、按什么条款可以引用。
主站把这份告示当正经工程来做,因为它的读者是机器,机器对含糊零容忍。现在的形态:五百多个词条编成二十多卷,每卷带导语和更新时间,另有分块的全文版本;还有一份三十四条的中英术语对照——英文提问可以映射到中文语料;文件头部挂着授权条款和“与现行标准原文不一致以原文为准”的时效声明。
这里有个值得讲的事故。某次升级后检查发现,同一秒部署出去的两个文件,导语里的条目计数居然互斥:一个说五百六十二,另一个说六百。追查下来既不是生成逻辑错也不是计数错,而是部署环节混用了不同轮次的暂存产物——一份是新批次的,一份还是上一轮的老文件。文件都是“真的”,拼在一起就是假的。
这类问题的根治思路让我挺受启发:与其信任流程,不如让文件自证新鲜。三件套落地——导语里打印生成时间戳,任何人一眼可见这批产物是哪轮出的;出仓前加一道校验门槛,两份文件的导语不一致、引用的链接不存在、计数文件超过时效,任何一条不满足直接禁止发布;上线后再跑一遍活文件回归,确认线上那两份真的互洽。此后同类事故零复发。
给机器修的门,和人走的门是两种要求:人能容忍“大概是最新的”,机器只认字节。所以这份文件的每一次升级,做的其实都是同一件事——把“应该是”改写成“可验证”。这大概也是所有 AI 时代内容基建的共同守则:你没法向一个语言模型解释“我们一般是周四更新”,你只能给它一个能自己核对的时间戳。