ITSWE博客

静态博客的 SEO/GEO 基建:从 sitemap 到 llms.txt

传统搜索引擎之外,AI 检索成了新的引用通道。一套完整的机器可读基建:sitemap、RSS、结构化数据、llms.txt,与它们的工程化。

这座博客上线时,机器可读基建是按两层设计的:第一层给传统搜索引擎,第二层给 AI 检索。这篇把两层摊开,讲每一件的实现方式与踩过的坑。

第一层:传统搜索引擎的四件套

站点地图是索引通道的地基。构建时自动生成索引型地图加子表,robots 文件里指向它,每个页面再放一个链接声明。值得注意的是地图的“诚实性”:只收录希望被索引的地址,别名页、参数变体一律排除——我们见过反面教材,两百多条不该收的别名躺在主站地图里占了近两成名额,等于主动稀释抓取预算。

RSS 的价值被普遍低估。它不只是订阅器协议:聚合工具、部分检索通道、乃至一些 AI 数据管线都还在消费它。实现上是一个路由函数,把文章集合按时间倒序输出,带上语言声明。成本十分钟,收益长期。

规范地址解决变体收敛:每个页面用 link 标签声明自己的规范地址,带参数、带翻页的变体不参与收录竞争。实现是布局组件里统一生成,一劳永逸。

结构化数据是让引擎“理解”而非“抓取”的关键:文章页输出博客文章类型的结构化数据(标题、摘要、发布时间、作者、语言),首页输出网站类型。全是布局组件里的模板代码,零运行成本。

第二层:给 AI 修的门

AI 检索的引用逻辑与传统排名不同:它更依赖语义清晰的正文、干净的层次、以及显式的站点说明。我们的做法三件套。

其一,语义化的静态 HTML:全部页面预渲染,正文在 HTML 源码里,零客户端渲染。这是地基——任何依赖浏览器执行代码才能看到的内容,对大部分 AI 管线都不可见。

其二,llms.txt 站点说明:一份专门给大模型的站点导览——站点身份、内容结构、分卷全文、术语对照、授权条款、时效声明。它不是标准,是正在形成的惯例,而惯例期先行的成本极低。我们给主站做的版本有五百多个词条、二十多卷、三十余条中英术语对照, 曾发生过一次“同秒部署的两份文件计数互斥”的事故,根因是部署混用了不同轮次的产物——修复方案是让文件自证新鲜:导语打印生成时间,出仓前校验一致性,上线后自动回归。这套路数值得抄:凡是机器消费的东西,自证新鲜比信任流程可靠。

其三,推送通道各就各位:各站长平台该提交的提交,快速收录接口该配的配。定位是“不缺席”,不是“保流量”。

llms.txt 的结构设计

主站这份机器说明的结构值得展示。入口文件是一份总纲:站点身份、内容概述、授权条款、时效声明、机器接口清单;正文按主题切成二十多个分卷,每卷一个主题(理论、设计、施工、运维、零部件……),卷内每个词条一条记录,带标题、地址与一句话摘要;另有全文分块版本,五百多个分块每块带独立的更新时间戳,便于机器按块引用而非整卷吞读;一份三十四条的中英术语对照,解决“英文提问如何映射到中文语料”的问题——弓网关系、承力索、吊弦这些术语没有对照表,英文世界的检索永远找不到中文的答案。

更新机制同样工程化:总纲与分卷的导语打印生成时间,出仓前校验两份文件的导语一致、引用地址存活、计数文件未过期,上线后自动回归核对。这套设计让说明文件从“一份文档”变成了“一条管线”——机器读到的不只是内容,还有内容的新鲜度证明。

推送通道的工程化

各平台的快速收录接口,值得讲讲工程化细节。接口按站点配额,每天有限条数,于是自动化脚本要做四件事:拉取全量地址清单、对照状态文件筛出未推过的、按优先级排序(首页与栏目先,详情后,推完一轮按最久未推轮换)、把结果写回状态文件防重复。这套机制让“推送”从手工动作变成无人值守的日常任务,配额的每一分都花在刀刃上。同类快速推送协议(如 IndexNow)配一个密钥文件放站点根,每日批量喂——某引擎对这套协议响应极快,是我们实测收录最快的通道。

结构化数据的字段清单也一并给出:文章页输出类型、标题、摘要、发布时间、规范地址、作者与发布者(组织名与主站地址)、语言;首页输出站点名、地址、描述、语言。全部在布局组件生成,新文章零边际成本。

llms.txt 的头部政策

给 AI 的站点说明,头部政策比正文更值得琢磨,有三条经验。授权声明:明确内容按什么条款可被引用,比如知识共享署名类协议——AI 管线在决定“能不能引、怎么署名”时,这是它唯一能看到的地方。时效声明:工程内容有时效性,一句“与现行标准原文不一致处以原文为准”既是对读者负责,也是对引用者的提醒。机器接口清单:把全文分卷、术语对照、更新时间的地址逐条列出,让机器不用猜结构。

一次全线联调的教训

基建铺完不等于生效。主站曾经发生过一次“检测工具复扫数字不动”的迷局:修复上线,复扫结果纹丝不动,报的还是旧颜色。层层排查后真相是 CDN 边缘节点在海外出口长时间持有旧页面——你的更新和机器看到你的更新,中间隔着一层边缘缓存。从那以后,验收流程固定为三段:绕开边缘直连源站确认修复生效、加随机参数穿透验证、最后等边缘自然过期或主动刷新后再看机器视角。

总账

这套基建的总成本:一次性搭建约两天,之后每篇文章零边际成本。收益很难精确计量,但方向明确——传统引擎的抓取在内容升级后出现谷底回升,AI 检索对静态语义页面的引用也远比动态页友好。机器可读性不是玄学,是把“人能读懂”翻译成“机器能核对”的工程,而工程,就有清单。

SEOAI
返回全部文章