specification.website AI就绪篇:21条Agent Readiness规范,让你的网站被AI Agent读懂的完整攻略
【免费下载链接】specification.websiteWebsite specification — HTML, accessibility, security, SEO, agent-readiness. Platform-agnostic, sourced, MIT.项目地址: https://gitcode.com/gh_mirrors/sp/specification.website
specification.website 是一个平台无关的开源网站规范项目,覆盖 HTML、无障碍、安全、SEO 与 AI 就绪(Agent Readiness)五大维度。本文带你完整梳理其中 21 条 Agent Readiness 规范——从 llms.txt、robots.txt 的 AI 爬虫策略到 MCP 工具发现,帮助新手让网站被 AI Agent 顺利读懂、引用并调用。
为什么 AI Agent 读你的网站和浏览器不一样?
先纠正一个常见误解:AI Agent 不是"更聪明的浏览器",而是一个几乎不执行 JavaScript、只抓纯文本的读者。它会抓取页面、剥离导航和广告、解析链接与结构化数据,然后把你的内容缓存、引用进回答里。
如果你的关键内容藏在客户端渲染里、URL 每次发版都变、robots.txt 把主流 AI 爬虫全挡了门——那你在 AI 回答里就是"不存在"。Agent Readiness 就是解决这件事的一组规范:
💡 这 21 条规范并不互相独立,它们与 SEO、无障碍高度重叠。做好它们,搜索引擎和视障用户同时受益。
21条Agent Readiness规范全景:四大板块一张表看懂
规范源码位于 src/content/spec/agent-readiness/,每条都遵循统一结构:是什么、为何重要、如何实现、常见错误、如何验证。按"读懂 → 放行 → 发现 → 调用"四个递进阶段分组:
| 阶段 | 规范 | 状态 | 一句话说明 |
|---|---|---|---|
| 📖 内容可读 | Stable URLs | 必须 | URL 是公开契约,别让引用和缓存失效 |
| 📖 内容可读 | Structured data for agents | 推荐 | JSON-LD + schema.org 给 Agent 类型化事实 |
| 📖 内容可读 | /llms.txt | 推荐 | 站点根部的 Markdown 内容目录(v2 可发现) |
| 📖 内容可读 | /llms-full.txt | 可选 | 关键页面全文拼接成一个大文件 |
| 📖 内容可读 | Markdown source endpoints | 推荐 | 每个页面提供 .md 原始源码端点 |
| 📖 内容可读 | Machine-readable formats | 推荐 | 提供 JSON / RSS / Markdown 端点 |
| 🚪 访问控制 | robots.txt for AI crawlers | 推荐 | 按 User-Agent 精确放行/拦截各家 AI 爬虫 |
| 🚪 访问控制 | Content Signals | 可选 | robots.txt 中声明可否检索/摄取/训练 |
| 🚪 访问控制 | TDMRep | 可选 | 机器可读地保留文本数据挖掘异议权 |
| 🚪 访问控制 | Web Bot Auth | 可选 | 爬虫用密钥签名自证身份,告别 IP 猜测 |
| 🔍 能力发现 | HTTP Link headers | 推荐 | 响应头直接广播 llms.txt、sitemap 等资源 |
| 🔍 能力发现 | Agent Skills discovery | 推荐 | 发布给 Agent 加载的短指令集 |
| 🔍 能力发现 | ARD(ai-catalog.json) | 可选 | 一个文件列全所有 Agent 能力 |
| 🔍 能力发现 | DNS-AID | 可选 | 用 DNS 记录在 HTTP 之前暴露服务 |
| 🔍 能力发现 | OKF bundle | 可选 | 整个知识库打包成 Markdown 概念树 |
| 🔍 能力发现 | Schemamap | 可选 | 为每个资源单独暴露 JSON-LD 端点 |
| 🔧 交互调用 | MCP and tool discovery | 可选 | 通过 MCP 向 Agent 暴露可查询工具 |
| 🔧 交互调用 | A2A agent cards | 可选 | 用 agent-card.json 让 Agent 互相发现 |
| 🔧 交互调用 | NLWeb | 可选 | 暴露 /ask 端点支持自然语言问答 |
| 🔧 交互调用 | WebMCP | 可选 | 页面注册浏览器原生工具供 Agent 调用 |
(另含 1 条总览规范 Agent readiness overview,共 21 条。)
核心速通:先做哪 5 件事回报最高?
不用一次做完。新手按以下优先级落地前五项,即可覆盖 80% 的 AI 可见度:
1️⃣ 稳住 URL:一切引用都是基于它的
Stable URLs是唯一的"必须"级规范。W3C 早在 1998 年就提出"好 URI 不改变"。Agent 会缓存你的 URL 作为引用,一旦 404,权威性随之崩塌。
要点:内容搬家就做 301 永久重定向,别为了"好看"每版重构 URL。
2️⃣ 发布 /llms.txt:给 AI 一份精选地图
/llms.txt 是放在站点根部的纯 Markdown 文件:第一行站点名、引用块简介、若干##分组链接。注意两点常见误区:
- 它不是 robots.txt——不控制权限,只是索引和邀请;
- v2 新变化:必须用
Link: </llms.txt>; rel="describedby"; type="text/markdown"响应头(或 head 中的<link>)广播它,否则 Agent 只能靠猜路径。
本项目的 /llms.txt 由 src/pages/llms.txt.ts 从同一内容集合自动生成,与所有页面共用单一事实来源,值得参考。
3️⃣ 写清 robots.txt:点名各家 AI 爬虫
2026 年的主流 AI 爬虫都有"署名 User-Agent":GPTBot、OAI-SearchBot、ClaudeBot、Google-Extended、Applebot-Extended、PerplexityBot 等。默认全拦,然后抱怨品牌在 AI 助手里没有存在感,是最典型的错误。按需分条配置:
# robots.txt 示例:精确控制 AI 爬虫 User-agent: GPTBot Allow: / User-agent: ClaudeBot Disallow: /private/4️⃣ 加 JSON-LD 结构化数据
Agent 不擅长从散文里猜实体,却可靠地解析 JSON-LD。在<head>里嵌入 schema.org 类型(Article、Person、HowTo 等),等于告诉 Agent"这一页是关于什么的、谁写的、何时发布"。
5️⃣ 给每个页面提供 Markdown 源码端点
给页面路径加.md后缀(或支持Accept: text/markdown内容协商),Agent 就能直接拿到无广告、无 DOM 噪音的原始内容,省去 HTML 解析的有损往返。本项目通过 src/pages/spec/[category]/[slug].md.ts 为 168 个规范页全部提供 Markdown 镜像。
进阶玩法:让 AI Agent 主动"找到并调用"你的网站
当内容可读之后,真正的差异化在于可发现性与可调用性:
🔗 用 HTTP Link 头广播资源
Agent 可能根本不解析你的 HTML。在响应头里直接声明 sitemap、RSS、llms.txt 的Link关系,是最稳的"暗号"。
🤖 部署 MCP 服务器:把网站变成工具
MCP(Model Context Protocol)让站点通过 JSON-RPC 向 Agent 暴露可查询工具。本项目就自带一个公开只读的 MCP 服务器,提供search(全文检索)、get_topic(取整页 Markdown)、get_checklist(审计清单)等 5 个工具,连接配置见 mcp/README.md。
🧩 Agent Skills 与 OKF 包:一次抓走整个知识库
- Agent Skills discovery:在
/.well-known/agent-skills/下发布短小、有边界的指令文件,Agent 加载后即可更好地操作你的站点; - OKF bundle:把全部知识打包成一棵带类型化 front matter 的 Markdown 概念树,Agent 一次抓取就能摄取整个语料库,无需逐页爬取;
- A2A agent cards / NLWeb / WebMCP:分别面向"Agent 互调"、"自然语言问答端点"和"浏览器内原生工具"三个更前沿的场景,标记为可选,按需跟进。
新手上手清单:十分钟自查步骤
- 用
curl抓一个关键页面,确认正文在初始 HTML里而非 JS 渲染后; - 检查
robots.txt是否明确列出要放行/拦截的 AI 爬虫; - 确认
/llms.txt返回 200 且结构符合 llmstxt.org 示例,信息架构变更后必须同步更新——过期的 llms.txt 比没有更糟; - 验证 JSON-LD 能被解析、URL 重定向链没有断点;
- 用浏览器 DevTools 的 Lighthouse 跑一遍,其 agentic-browsing 检查项现在会报告 llms.txt 的存在与可发现性。
结语:AI 就绪不是玄学,是基本功
Agent Readiness 听起来很新,但 21 条规范里绝大多数(稳定 URL、语义化 HTML、结构化数据、清晰的 robots 策略)本来就是"一直就该做"的网页基本功——AI 时代只是提高了它们的优先级。项目仓库中还有 CLAUDE.md 这份写给 Agent 的仓库协作指南、docs/okf-recon.md 的 OKF 落地调研,以及 /checklist/ 页面提供的可勾选完整审计清单,建议收藏逐条过一遍。
先做前五件,再逐步扩展——让你的网站从今天起,成为 AI Agent 愿意引用、敢于调用的那一类网站。
【免费下载链接】specification.websiteWebsite specification — HTML, accessibility, security, SEO, agent-readiness. Platform-agnostic, sourced, MIT.项目地址: https://gitcode.com/gh_mirrors/sp/specification.website
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考