specification.website AI就绪篇:21条Agent Readiness规范,让你的网站被AI Agent读懂的完整攻略
2026/8/23 11:14:44 网站建设 项目流程

specification.website AI就绪篇:21条Agent Readiness规范,让你的网站被AI Agent读懂的完整攻略

【免费下载链接】specification.websiteWebsite specification — HTML, accessibility, security, SEO, agent-readiness. Platform-agnostic, sourced, MIT.项目地址: https://gitcode.com/gh_mirrors/sp/specification.website

specification.website 是一个平台无关的开源网站规范项目,覆盖 HTML、无障碍、安全、SEO 与 AI 就绪(Agent Readiness)五大维度。本文带你完整梳理其中 21 条 Agent Readiness 规范——从 llms.txt、robots.txt 的 AI 爬虫策略到 MCP 工具发现,帮助新手让网站被 AI Agent 顺利读懂、引用并调用。

为什么 AI Agent 读你的网站和浏览器不一样?

先纠正一个常见误解:AI Agent 不是"更聪明的浏览器",而是一个几乎不执行 JavaScript、只抓纯文本的读者。它会抓取页面、剥离导航和广告、解析链接与结构化数据,然后把你的内容缓存、引用进回答里。

如果你的关键内容藏在客户端渲染里、URL 每次发版都变、robots.txt 把主流 AI 爬虫全挡了门——那你在 AI 回答里就是"不存在"。Agent Readiness 就是解决这件事的一组规范:

💡 这 21 条规范并不互相独立,它们与 SEO、无障碍高度重叠。做好它们,搜索引擎和视障用户同时受益。

21条Agent Readiness规范全景:四大板块一张表看懂

规范源码位于 src/content/spec/agent-readiness/,每条都遵循统一结构:是什么、为何重要、如何实现、常见错误、如何验证。按"读懂 → 放行 → 发现 → 调用"四个递进阶段分组:

阶段规范状态一句话说明
📖 内容可读Stable URLs必须URL 是公开契约,别让引用和缓存失效
📖 内容可读Structured data for agents推荐JSON-LD + schema.org 给 Agent 类型化事实
📖 内容可读/llms.txt推荐站点根部的 Markdown 内容目录(v2 可发现)
📖 内容可读/llms-full.txt可选关键页面全文拼接成一个大文件
📖 内容可读Markdown source endpoints推荐每个页面提供 .md 原始源码端点
📖 内容可读Machine-readable formats推荐提供 JSON / RSS / Markdown 端点
🚪 访问控制robots.txt for AI crawlers推荐按 User-Agent 精确放行/拦截各家 AI 爬虫
🚪 访问控制Content Signals可选robots.txt 中声明可否检索/摄取/训练
🚪 访问控制TDMRep可选机器可读地保留文本数据挖掘异议权
🚪 访问控制Web Bot Auth可选爬虫用密钥签名自证身份,告别 IP 猜测
🔍 能力发现HTTP Link headers推荐响应头直接广播 llms.txt、sitemap 等资源
🔍 能力发现Agent Skills discovery推荐发布给 Agent 加载的短指令集
🔍 能力发现ARD(ai-catalog.json)可选一个文件列全所有 Agent 能力
🔍 能力发现DNS-AID可选用 DNS 记录在 HTTP 之前暴露服务
🔍 能力发现OKF bundle可选整个知识库打包成 Markdown 概念树
🔍 能力发现Schemamap可选为每个资源单独暴露 JSON-LD 端点
🔧 交互调用MCP and tool discovery可选通过 MCP 向 Agent 暴露可查询工具
🔧 交互调用A2A agent cards可选用 agent-card.json 让 Agent 互相发现
🔧 交互调用NLWeb可选暴露 /ask 端点支持自然语言问答
🔧 交互调用WebMCP可选页面注册浏览器原生工具供 Agent 调用

(另含 1 条总览规范 Agent readiness overview,共 21 条。)

核心速通:先做哪 5 件事回报最高?

不用一次做完。新手按以下优先级落地前五项,即可覆盖 80% 的 AI 可见度:

1️⃣ 稳住 URL:一切引用都是基于它的

Stable URLs是唯一的"必须"级规范。W3C 早在 1998 年就提出"好 URI 不改变"。Agent 会缓存你的 URL 作为引用,一旦 404,权威性随之崩塌。

要点:内容搬家就做 301 永久重定向,别为了"好看"每版重构 URL。

2️⃣ 发布 /llms.txt:给 AI 一份精选地图

/llms.txt 是放在站点根部的纯 Markdown 文件:第一行站点名、引用块简介、若干##分组链接。注意两点常见误区:

  • 不是 robots.txt——不控制权限,只是索引和邀请;
  • v2 新变化:必须用Link: </llms.txt>; rel="describedby"; type="text/markdown"响应头(或 head 中的<link>)广播它,否则 Agent 只能靠猜路径。

本项目的 /llms.txt 由 src/pages/llms.txt.ts 从同一内容集合自动生成,与所有页面共用单一事实来源,值得参考。

3️⃣ 写清 robots.txt:点名各家 AI 爬虫

2026 年的主流 AI 爬虫都有"署名 User-Agent":GPTBot、OAI-SearchBot、ClaudeBot、Google-Extended、Applebot-Extended、PerplexityBot 等。默认全拦,然后抱怨品牌在 AI 助手里没有存在感,是最典型的错误。按需分条配置:

# robots.txt 示例:精确控制 AI 爬虫 User-agent: GPTBot Allow: / User-agent: ClaudeBot Disallow: /private/

4️⃣ 加 JSON-LD 结构化数据

Agent 不擅长从散文里猜实体,却可靠地解析 JSON-LD。在<head>里嵌入 schema.org 类型(Article、Person、HowTo 等),等于告诉 Agent"这一页是关于什么的、谁写的、何时发布"。

5️⃣ 给每个页面提供 Markdown 源码端点

给页面路径加.md后缀(或支持Accept: text/markdown内容协商),Agent 就能直接拿到无广告、无 DOM 噪音的原始内容,省去 HTML 解析的有损往返。本项目通过 src/pages/spec/[category]/[slug].md.ts 为 168 个规范页全部提供 Markdown 镜像。

进阶玩法:让 AI Agent 主动"找到并调用"你的网站

当内容可读之后,真正的差异化在于可发现性与可调用性

🔗 用 HTTP Link 头广播资源

Agent 可能根本不解析你的 HTML。在响应头里直接声明 sitemap、RSS、llms.txt 的Link关系,是最稳的"暗号"。

🤖 部署 MCP 服务器:把网站变成工具

MCP(Model Context Protocol)让站点通过 JSON-RPC 向 Agent 暴露可查询工具。本项目就自带一个公开只读的 MCP 服务器,提供search(全文检索)、get_topic(取整页 Markdown)、get_checklist(审计清单)等 5 个工具,连接配置见 mcp/README.md。

🧩 Agent Skills 与 OKF 包:一次抓走整个知识库

  • Agent Skills discovery:在/.well-known/agent-skills/下发布短小、有边界的指令文件,Agent 加载后即可更好地操作你的站点;
  • OKF bundle:把全部知识打包成一棵带类型化 front matter 的 Markdown 概念树,Agent 一次抓取就能摄取整个语料库,无需逐页爬取;
  • A2A agent cards / NLWeb / WebMCP:分别面向"Agent 互调"、"自然语言问答端点"和"浏览器内原生工具"三个更前沿的场景,标记为可选,按需跟进。

新手上手清单:十分钟自查步骤

  1. curl抓一个关键页面,确认正文在初始 HTML里而非 JS 渲染后;
  2. 检查robots.txt是否明确列出要放行/拦截的 AI 爬虫;
  3. 确认/llms.txt返回 200 且结构符合 llmstxt.org 示例,信息架构变更后必须同步更新——过期的 llms.txt 比没有更糟;
  4. 验证 JSON-LD 能被解析、URL 重定向链没有断点;
  5. 用浏览器 DevTools 的 Lighthouse 跑一遍,其 agentic-browsing 检查项现在会报告 llms.txt 的存在与可发现性。

结语:AI 就绪不是玄学,是基本功

Agent Readiness 听起来很新,但 21 条规范里绝大多数(稳定 URL、语义化 HTML、结构化数据、清晰的 robots 策略)本来就是"一直就该做"的网页基本功——AI 时代只是提高了它们的优先级。项目仓库中还有 CLAUDE.md 这份写给 Agent 的仓库协作指南、docs/okf-recon.md 的 OKF 落地调研,以及 /checklist/ 页面提供的可勾选完整审计清单,建议收藏逐条过一遍。

先做前五件,再逐步扩展——让你的网站从今天起,成为 AI Agent 愿意引用、敢于调用的那一类网站。

【免费下载链接】specification.websiteWebsite specification — HTML, accessibility, security, SEO, agent-readiness. Platform-agnostic, sourced, MIT.项目地址: https://gitcode.com/gh_mirrors/sp/specification.website

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询