文章目录
- Cloudflare技术解析:AI机器人流量超越人类后的互联网治理挑战
- 一、引言
- 二、非人类流量为何增长更快
- 三、网站需要的新治理层
- 四、数据与财报该如何解读
- 五、行动建议
- 六、从robots.txt到可验证机器身份
- 七、内容产业的商业模式变化
- 八、企业应如何准备
- 九、怎样理解1:1000预测
- 十、机器人流量的分类体系
- 十一、Agent访问网站的完整链路
- 十二、付费抓取与内容授权
- 十三、对网络架构的影响
- 十四、社会层面的真实性问题
- 十五、总结
Cloudflare技术解析:AI机器人流量超越人类后的互联网治理挑战
一、引言
据题设转述的 Cloudflare 2026 年第二季度财报电话会信息,AI 机器人等非人类流量在 5 月已超过人类流量;公司进一步预测,若趋势延续,五年后人机流量比可能达到 1:1000。这个数字即使被视作趋势判断而非精确预言,也足以说明互联网正在从“人浏览网页”走向“机器代表人读取、检索与执行”。
亲爱的朋友们,创作不容易,若对您有帮助的话,请点赞收藏加关注哦,您的关注是我持续创作的动力,谢谢大家!有问题请私信或联系邮箱:jasonai.fn@gmail.com
二、非人类流量为何增长更快
搜索爬虫曾是主要的自动访问者;今天新增的是训练抓取、检索增强抓取、实时 Agent 浏览、监控和自动化交易。一个用户发出一次任务,背后可能触发数十甚至数千次页面请求。
| 流量类型 | 目标 | 对网站的影响 |
|---|---|---|
| 传统搜索爬虫 | 建索引 | 节奏相对可预测 |
| AI 训练抓取 | 收集语料 | 规模大、授权争议多 |
| Agent 浏览 | 完成用户任务 | 请求链更长、更动态 |
| 恶意自动化 | 欺诈、扫描、攻击 | 直接抬高安全风险 |
三、网站需要的新治理层
请求到达 ├─ 身份与来源验证 ├─ 意图/速率/行为分析 ├─ 允许、限速、付费或拒绝 └─ 审计与异常响应过去只区分“真人”和“机器人”已不够。合规的 Agent 可能确实代表付费用户;未声明身份的抓取器则可能消耗带宽、绕过内容规则。新的关键问题是:机器人是谁、代表谁、能访问什么、是否愿意为访问付费。
四、数据与财报该如何解读
题设给出的季度营收为 6.96 亿美元、同比增长 36%,净亏损为 2.057 亿美元。流量口径、机器人识别方法和时间窗口都会影响结论,因此不宜把单次电话会的预测理解为整个互联网的精确普查。更有价值的是观察其方向:自动化请求已从边缘现象变成网络容量、内容授权和安全产品的核心变量。
| 角色 | 机会 | 风险 |
|---|---|---|
| 网站运营者 | 新的访问控制与变现方式 | 成本飙升、内容被无授权抓取 |
| Agent 开发者 | 更丰富的数据与服务接口 | 访问受限、身份合规要求提高 |
| 网络服务商 | 提供防护、计量与策略 | 识别误伤合法自动化 |
五、行动建议
站点应先建立可观测性:区分已验证机器人、未知自动化与真实用户;再按风险设置 robots 规则、速率限制、身份验证和付费接口。开发 Agent 的团队则要公开 User-Agent、遵守站点政策、控制重试与并发,并为用户可追溯地说明访问行为。
六、从robots.txt到可验证机器身份
robots.txt 主要表达抓取偏好,无法证明请求者身份,也无法强制一个隐藏爬虫遵守规则。下一代治理需要把声明、认证、授权和计费分开:User-Agent 声明“我是谁”,加密身份验证证明声明可信,站点策略决定可访问范围,计量系统负责限额与结算。
| 层次 | 旧方式 | 新需求 |
|---|---|---|
| 身份 | User-Agent 字符串 | 可验证的机器人身份 |
| 权限 | 全站允许/拒绝 | 按路径、用途和用户授权 |
| 频率 | IP 限速 | 按主体、任务和资源成本计量 |
| 交换 | 免费抓取换搜索流量 | API、付费抓取或收益分成 |
Cloudflare 已在讨论“wanted bots 与 unwanted humans”的区别:合法 Agent 可能替用户订票,真人也可能实施欺诈。因此判断核心应从生物身份转向行为、授权和责任主体。
七、内容产业的商业模式变化
传统搜索爬虫为网站带来点击,AI 抓取却可能在回答界面直接消化内容,发布者承担带宽和创作成本却拿不到访问。Cloudflare 公开资料显示,2026 年 6 月按用途识别的爬虫请求中,AI 训练占比已升至 52%。这推动网站探索按次付费、授权 API、来源归因和 Agent 专用页面。
旧链路:抓取 → 搜索结果 → 人点击 → 广告/订阅收入 新链路:抓取 → AI答案 → 人不访问网站 → 价值分配断裂 未来链路:认证Agent → 授权/计量 → 内容调用 → 归因与结算如果没有新的价值交换机制,高质量内容可能转向登录墙、封闭数据库或直接授权给少数模型厂商,开放 Web 反而会变得更贫瘠。
八、企业应如何准备
企业既是网站运营者,也是 Agent 使用者。对外要建立 Bot 流量分类、资源成本核算与访问政策;对内要给自家 Agent 设置身份、请求预算、缓存和来源引用。API 优先于页面模拟操作,因为 API 更容易限权、计费和审计。
| 时间范围 | 建议动作 |
|---|---|
| 30 天 | 识别主要机器人、统计成本和来源 |
| 90 天 | 建立允许/限制/付费三类策略 |
| 180 天 | 推出 Agent API、身份验证与归因机制 |
九、怎样理解1:1000预测
“五年后 1:1000”并不意味着每一千个社交账号里只有一个真人,它更可能描述 HTTP 请求或网络工作负载:一次人类指令会触发 Agent 搜索、抓取、验证和调用多个 API,机器请求数自然呈乘数增长。不同国家、行业和站点的比例也会显著不同。
因此,判断趋势至少要同时查看请求数、带宽、独立主体、访问目的和带来的真实用户转化。低成本的健康检查请求与一次高成本视频抓取,不能只按“各一次”计算。Cloudflare 观察到的是其网络覆盖范围内的流量,不应无条件外推为整个互联网的精确人口统计。
| 口径 | 能回答的问题 | 局限 |
|---|---|---|
| HTTP 请求数 | 谁访问得更频繁 | 不代表内容价值与流量大小 |
| 带宽 | 谁消耗更多网络资源 | 大文件会放大单次请求 |
| 独立身份 | 有多少 Agent 主体 | 身份伪装和共享出口难识别 |
| 业务转化 | 是否带来订单或订阅 | 归因链路仍不成熟 |
十、机器人流量的分类体系
“非人类流量”是一个过于宽泛的标签。搜索引擎索引、AI 训练、Agent 实时访问、网站监控、价格比较和恶意撞库都由机器产生,却有完全不同的价值与风险。站点应先按主体是否可验证、访问目的、是否代表用户以及是否遵守策略分类。
| 类别 | 典型目的 | 推荐策略 |
|---|---|---|
| 搜索索引 | 帮助网页被发现 | 允许但控制频率 |
| AI训练 | 构建或更新模型 | 按版权与授权政策决定 |
| Agent访问 | 代表用户查询或办事 | 验证身份、按用户权限授权 |
| 商业聚合 | 比价、监测、数据产品 | API、付费或合同接入 |
| 运维机器人 | 健康检查、安全扫描 | 固定身份与专用路径 |
| 恶意自动化 | 欺诈、抢购、攻击 | 挑战、限速与封禁 |
分类不能只靠 IP。云浏览器、代理网络和动态地址会让来源不断变化;可靠识别需要签名身份、TLS 特征、请求行为、历史信誉和站点自身的业务信号组合判断。
十一、Agent访问网站的完整链路
当用户要求 Agent “比较三家酒店并预订”时,Agent 可能先搜索目的地、访问多个页面、读取评论、查询地图、调用价格 API,最后回到预订服务。一次人类意图由数十个机器请求完成,这就是流量放大的基本机制。
用户授权与预算 ↓ Agent 身份认证 ↓ 搜索/站点/API 多次访问 ↓ 证据汇总与方案比较 ↓ 用户确认 交易接口 → 订单与审计记录站点若能识别 Agent 代表的真实用户,可按用户订阅权限提供内容;若无法证明代理关系,只能按公开访问策略处理。未来身份协议需要同时保护隐私:站点应知道请求获得了授权,却不必知道用户所有个人信息。
十二、付费抓取与内容授权
付费抓取的难点不是简单按请求收费。不同页面的创作成本、更新频率和商业价值不同,Agent 还可能缓存一次访问服务多个用户。可探索按 Token、页面、带宽、用途、时间窗口或最终收入分成,但任何方案都需要可靠身份和计量。
| 计费方式 | 优点 | 难点 |
|---|---|---|
| 按请求 | 实现简单 | 无法反映内容大小与价值 |
| 按带宽 | 与基础设施成本相关 | 高价值短文本可能被低估 |
| 按内容包/API | 产品边界清晰 | 需要站点重建接口 |
| 按用途授权 | 区分训练、检索和展示 | 用途难以技术验证 |
| 收益分成 | 与商业结果一致 | 归因复杂、结算周期长 |
robots.txt 仍可表达偏好,但真正的商业交换需要机器可读许可证、身份验证、计量和争议处理。否则,守规则的 Agent 付费,隐藏身份的抓取器免费,市场会产生逆向激励。
十三、对网络架构的影响
Agent 请求比传统网页浏览更突发、更并行,也更依赖 API 与结构化数据。网站可能需要为机器访问提供稳定的 JSON 端点、明确的错误码和幂等操作,同时为人类保留富交互页面。缓存策略也会变化:高频重复的公开知识适合边缘缓存,个性化交易则必须按身份隔离。
基础设施提供商会承担身份验证、Bot 管理、速率控制、内容计量和攻击防护等新职责,但平台权力也随之扩大。网站需要能够导出日志、解释策略和选择其他服务商,避免机器访问规则被少数中间层完全控制。
十四、社会层面的真实性问题
当自动内容发布与自动访问同时增长,浏览量、点赞、热度和“大家都在讨论”可能越来越难代表真实人类兴趣。平台应区分机器生成、机器传播和真实用户认可,并为研究者提供透明统计。验证人类身份也不能演变为强制收集过多个人信息,匿名权与反滥用需要同时保护。
未来更可取的机制是证明“这是一个获得授权的真人会话”或“这是一个可追责的 Agent”,而不是向每个网站重复暴露用户真实身份。真实性治理的目标不是消灭自动化,而是让人们能够判断信息由谁产生、代表谁行动、出现伤害时由谁负责。
十五、总结
| 维度 | 核心要点 |
|---|---|
| 变化 | 流量主角从人类浏览转向机器执行 |
| 关键能力 | 身份、授权、速率与审计 |
| 长期问题 | 内容价值如何被计量与公平交换 |
“1:1000”更像一个尖锐的方向标:未来网络规则必须服务于人机共存,而不能只靠静态爬虫协议。谁能建立可信的机器身份与访问市场,谁就更有可能掌握下一代互联网入口。
参考资料:
- Cloudflare Investor Relations
- Cloudflare Bot Management
- Cloudflare:构建 Agentic Internet 的商业模式
- Cloudflare:超越 Bot 与 Human 的二分法