
1. 全新 AI 流量管理选项推出背景
一年前,Cloudflare 宣布首个 [“内容独立日”],让网站所有者重新掌控内容。过去 30 年爬虫与网站所有者的模式已不适用,AI 无偿获取内容,对网站所有者构成生存威胁,所以推出一键“阻止 AI 机器人”选项和 [“按次爬取市场”]。一年间情况变化大,去年 7 月讨论围绕阻止未经补偿的 AI 训练,如今人们希望有更细致解决方案,内容所有者希望保护内容并获补偿,网站所有者也希望有更多选择。对于小型网站,不仅面临内容被用于模型训练问题,还存在网站难以被发现的困境,网站所有者需艰难抉择。若现有搜索提供商用相同机器人进行搜索和训练,会获得不公平优势,促使新参与者采取规避策略。
2. 如今 AI 无处不在
如今,AI 已融入各个领域,谷歌搜索已转变为 [“全面答案引擎”],这是“搜索”发展的大趋势。由于“AI”定义标准随时变化,所以不再主要依据是否为“AI”对机器人分类,而是探究机器人或代理的行为。
3. 实用的分类体系
为解决问题,需要一个与客户关注的 AI 使用场景相匹配的实用分类体系。将讨论范围扩展到三个客户希望管理的 AI 使用场景:搜索,即收集或索引网站内容以便日后回答问题,网站所有者应获推荐流量或其他补偿;代理,通常实时代表用户执行任务,背后有用户等待;训练,爬虫获取网站内容用于训练或微调模型,网站数据会被永久纳入 AI 底层架构。网络上许多流行爬虫可归入这些类别,有些还同时符合多个类别。除这三种,还对其他多种行为分类。鼓励机器人运营者将不同用途的爬虫分开,以提高透明度,让网站所有者更好管理访问权限。希望建立可扩展的分类系统,新体系更能反映当前机器人流量实际情况,认识到具有多种用途的机器人应标记所有用途。
4. 管理 AI 流量的新选项
希望为 Cloudflare 网络上的所有网站所有者提供更多管理不同类型 AI 流量的选项。之前推出的“阻止 AI 机器人”管理预设主要针对单一用途机器人。但并非所有 AI 使用场景都相同,所以推出基于搜索、代理和训练这三大主要使用场景来管理 AI 流量的功能,客户包括免费套餐用户都能更精细地调整管理方式。
5. 设置新的默认规则
2026 年 9 月 15 日,将为三个分类设置新的默认规则。对于新加入 Cloudflare 的域名,在显示广告的页面上,默认阻止“训练”和“代理”类别的访问,“搜索”类别默认允许访问。因为广告页面网站所有者希望用户访问并看到广告,所以阻止可能影响用户关注的机器人;搜索能自然地为网站带来访客,允许搜索符合大多数网站所有者利益。9 月 15 日,多用途爬虫将根据所有行为决定是否允许访问,若客户选择阻止“训练”类别,像 Googlebot、Applebot 和 BingBot 等多用途爬虫将被阻止访问。当然,网站所有者若不想采用新的默认配置,可在 9 月 15 日前随时进行标记。接近 9 月 15 日时,会继续通知客户默认规则的更改。
6. BotBase:为企业客户提供全新的可见性平台
为企业级 Bot 管理推出一项重大的可见性更新功能,推出 [BotBase]。BotBase 是全新的数据库,用于跟踪所有已知的机器人,在 Cloudflare 仪表板上提供全面且可搜索的视图。今年晚些时候,还将扩展其功能,使其成为直接管理网站上已知自动化内容的控制中心。企业级 Bot 管理客户可查看所有经过验证的机器人/代理的完整目录及它们在更新后的分类体系中的归属,还可轻松过滤特定机器人的流量并复制检测 ID 用于安全规则设置。构建 BotBase 时考虑了机器人在网站上的行为,将其分类为搜索、代理、训练、交易、数据收集、安全测试、SEO、广告验证、社交/链接预览、内容源抓取、监控与运维等,其中加粗斜体行表示所有客户都可配置的新选项。
7. 爬虫如何使用我的内容?
了解到客户关注机器人的内容使用方式,正在为 Bot 管理客户构建根据“内容使用方式”进行选择和阻止的功能。此设置分为三个等级:immediate,仅进行交互,不存储和重复使用内容;reference(默认),索引、摘录并提供链接;full,总结并复制内容。这些值可与机器人分类结合使用,表达更细致的规则。从今天开始,测试一个新的信号 use,它扩展了 [“内容信号”] 并可在 robots.txt 文件中使用,增加了可选字段表达偏好。内容使用信号的值仅表示网站所有者的偏好,非直接阻止。已启用托管 robots.txt 的客户,现在将在其中增加 use=reference 的偏好。还开始在 BotBase 中跟踪每个机器人的内容使用情况,滥用信号的机器人将失去“已验证”状态,目前完全复制内容的机器人无法获得“已验证”状态。
8. 机器人被验证意味着什么?
“已验证”的定义正在更新,以反映即将到来的默认允许和阻止规则的变化。以前“已验证”的机器人默认允许访问,现在“已验证”标签仅表示该机器人在相关类别中是可允许的,“允许类别”决定哪些机器人可访问网站。为平衡这一变化,将开放机器人验证流程并提高其透明度。要使机器人获得“验证”,运营者需证明诚实展示身份和不滥用访问权限。目前正在构建管理工具帮助运营者确保分类系统准确反映机器人情况。
9. 尝试传递信任机制
如今访问网站的机器人往往并非由开发者直接运行,存在传递信任问题。提议利用 [RFC 7239] 中定义的现有 Forwarded 头部信息,该头部信息随请求传输,允许“代理组件披露在代理过程中丢失的信息”。当网站所有者说“允许这个运营者”时,无论该运营者如何访问网站,偏好都将生效。结合内容使用扩展,头部信息添加可指定运营者使用内容的方式。这符合建立的激励模式,在 Cloudflare 背后失去受信任地位是一种威慑,信任成为可获得和失去的资产。然而,这种传递信任机制可能无法涵盖所有能识别身份的用户,今天提出的措施有助于传递信任,但并非适用于所有网站和情况,小型流量来源需要隐私,相关公司可探索构建代理互联网未来的公平基石。
10. 立即设置你的规则
这些小变化都让网站所有者能更好控制谁可以使用他们的内容以及如何使用。新默认规则将促进透明度,反映行业发展趋势。网络环境不断变化,Cloudflare 也会不断调整,但方向不变,即构建基于信任的网络生态系统,让创作者决定作品使用方式,诚实使用内容的人将获得更多访问权限。管理 AI 流量的新选项现已上线,现有客户可在 [“区域设置”] 中配置。未使用 Cloudflare 的用户可免费开始使用以设置流量控制规则。

433

被折叠的 条评论
为什么被折叠?



