Cloudflare 推出全新 AI 流量管理选项,助力网站所有者掌控内容使用!

1. 全新 AI 流量管理选项推出背景

一年前,Cloudflare 宣布首个 [“内容独立日”],让网站所有者重新掌控内容。过去 30 年爬虫与网站所有者的模式已不适用,AI 无偿获取内容,对网站所有者构成生存威胁,所以推出一键“阻止 AI 机器人”选项和 [“按次爬取市场”]。一年间情况变化大,去年 7 月讨论围绕阻止未经补偿的 AI 训练,如今人们希望有更细致解决方案,内容所有者希望保护内容并获补偿,网站所有者也希望有更多选择。对于小型网站,不仅面临内容被用于模型训练问题,还存在网站难以被发现的困境,网站所有者需艰难抉择。若现有搜索提供商用相同机器人进行搜索和训练,会获得不公平优势,促使新参与者采取规避策略。

2. 如今 AI 无处不在

如今,AI 已融入各个领域,谷歌搜索已转变为 [“全面答案引擎”],这是“搜索”发展的大趋势。由于“AI”定义标准随时变化,所以不再主要依据是否为“AI”对机器人分类,而是探究机器人或代理的行为。

3. 实用的分类体系

为解决问题,需要一个与客户关注的 AI 使用场景相匹配的实用分类体系。将讨论范围扩展到三个客户希望管理的 AI 使用场景:搜索,即收集或索引网站内容以便日后回答问题,网站所有者应获推荐流量或其他补偿;代理,通常实时代表用户执行任务,背后有用户等待;训练,爬虫获取网站内容用于训练或微调模型,网站数据会被永久纳入 AI 底层架构。网络上许多流行爬虫可归入这些类别,有些还同时符合多个类别。除这三种,还对其他多种行为分类。鼓励机器人运营者将不同用途的爬虫分开,以提高透明度,让网站所有者更好管理访问权限。希望建立可扩展的分类系统,新体系更能反映当前机器人流量实际情况,认识到具有多种用途的机器人应标记所有用途。

4. 管理 AI 流量的新选项

希望为 Cloudflare 网络上的所有网站所有者提供更多管理不同类型 AI 流量的选项。之前推出的“阻止 AI 机器人”管理预设主要针对单一用途机器人。但并非所有 AI 使用场景都相同,所以推出基于搜索、代理和训练这三大主要使用场景来管理 AI 流量的功能,客户包括免费套餐用户都能更精细地调整管理方式。

5. 设置新的默认规则

2026 年 9 月 15 日,将为三个分类设置新的默认规则。对于新加入 Cloudflare 的域名,在显示广告的页面上,默认阻止“训练”和“代理”类别的访问,“搜索”类别默认允许访问。因为广告页面网站所有者希望用户访问并看到广告,所以阻止可能影响用户关注的机器人;搜索能自然地为网站带来访客,允许搜索符合大多数网站所有者利益。9 月 15 日,多用途爬虫将根据所有行为决定是否允许访问,若客户选择阻止“训练”类别,像 Googlebot、Applebot 和 BingBot 等多用途爬虫将被阻止访问。当然,网站所有者若不想采用新的默认配置,可在 9 月 15 日前随时进行标记。接近 9 月 15 日时,会继续通知客户默认规则的更改。

6. BotBase:为企业客户提供全新的可见性平台

为企业级 Bot 管理推出一项重大的可见性更新功能,推出 [BotBase]。BotBase 是全新的数据库,用于跟踪所有已知的机器人,在 Cloudflare 仪表板上提供全面且可搜索的视图。今年晚些时候,还将扩展其功能,使其成为直接管理网站上已知自动化内容的控制中心。企业级 Bot 管理客户可查看所有经过验证的机器人/代理的完整目录及它们在更新后的分类体系中的归属,还可轻松过滤特定机器人的流量并复制检测 ID 用于安全规则设置。构建 BotBase 时考虑了机器人在网站上的行为,将其分类为搜索、代理、训练、交易、数据收集、安全测试、SEO、广告验证、社交/链接预览、内容源抓取、监控与运维等,其中加粗斜体行表示所有客户都可配置的新选项。

7. 爬虫如何使用我的内容?

了解到客户关注机器人的内容使用方式,正在为 Bot 管理客户构建根据“内容使用方式”进行选择和阻止的功能。此设置分为三个等级:immediate,仅进行交互,不存储和重复使用内容;reference(默认),索引、摘录并提供链接;full,总结并复制内容。这些值可与机器人分类结合使用,表达更细致的规则。从今天开始,测试一个新的信号 use,它扩展了 [“内容信号”] 并可在 robots.txt 文件中使用,增加了可选字段表达偏好。内容使用信号的值仅表示网站所有者的偏好,非直接阻止。已启用托管 robots.txt 的客户,现在将在其中增加 use=reference 的偏好。还开始在 BotBase 中跟踪每个机器人的内容使用情况,滥用信号的机器人将失去“已验证”状态,目前完全复制内容的机器人无法获得“已验证”状态。

8. 机器人被验证意味着什么?

“已验证”的定义正在更新,以反映即将到来的默认允许和阻止规则的变化。以前“已验证”的机器人默认允许访问,现在“已验证”标签仅表示该机器人在相关类别中是可允许的,“允许类别”决定哪些机器人可访问网站。为平衡这一变化,将开放机器人验证流程并提高其透明度。要使机器人获得“验证”,运营者需证明诚实展示身份和不滥用访问权限。目前正在构建管理工具帮助运营者确保分类系统准确反映机器人情况。

9. 尝试传递信任机制

如今访问网站的机器人往往并非由开发者直接运行,存在传递信任问题。提议利用 [RFC 7239] 中定义的现有 Forwarded 头部信息,该头部信息随请求传输,允许“代理组件披露在代理过程中丢失的信息”。当网站所有者说“允许这个运营者”时,无论该运营者如何访问网站,偏好都将生效。结合内容使用扩展,头部信息添加可指定运营者使用内容的方式。这符合建立的激励模式,在 Cloudflare 背后失去受信任地位是一种威慑,信任成为可获得和失去的资产。然而,这种传递信任机制可能无法涵盖所有能识别身份的用户,今天提出的措施有助于传递信任,但并非适用于所有网站和情况,小型流量来源需要隐私,相关公司可探索构建代理互联网未来的公平基石。

10. 立即设置你的规则

这些小变化都让网站所有者能更好控制谁可以使用他们的内容以及如何使用。新默认规则将促进透明度,反映行业发展趋势。网络环境不断变化,Cloudflare 也会不断调整,但方向不变,即构建基于信任的网络生态系统,让创作者决定作品使用方式,诚实使用内容的人将获得更多访问权限。管理 AI 流量的新选项现已上线,现有客户可在 [“区域设置”] 中配置。未使用 Cloudflare 的用户可免费开始使用以设置流量控制规则。

内容概要:本文提出了一种考虑用户行为的基于扩散模型的电动汽车充电场景生成方法,并提供了完整的Python代码实现。该方法充分利用扩散模型在复杂数据分布建模方面的优势,精准捕捉并还原电动汽车用户的实际充电行为特征,如充电时间、持续时长、充电功率及空间分布等,从而生成高保真、多样化的充电负荷场景。文中系统阐述了模型架构设计、训练流程、关键超参数设置及采样策略,实现了对充电需求不确定性的精细化建模,为后续电网规划、负荷预测、电力市场仿真及有序充电策略研究提供了高质量的数据基础。; 适合人群:具备一定Python编程能力和机器学习基础知识,从事电力系统、交通电气化、综合能源系统、智能电网等领域研究的科研人员、工程师及研究生,尤其适用于关注负荷建模、不确定性分析与数据驱动仿真方法的研究者。; 使用场景及目标:①生成具有真实用户行为特征的电动汽车充电负荷场景,支撑高比例电动汽车接入下的电力系统影响分析;②服务于车网互动(V2G)、需求响应、配电网扩容规划等应用场景,提升模型对用户随机行为的刻画能力;③作为深度生成模型在能源领域应用的典型案例,帮助研究人员掌握扩散模型的原理与工程实现技巧。; 阅读建议:建议读者结合所提供的Python代码逐模块深入学习,重点关注数据预处理流程、扩散过程的正向加噪与反向去噪网络设计,以及条件输入如何融合用户行为特征,并鼓励在自有数据集上进行迁移训练与参数调优,以充分理解模型对复杂充电行为模式的学习与生成机制。
内容概要:本文围绕基于DDPM(去噪扩散概率模型)的电动汽车充电行为场景生成展开研究,提出了一种融合用户行为特征的充电行为建模方法。通过Python实现了扩散模型的核心算法,旨在对电动汽车用户的充电时间、持续时长、充电功率等关键行为变量的不确定性进行高保真度模拟与多样化场景生成。该方法充分体现了数据驱动特性,利用真实充电数据训练模型,有效捕捉实际充电行为的随机性、个体差异与时序依赖性,生成具有统计一致性的多维行为场景样本,为电力系统规划、微电网优化调度、有序充电管理及V2G策略设计等应用提供可靠的概率性输入。研究重点涵盖了前向加噪与反向去噪过程的理论实现、网络架构设计、数据预处理流程及采样策略。; 适合人群:具备一定Python编程基础和机器学习理论背景的研究生、科研人员,以及从事智慧交通、新型电力系统、新能源汽车能源管理、城市基础设施规划等领域的技术研发工程师。; 使用场景及目标:①支撑电动汽车集群充电负荷的概率性预测与多场景分析;②服务于高比例电动汽车接入背景下的微电网、主动配电网优化调度研究;③为充电基础设施规划、车网互动(V2G)控制策略与需求响应机制设计提供精细化的行为建模工具;④作为扩散模型在能源与交通交叉领域应用的典型案例,用于教学演示与学术研究,深化对生成模型解决现实世界不确定性问题能力的理解。; 阅读建议:建议读者结合所提供的Python代码进行实践操作,深入理解DDPM的数学原理与实现细节,重点关注数据标准化、噪声调度、U-Net网络结构设计及反向采样过程。推荐同步学习扩散模型的基础理论文献,以更好地把握模型超参数选择与训练技巧,并尝试将其迁移应用于其他类型的能源消费行为或交通出行场景的生成任务。
内容概要:本文围绕“新能源发电接入弱电网的宽频带振荡机理及抑制方法”开展深入研究,结合Matlab编程与Simulink仿真平台,系统剖析新能源发电系统在弱电网条件下引发的宽频带振荡问题。研究聚焦于变流器控制动态、锁相环(PLL)频率耦合效应、序阻抗建模及其交互特性等关键因素,揭示振荡产生的内在机理。通过构建精确的数学模型与电磁暂态仿真模型,采用扫频分析法获取系统序阻抗特性,并结合奈奎斯特稳定性判据进行判别,验证理论分析的正确性。同时,提出针对性的抑制策略,如改进控制算法、引入阻尼补偿环节或优化控制器参数设计,以提升系统在弱电网环境下的稳定性。整个研究流程完整复现了博士论文级别的科研工作,具有较强的理论深度与工程应用价值。; 适合人群:适用于具备电力系统、电力电子或自动控制等相关专业背景,熟悉Matlab/Simulink仿真工具,正在从事新能源并网、电力系统稳定性分析、变流器控制策略研究的研究生、科研人员及电力行业工程技术开发者。; 使用场景及目标:①深入理解新能源并网系统在弱电网中发生宽频带振荡的物理本质与动态演化过程;②掌握基于频域阻抗法的系统稳定性建模与分析方法;③学习并复现高水平学术论文中的关键技术路线,提升独立科研能力与仿真建模水平;④为实际工程中新能源电站的并网稳定性问题提供理论依据与可行的抑制方案参考。; 阅读建议:建议读者结合文中提供的Matlab代码与Simulink仿真模型,逐步完成从阻抗建模、扫频仿真到稳定性判据应用的全过程实践,重点关注锁相环与电流环之间的动态耦合关系,并辅以相关文献深化对频域分析理论的理解,实现理论与仿真的深度融合。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值