
Patreon从请求转为封禁AI爬虫

Patreon 终于对 AI 爬虫硬起来了。之前他们也像大多数网站一样,用 robots.txt 告诉爬虫“请别抓”。问题在于,这种请求完全没有技术约束力——爬虫想不理就不理。测试时发现,某些 AI 训练爬虫每周会尝试抓取 Patreon 数千次,完全无视 robots.txt 里的指令。这意味着创作者辛苦产出的内容,被 AI 公司免费拿去训练模型,而平台只靠一张“君子协议”来保护。随着 Patreon 推出 Home Feed 和 Quips 这类暴露更多内容的社交功能,开放出去的作品更容易被爬虫瞄准。传统防护方案已经彻底失效,痛点就在于:自愿遵守的规则在利益面前形同虚设。
他们的解法很直接:不再请求 AI 爬虫别来,而是直接阻止。Patreon 跟 Cloudflare 合作,启用了对方提供的 AI Crawl Control 技术,主动封禁那些为训练模型而设计的爬虫。换句话说,从“请勿入内”升级成了“锁死大门”。测试效果非常显著:启用了主动阻止之后,单个爬虫每周的抓取尝试直接从数千次降为零。而且 Patreon 保留了正常的搜索引擎爬虫(比如谷歌),因为后者能带来流量。整个方案的关键在于借助 Cloudflare 的底层网络能力,在流量进入 Patreon 服务器之前就完成拦截,而不是事后靠分析日志。同时 Cloudflare 也推出了 Pay Per Crawl 市场,允许网站向 AI 公司收费放行,但 Patreon 选择直接封死。
这件事对内容平台和 AI 行业都有启示。第一,robots.txt 这类自愿协议正在失去信用,因为 AI 爬虫的开发者没有动力遵守。未来的保护必须依赖基础设施层面的强制封锁,比如 Cloudflare 提供的网络级拦截。第二,这会加速 AI 训练数据的“围墙化”——更多高价内容会藏在付费墙和反爬措施后面,导致公开互联网上可供训练的高质量数据越来越少。第三,Patreon 这个信号会倒逼其他创作者平台跟进,甚至可能推动立法要求 AI 训练必须获得明确授权。对创业者来说,这催生了新的商业机会:为版权方提供反爬、防盗用的工具链,或者帮助 AI 公司合规获取许可数据。总之,信任正在被技术替换,而数据获取的成本只会越来越高。


