Patreon 停止友好协议转为技术封锁 AI 爬虫,创作者内容授权博弈进入硬对抗阶段
创作者付费平台 Patreon 宣布放弃 robots.txt 这种自愿性约束机制,从本月起对所有主流 AI 训练爬虫启用主动识别和请求拦截。这是订阅制创作者平台首次公开表态放弃与 AI 公司之间的协议式共识,转向硬技术对抗。
Patreon 首席技术官凯瑟琳在博客中列出了具体的技术方案。平台将部署一套结合请求签名、行为指纹和验证码挑战的三层拦截,主要针对 OpenAI 的 GPT 爬虫、字母表公司的 Google 爬虫、meta 的 llama 爬虫以及 Anthropic 的 claude 爬虫。识别命中后请求会被静默丢弃而不是返回错误。
Patreon 之所以调整策略,起因是过去一年间创作者的持续投诉。平台内部数据显示,有超过十四万活跃创作者的付费专属内容曾在生成式模型的输出中被复现,其中约百分之十七的复现内容与原文相似度超过八成。这些数据被创作者作为集体诉讼的证据在美国联邦法院立案。
放弃 robots.txt 的直接原因是这种机制在生成式模型时代几乎完全失效。robots.txt 依赖爬虫方自我约束,而多家研究机构公开的对照实验表明,主流 AI 公司在实际爬取时并不严格遵守相关声明,尤其是通过第三方数据集绕过声明的做法广泛存在。
技术封锁的成本并不低。Patreon 内部估算,三层拦截系统的部署成本约一千五百万美元,年度运维成本约六百万美元。这个成本对一家年营收在数亿美元规模的平台来说不算小,但相比创作者流失带来的商业损失还是更可控。
AI 公司对 Patreon 的举动没有集体回应。OpenAI 的公共政策发言人给出的表态维持了此前的立场,即公司严格遵守站点的自愿声明。字母表公司则表示会持续评估各站点的可访问策略。Meta 和 Anthropic 目前没有公开回应。
类似的技术封锁在其他创作者平台已经零星出现。Substack 在四月启用了对特定 AI 爬虫的针对性限流,Medium 在五月与 OpenAI 达成了内容授权协议以换取 opt-out 能力,只有 Patreon 这次直接选择硬拦截路线。三种策略中长期效果如何还需要时间验证。
从法律角度看,Patreon 的技术封锁给正在审理的集体诉讼提供了新的举证材料。原告方可以据此主张平台已经明确表达了不允许爬取的意愿,AI 公司如果继续通过第三方数据集获取平台内容,构成故意侵权的证据链更清晰。
创作者社区对 Patreon 的决定普遍表示支持。平台过去两个月流失的高频创作者中有约六成表示会考虑回归,前提是硬拦截真的能持续起作用。技术封锁的实际防御效果需要在未来六到十二个月内接受市场验证。