
新证据:微软高管称AI抓取是“最大盗窃”

《纽约时报》诉 OpenAI 和微软版权案近日解封的新文件,首次披露了两家公司内部对 AI 抓取行为的多处自认性表述,揭示了这些行为背后的“盗窃”性质。
新公开的未脱敏文件显示,微软一名高管私下将两家公司的 AI 训练行为描述为“盗窃”。微软自己的内部文件也承认,生成式 AI 对新闻出版业构成“生存威胁”。例如,微软数据显示,与传统的必应搜索相比,其 Copilot “答案引擎”导致《纽约时报》网站的点击率下降了高达 93%。微软应用科学总监 Brent Hecht 在 2024 年 1 月的内部演示中,将这种下降描述为“厄运循环”,会“同时损害我们模型的性能和整个网络”。微软的一份文件还警告称,生成式 AI 可能“严重破坏那些生成基础模型训练数据的人的经济基础”。
其他新披露的内部沟通也削弱了 OpenAI 的“合理使用”辩护。OpenAI 内部文件显示,其研究人员曾计划规避付费墙,一位研究员在给奥特曼的内部邮件中提到了一个“绕过《纽约时报》付费墙的窍门”,奥特曼回复“不错”。OpenAI 前总裁 Greg Brockman 曾在内部称模型“非常擅长新闻”。微软 CEO 纳德拉在宣誓作证时也承认,与聊天机器人对话“已经取代了……直接访问原始网站获取信息”。
文件还首次披露了训练数据的庞大规模:OpenAI 的中间训练数据集中包含超过 91,692 份来自《纽约时报》、《每日新闻》和调查报道中心的受版权保护作品;一个基于 Common Crawl 的数据集中包含来自 nytimes.com 的超过 200 万份文档。OpenAI 还被指将完整的 GPT-3 训练数据集提供给微软,而微软则通过“Taxi 计划”和“Mango 计划”向 OpenAI 提供数据。
此外,OpenAI 员工据称还故意从训练数据中剥离版权声明,以免模型向用户输出这些内容。这些新披露的细节都对 OpenAI 和微软的“合理使用”抗辩构成挑战。截至目前,OpenAI 和微软均未回应置评请求。


