
用版权书籍训练AI合法吗?复杂且待定

AI 模型普遍依赖海量书籍、文章和论文进行训练,但多数作者对此毫不知情也未同意。这看起来像侵权,但法律上远没那么简单。版权法专家 Cathy Gellis 对 TechCrunch 表示,这个领域的技术和法律都很复杂,情绪对立强烈。
去年,法官 William Alsup 曾命令 Anthropic 向一批作家支付 15亿美元 版权赔偿,表面上像是作者胜利,但 Alsup 实际认定 Anthropic 的训练行为合法,罚的是它从非法影子图书馆盗版书籍。法官把大语言模型吸收数十亿词汇比作作家研读文学,认为这是阅读而非复制。Gellis 认为这一裁决对 AI 公司更有利,因为版权法约束的是复制,而不是使用、阅读或消费作品。
版权法自 1976 年后未更新,法官必须用五十年前的规则裁决可能重塑 AI 产业的问题。JWL International 的资深律师 Jason Henderson 表示,法律非常混乱,核心在于合理使用原则——即使用是否足够“转换性”。法官会考量使用目的、使用比例和市场影响。Henderson 指出,如果训练是为了直接竞争,法院往往不支持;若不会构成竞争,则倾向于放行。他引用 Thomson Reuters 诉 Ross Intelligence 案:Ross 利用其内容构建直接竞争的 AI 法律平台,法官裁决这不属于合理使用,因为缺乏“进一步目的或不同性质”。
但作者们声称聊天机器人用其作品生成新书来竞争,这一论点尚未在法庭获胜。Gellis 认为应区分 AI 训练和 AI 生成内容的版权。Thaler v. Perlmutter 案裁定,100% AI 生成的内容不可版权化,这引出如何证明作品由 AI 生成以及 AI 参与比例的问题。她比喻说,用 Word 写小说并运行拼写检查,不会有人认为 Word 拥有小说。AI 迫使人们重新审视许多被忽视的法律决策。
大多数 AI 公司仍身陷未决诉讼,短期内不会有明确答案。Gellis 指出,初期裁决正在产生影响,但可能被其他法院的相反决定推翻,最终需由后续诉讼决定哪种观点占上风。在此之前,这些判决都在塑造行业走向,AI 公司忽视它们是不明智的。


