AI训练使用版权书籍:法律边界何在?

AI训练与版权法的复杂关系
如今,驱动ChatGPT、Gemini、Claude等聊天机器人的智能体模型,似乎被训练在无穷无尽的数据库中,包含数以亿计的书籍、网络文章、学术论文以及互联网上能找到的几乎所有内容。大多数出版作者在不知情或未同意的情况下,为开发了可能威胁他们生计的同一AI工具做出了贡献。这看起来似乎违法,对吗?
但现实并非如此简单。
法律专家的观点
“我认为这个法律领域和技术领域存在的一个问题是,其中涉及的事情非常复杂,”知识产权、版权和技术专家律师Cathy Gellis表示。”情况非常复杂,对于正在发生的事情,各方都有强烈的情绪反应。”
具有里程碑意义的案件
去年,在同类裁决中的首次案例之一,法官William Alsup命令Anthropic向一群作家支付高达15亿美元的版权和解金,这些作家的作品被用于训练该公司的智能体模型。表面上看,这似乎是对作者有利的道德胜利,但Alsup法官实际上裁定Anthropic的AI训练是合法的。Alsup惩罚Anthropic的是他们从非法在线影子图书馆盗版书籍的行为。
“就像任何立志成为作家的读者一样,Anthropic的大型语言模型学习作品不是为了抢先复制或取代它们——而是要转弯创造一些不同的东西,”法官写道,他将大型语言模型吸收万亿单词的方式比作作家对文学的研究。
裁决的影响
Gellis认为这一裁决对AI公司更为有利。对于一个预计到2028年将产生约2000亿美元年收入的公司来说,15亿美元的罚款算什么呢?
“我认为这对于AI训练来说是个好消息,因为他审视了正在发生的事情,并认为这类似于阅读受版权保护的作品,而不是复制受版权保护的作品,”Gellis说。”版权法依赖于复制,但它不依赖于使用作品、体验作品、消费作品或阅读作品。”
过时的版权法
版权法自1976年以来一直没有更新,这意味着法官们必须设法解释50年前的指导方针,以应对可能塑造AI行业未来的法律问题。
“目前每个人都非常担忧,因为法律规定非常混乱,正是因为这个问题,”JWL国际知识产权与媒体实践高级律师兼创始人Jason Henderson表示。”他们知道AI模型已经基于海量内容进行了训练,但法律实际上还没有跟上这个问题的步伐。”
合理使用原则
这些问题常常围绕合理使用原则展开——即使用受版权保护的作品是否足够”转化”以被视为合法。
合理使用是版权法的一项例外,允许在未获得明确许可的情况下使用受版权保护的材料,通过批评、模仿、教育等方式保护对受版权保护作品进行评论和迭代的能力。法官在判断某事是否构成合理使用时会考虑特定因素,包括作品的目的和性质、使用量及其对市场的影响。
“版权始终关乎保护和促进市场,”Henderson指出。”法院在AI案件中的推理各不相同。如果训练他人财产的目的是直接竞争,那么法院会反对…如果不会产生竞争,法院则倾向于找到认可的方式。”
商业竞争案例
Henderson指的是媒体和技术公司Thomson Reuters起诉研究公司Ross Intelligence的案件,后者复制其内容以构建竞争性的AI法律平台。
“Ross的使用不是转化性的,因为它没有’Thomson Reuters的进一步目的或不同特性’,”Stephanos Bibas法官去年写道。
在该案中,Bibas法官裁定,使用Reuters的内容来开发将与它直接竞争的新平台不属于合理使用。虽然作者可能会争辩说聊天机器人通过使用他们的作品生成新的合成书籍与他们竞争,但这一论点在法庭上尚未获得成功。
AI与版权的多维关系
当涉及到AI与版权的关系时,Gellis发现缩小我们实际讨论的范围很有帮助——我们对AI训练中版权的思考方式与我们思考AI生成内容的版权方式有很大不同。
在一个案例中,法院裁定如果作品100%由AI生成,则不可获得版权保护,这引发了一系列新问题——我们如何确定证明作品是否使用AI生成,如果确实使用了,我们又能知道其中有多大比例是由AI创建或辅助完成的?
“如果你用[微软]Word写小说并运行拼写检查,我们很容易接受Word不拥有你的小说这一概念,”Gellis说。”[AI]迫使我们审视…”
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!