AI数据抓取被指史上最大劳动盗窃 微软文件证实

AI数据抓取争议:微软高管文件揭示行业隐忧
最新解封的法律文件显示,微软一名高管私下将人工智能训练数据抓取行为称为”人类历史上最大的劳动盗窃”,这一言论源于纽约时报起诉OpenAI和微软的版权诉讼案。这起持续三年的法律纠纷揭示了AI行业在数据获取方面存在的道德和法律争议。
内部文件承认AI训练存在不当行为
根据法庭文件,微软一名高管私下描述两家公司的AI训练实践等同于”盗窃”,而OpenAI的领导层也承认,其AI模型对那些用于训练它们的出版商和记者构成了”生存威胁”。这些内部言论与两家公司公开表达的立场形成鲜明对比。
解封的材料还详细描述了这些公司 allegedly 如何规避付费墙获取内容,通过大规模抓取构建训练数据集,并故意从训练数据中剥离版权声明。这些做法引发了关于AI训练数据获取伦理的广泛讨论。
法律争议:合理使用还是侵权?
关于AI公司是否能合法使用受版权保护的材料训练AI,目前尚无明确答案。但法官们大多倾向于支持AI公司的论点,认为训练过程构成”合理使用”。这一法律原则允许在某些情况下(如 parody、新闻报道或批评)未经许可使用受版权保护的作品。
然而,许多新披露的陈述与OpenAI的合理使用辩护相矛盾,特别是关于使用不应替代或损害原作品市场的规定。例如,微软自己的数据显示,其Copilot”答案引擎”导致纽约时报网站的点击率与传统必应搜索相比下降了高达93%。
对出版业的潜在威胁
一位微软内部演示文稿中描述这一下降为”死亡循环”,会”同时损害我们模型和整个网络的性能”。该文件指出:”终端产品威胁到其必要供应商的经济基础,这是一种非常不寻常的情况,但这就是我们在LLM业务中相对于’内容供应链’所创造的局面。”
微软CEO萨提亚·纳德拉(Satya Nadella)在今年早些时候的证词中表示,”任何付费墙内容都应被希望使用它进行训练或基础模型构建的人授权使用”,并明确表示,如果”被告知OpenAI抓取并使用了付费墙后的信息”,他会”要求(微软的权利)要求OpenAI重新训练其模型”。
AI与原创内容的竞争关系
OpenAI的ChatGPT负责人尼克·特利(Nick Turley)在内部通讯中表示,出版商面临来自聊天机器人产品的”生存威胁”,这些产品”在很大程度上是替代性的”,并且”随着它们变得越来越好,替代性会越来越强”。OpenAI总裁格雷格·布罗克曼(Greg Brockman)将这些模型描述为”非常擅长新闻”。
纳德拉在宣誓作证时也同意,与聊天机器人对话”已经替代了……在AI平台上直接给你信息,而不是需要访问原始来源”。这种语言表明,技术可能直接与原创作品竞争,而非对其进行改造。
大规模数据复制引发担忧
文件首次揭示,仅OpenAI的中期训练数据集中就包含超过91,692份纽约时报、每日新闻和调查报道中心出版的作品副本。一个基于Common Crawl的数据集仅包含来自纽约时报网站就超过200万份文档。
在2023年1月的一份内部备忘录中,微软应用科学总监布伦特·赫希特(Brent Hecht)称其为”前所未有规模的惊人盗窃”和”人类历史上最大的劳动盗窃”。
数据获取的具体方式
文件详细说明了OpenAI和微软如何获取原告内容,包括从必应索引中抓取。文件中写道:”OpenAI向微软提供了完整的GPT-3训练数据集,微软用它来评估如何在其商业产品中实施OpenAI的模型。微软还通过名为Project Taxi和Project Mango的计划向OpenAI提供了训练数据。”
这些解封文件为AI训练数据获取的争议提供了新的视角,引发了对AI行业数据获取伦理和合法性的深入思考。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!