US government sides with OpenAI on issue of training LLMs on copyrighted material

AI前沿4小时前发布 yizz
727 0 0

美国政府为何在版权与人工智能训练争议中站到OpenAI一边?

在《纽约时报》起诉OpenAI的案件中,特朗普政府提交了一份20页的法律意见书,为这家ChatGPT开发公司使用未经许可的版权材料训练大语言模型进行辩护。这份文件显示,美国政府正将人工智能产业的全球竞争力,与AI训练数据版权争议联系在一起。

案件争议的核心是什么?

《纽约时报》认为,像OpenAI这样的人工智能公司在训练模型时使用受版权保护的内容,可能涉及违法问题。争议焦点并不只是模型最终生成了什么,而是人工智能公司在训练阶段,是否可以将大量已经出版的作品复制、整理并输入数据库,而且不必事先获得版权所有者的许可。

目前,驱动ChatGPT、Claude和Gemini等聊天机器人的大语言模型,通常需要依靠规模极其庞大的数据进行训练。这些数据包括:

  • 受版权保护的书籍
  • 新闻报道和文章
  • 其他形式的媒体内容

来源材料指出,人工智能公司将这些已经发表的作品输入训练数据库时,并没有取得相关授权。这也使出版商与AI公司之间的矛盾集中爆发:出版商关注作品是否被未经许可地使用,AI公司则需要面对训练模型所需的大规模数据来源问题。

美国政府提交了什么立场?

在这起诉讼中,特朗普政府提交了一份20页的意见书,立场偏向OpenAI,支持其对未经许可的版权材料进行大语言模型训练的做法。

意见书强调,美国在继续发展一个强大且具有竞争力的人工智能产业方面拥有重要利益。文件还表示,美国需要在全球人工智能使用的实践与程序方面建立标准,因此保持美国在人工智能领域的全球领导地位至关重要。

“美国对于继续发展一个强大且具有竞争力的人工智能产业拥有重大利益,该产业能够在全球范围内为人工智能使用的实践和程序设定标准……因此,美国保持人工智能领域的全球领导地位至关重要。”

这段表述引用了特朗普总统前一年签署的一项行政命令。从政府提交的意见书来看,人工智能产业的国际竞争力和美国的技术领导地位,是其支持OpenAI立场的重要理由。

为什么出版商反对AI公司使用这些内容?

许多出版商都在关注人工智能模型训练中的版权问题。来源材料提到,包括《纽约时报》在内的多家出版商,已经试图主张:人工智能公司未经许可使用受版权保护的作品来训练AI模型,是违法行为。

出版商担忧的关键在于,书籍、文章和其他媒体内容并非天然可以被AI公司自由使用。它们通常由作者、媒体机构或出版商创作、编辑和发布,背后涉及明确的版权关系。当这些内容被批量放入人工智能训练数据库时,版权所有者是否应当被告知、是否需要获得授权,以及是否应当获得补偿,就成为诉讼争议的重要组成部分。

这起诉讼反映了怎样的矛盾?

这场争议实际上体现了两种利益之间的冲突:

  • 人工智能产业的利益:大语言模型需要大量文本和媒体材料进行训练,AI公司希望继续利用广泛的数据发展模型能力。
  • 版权所有者的利益:出版商希望自己的书籍、文章和其他作品不会在未经许可的情况下被投入AI训练,也希望版权规则得到明确执行。
  • 国家技术竞争的利益:美国政府强调发展具有竞争力的人工智能产业,并希望美国继续保持全球人工智能领导地位。

因此,案件并不只是OpenAI与《纽约时报》之间的单一纠纷,也涉及人工智能训练数据如何使用、版权边界如何界定,以及产业发展与知识产权保护应如何平衡。

目前可以确认的事实是什么?

根据现有材料,可以确认的是:《纽约时报》已经起诉OpenAI;特朗普政府提交了20页意见书,为OpenAI使用未经许可的版权材料训练大语言模型进行辩护;政府强调美国发展强大、具有竞争力的人工智能产业,以及保持全球人工智能领导地位的重要性;与此同时,包括《纽约时报》在内的许多出版商,正在主张这种未经许可的训练行为属于违法。

来源材料没有进一步说明案件最终是否已经作出裁决,也没有说明法院是否采纳了美国政府的立场。因此,关于这场版权争议的最终法律结果,仍不能仅凭现有内容作出判断。

我认为:人工智能可以迅速阅读海量内容,却不能因此让创作者的权利悄无声息地消失。技术若只追求速度,版权便可能被当成脚下的尘土;而一个真正强大的人工智能产业,也不应只靠“能不能用”来证明自己,更要回答“凭什么用、怎样用、谁来负责”。美国政府把AI竞争力与全球领导地位摆在台前,出版商则把未经许可的使用摆在法庭上——这场争论的意义,或许就在于提醒人们:机器学习的是人类留下的文字,而社会最终仍要为这些文字建立清楚的规则。

#人工智能监管

© 版权声明

相关文章