宣判!如果 Anthropic 使用你的作品进行训练,它会欠你 3000 美元

信息来源:https://futurism.com/Anthropic-writers-books-lawsuit-settlement

人工智能公司Anthropic已同意支付约15亿美元,解决一起涉及未经授权使用版权作品训练其AI模型Claude的集体诉讼。这一里程碑式的和解协议将为每部被非法使用的作品提供3000美元赔偿,涉及约50万部来自盗版数据库LibGen的书籍和其他出版物。

这起诉讼的和解标志着AI行业面临的知识产权挑战进入新阶段。法律专家将此案比作音乐行业的"Napster时刻",预示着AI公司与内容创作者之间的关系可能发生根本性转变。纽约时报援引一位律师的观点称,这一和解可能成为整个AI行业处理版权争议的重要参考。

和解条款的具体内容

根据原告方发布的新闻稿,和解协议的核心条款包括每部作品3000美元的标准赔偿金。如果最终申请赔偿的作品数量少于50万部,作者将获得更高的单作品赔偿;如果超过这一数量,Anthropic仍需按每部作品3000美元的标准支付。

值得注意的是,这一和解并不免除Anthropic面临进一步法律诉讼的可能性。如果其他作者认为该公司未经授权使用了他们的作品,仍可提起单独的诉讼。此外,Anthropic还同意删除其从盗版源获取的受版权保护的材料。

受影响的作者可以通过专门的和解网站提交申请,确认他们的作品是否包含在LibGen数据库中。LibGen是一个提供免费电子书下载的网站,长期以来一直面临版权侵权的指控,现在成为确定赔偿资格的关键参考。

图片来源: Getty / Futurism

《纽约客》特约撰稿人凯尔·查卡的案例提供了一个具体的例子。他的两本书《过滤世界:算法如何扁平化文化》和《渴望更少:极简主义生活》都出现在LibGen数据库中,包括《过滤世界》的意大利语译本。根据和解条款,他预计可以获得超过1.2万美元的赔偿。

AI训练数据的版权困境

这一和解凸显了AI行业面临的根本性挑战:如何在不侵犯版权的前提下获得足够的训练数据。大型语言模型需要海量文本数据进行训练,而互联网上的大部分高质量内容都受到版权保护。AI公司长期以来依赖各种数据源,包括网络爬虫、公开数据集以及有时包括盗版材料。

Anthropic使用LibGen数据训练Claude的做法并非个例。许多AI公司都面临类似的版权争议,包括OpenAI、Meta和Google等行业巨头都因使用受版权保护的材料训练AI模型而面临诉讼。这些案件的结果可能重塑整个行业的数据获取和使用方式。

查卡在接受采访时表示,他认为3000美元的赔偿"应该算作许可费",因为AI训练是一个持续的过程。他建议应该采用更像传统许可协议的模式,比如"每5年5000美元,或者只要他们还在使用,每年1000美元"。不过他也承认,考虑到这相当于大多数书籍预付款的相当一部分,现有的赔偿金额似乎还算合理。

对内容创作行业的影响

这一和解协议对挣扎中的出版和写作行业来说是一个重要胜利。长期以来,作家和出版商一直面临着数字化转型带来的收入下降,而AI技术的崛起进一步威胁到传统的版权经济模式。

然而,一次性的赔偿可能无法解决根本问题。查卡指出,即使AI公司被禁止使用现有书籍进行训练,"科技界也总能找到绕过它的方法"。他认为真正有价值的将是"新数据",特别是新的新闻报道和实时内容。

这种观点反映了一个更深层的担忧:AI技术可能正在重构信息价值链,使传统的内容创作和分发模式面临根本性挑战。虽然法律和解可以提供短期的经济补偿,但它们可能无法解决AI与人类创作者之间长期共存的问题。

行业先例与未来趋势

Anthropic的和解可能为其他AI公司设立了一个重要先例。随着越来越多的版权持有者意识到他们的作品可能被用于AI训练,类似的诉讼可能会激增。这可能迫使整个行业重新考虑其数据获取策略,转向更透明和合法的许可模式。

一些AI公司已经开始主动寻求与内容提供商的合作。OpenAI与多家新闻机构签署了内容许可协议,而其他公司也在探索类似的伙伴关系。这种趋势可能会导致一个更加结构化的AI训练数据市场的出现。

然而,这种转变也带来了新的挑战。高质量训练数据的成本可能会显著增加,这可能有利于资源充足的大型科技公司,而对初创企业和研究机构造成不利影响。这种动态可能会进一步集中AI开发的权力,减少竞争和创新。

技术发展与监管应对

Anthropic案例也反映了监管机构在应对AI快速发展方面面临的挑战。传统的版权法是在完全不同的技术环境下制定的,可能需要更新以适应AI时代的现实。

欧盟已经通过了《人工智能法案》,对AI系统的开发和部署提出了严格要求。美国也在考虑类似的立法,可能包括对AI训练数据使用的更严格规定。这些法规的发展可能会进一步影响AI公司的运营方式和成本结构。

同时,技术社区也在探索可能减少对版权争议的依赖的方法,包括合成数据生成、联邦学习和差分隐私等技术。这些方法可能提供训练强大AI模型的替代路径,同时减少对受版权保护材料的依赖。

对于像查卡这样的个人作者来说,这笔意外之财可能提供了一些经济缓解。他表示计划将和解金用作"在意大利小村庄购买石砌联排别墅的首付,理想情况下没有wifi",这个回答既幽默又反映了许多创作者对数字时代的复杂感受。

这一和解最终可能被视为AI与传统内容行业关系演变过程中的一个重要里程碑,但它远非这个复杂问题的最终解决方案。

↑