欢迎您访问欢迎来到沄森网,沄森智能旗下资讯平台!今天是:2026年07月30日 星期四 农历:丙午(马)年-六月-十七
您现在的位置是:首页 > AI

吃掉作家文字销毁纸质书,美国 一 家 AI公司因AI训练数据版权纠纷被判赔 1 5 亿美元

创始人2026-07-29 22:23:01
  《Bartz v. Anthropic PBC:关于合理使用的裁定》首页内容,来自美国加利福尼亚北区联邦地区法院官网  7月29日,美国一家AI公司大量购买二手书籍,扫描获取数据“喂”给AI大模型训练并将纸质图书销毁一事在社交媒体引发热

  《Bartz v. Anthropic PBC:关于合理使用的裁定》首页内容,来自美国加利福尼亚北区联邦地区法院官网

  7月29日,美国一家AI公司大量购买二手书籍,扫描获取数据“喂”给AI大模型训练并将纸质图书销毁一事在社交媒体引发热议。涉事的AI公司是近几年来风头正盛的Anthropic,该公司由一批前openAI公司高管创立,他们的主要产品为人工智能大语言模型Claude。

  扫描纸质图书内容训练AI大模型后并销毁纸质书,这一行为的披露源于美国加利福尼亚北区联邦地区法院官网在今年7月中旬发布的《Bartz v. Anthropic PBC:关于合理使用的裁定》,这篇法律裁定书背后是一场美国史上最高昂的AI版权和解案,Anthropic为自己非法获取图书训练大语言模型而付出了高达15亿美元(约101亿元人民币)的代价。

  根据法院公开的判决文书,此次版权诉讼始于2025年,由美国恐怖小说家安德里亚·巴茨(Andrea Bartz)等为首的一批作家向 Anthropic发起集体诉讼。2023年,被AI公司广泛使用的大型训练文本库“The Pile”被曝光,其中一个名为“BOOK3”的数据集引起了作家群体的注意,这是一个包含有近20万册图书的在线图书馆数据集,而这些图书的来源是盗版网站,作家巴茨发现自己的作品赫然在列,自己精心创作的作品被“蒸馏”,作为作家的她无法忍受,因此巴茨与其他同样情况的作家联合起来开始对Anthropic发起集体诉讼,美国作家协会也参与到这场诉讼当中。随着司法调查的介入,Anthropic的AI大语言模型数据来源及方式被公开披露。

  该公司主要使用了两种方法“吃”掉作家们的文字,第一种方法是批量下载盗版图书资源,其中最开始被曝光的BOOK3就是盗版图书资源的一个合集,此外公司还从更多盗版网站下载了超700万本盗版图书,这些盗版图书包罗万象,不管是畅销书还是滞销书,是通俗读物还是冷门学术研究,统统被“喂”给了AI。

  第二种方法就是令网友们不寒而栗的纸质书摧毁法。为了获取“干净”的训练数据,该公司早前曾尝试过和出版社洽谈AI训练版权授权合作,后相关合作被搁置,公司转而斥资数百万美元采购二手纸质图书。Anthropic采用了一种相当冷酷的方式对待这些二手书,直接切掉二手书的书脊,扫描图书内容将之转化为机器可以阅读的文本,最后销毁纸质书。由于破坏性扫描效率更高、成本更低,因此AI公司普遍选择这一方式,最终导致数百万本纸质图书被拆毁。

  法庭文件显示,大约200万本实体书在这一过程中被销毁了,这些遭销毁的纸质图书具体目录并没有公开,但这种毁灭性破坏图书的行为引起了普遍的担忧,在纸质书被数字化的过程中,无法确定AI公司是否会区分普通图书和珍本、绝版图书,这也就意味着,很有可能一些流散在二手市场的绝版图书、珍本图书已经在这样的毁灭性电子化扫描行为中彻底的消失了。

  耐人寻味的是,Anthropic被判赔偿15亿美元的原因是持有盗版图书数据库,是明确的侵权行为,但采购纸质书扫描生成的资料库数字副本得到了法院的支持,认为这没有构成侵权。

  AI大语言模型使用出版图书进行训练早就不是什么秘密,相关的诉讼官司数不胜数,但其中的授权纠纷、伦理争议至今都没有被厘清。有相当数量的出版机构、作家不愿意将自己的作品“喂”给AI用来训练数据,但是却并没有有效的办法抵抗AI未经许可的抓取行为。Anthropic一案反倒是让人们发现了AI公司如何通过当前版权法的漏洞合法取得图书数据的办法,就是购买二手旧书后扫描并摧毁纸质书,一种并没有违反法律但是充满伦理争议的路径。尽管有人认为AI公司购入的这些二手图书大多没有什么商业价值可言,然而这样的破坏行为或许摧毁的不仅是一本书,而是未来的一种可能性,当下被视作 “无用废纸”的私人记录、边缘学科文稿,数十年后也许会成为社会史、文化史、民间研究无可替代的一手佐证,这种未来的可能性不应该被私人公司为寻求AI产业利益所断绝。

  中国《生成式人工智能服务管理暂行办法》第七条明确规定,生成式AI服务商必须使用具备合法来源的训练数据,并留存完整的溯源台账。在今年6月,国家版权局、工业和信息化部、公安部、国家互联网信息办公室联合启动打击网络侵权盗版“剑网2026”专项行动,其中特别提到了“从源头规范大模型训练,督促AI企业自查训练数据集、补齐素材版权授权,严禁未经许可抓取原创内容喂养模型。”同时也禁止使用AI扒取已出版内容拼凑新书,严禁使用AI洗稿现有作品。虽然法律在不断用新规来规范AI大模型抓取数据的行为,但这场版权战争还远不到结束的那一刻。

  扬子晚报|紫牛新闻记者 沈昭

所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。

举报邮箱:1002263188@qq.com

相关标签: