AI 公司被曝大量收购旧书,以获取“纯净”训练素材
IT之家7月28日消息,AI公司在推动内存和存储资源日益紧张之后,如今似乎又将目光投向了人类的文学遗产。调查媒体404Media最新报道称,多家AI公司正通过中间商大规模收购二手图书,以获取高质量训练数据用于训练AI模型,同时避免引发公众舆论反弹。
AI 的发展离不开海量数据(603138),但并非所有数据都有价值,关键在于数据质量。近年来,大量由AI生成的低质量内容(俗称“AI垃圾内容”)充斥互联网,不仅污染了数据环境,也降低了AI继续学习的效果。因此,领先的AI公司开始重新寻找由人类创作的内容,尤其是2022年之前出版的纸质书籍,因为这些内容更有可能是原创作品,尚未受到AI生成内容的污染。
事实上,AI公司利用纸质图书训练模型已有先例。作为当前卷入版权诉讼的主要AI公司之一,Anthropic曾投入数百万美元购买大量纸质图书,用于提取内容训练Claude AI模型,随后再将这些图书销毁。据悉,该公司从Better World Books大量采购图书。法院虽然认定,将正版图书用于AI训练属于版权法中的“合理使用”,但Anthropic因长期保存一个包含700万本盗版图书的数据库,侵犯了作者和出版商版权,最终被判赔偿高达15亿美元(IT之家注:现汇率约合101.62亿元人民币)。
类似争议也发生在谷歌身上。近期,一个出版商联盟已对谷歌提起诉讼,指控其未经授权使用数百万本受版权保护的图书训练Gemini AI模型。
拥有超过1.11亿本图书目录信息的在线数据库ISBNdb,长期以来一直是书商、图书馆和发行商的重要平台。随着AI行业迅速发展,ISBNdb也开始调整业务方向,推出专门面向AI企业的大规模图书采购服务。
404Media报道称,相关订单规模从一次采购1000本到一次采购100万本不等。
一位不愿透露姓名的职业书商表示,今年4月以来,图书销量出现了前所未有的增长。过去生意好的时候,一周只能卖出约20本书;而近几个月,每周销量已飙升至数百本,是平时销量的约五倍。
Alibris、Biblio等二手书交易平台上的其他书商,也反映出现了类似的大宗采购现象。
尽管目前没有确凿证据证明这些采购行为一定来自ISBNdb或某家AI公司,但其中存在不少异常现象。例如,大规模采购的对象几乎全部都是带有国际标准书号(ISBN)的图书,这种由13位数字组成的编码是全球图书唯一识别标识。
此外,这些采购行为几乎没有任何主题、类型或作者偏好,无论是小说、教材还是专业书籍都在采购范围内。更令人意外的是,买家似乎完全不在意价格,即使部分图书明显高于市场价,也会直接买下。
在 Anthropic的版权诉讼过程中,曾参与Google Books项目、后来负责Anthropic“巴拿马计划(Project Panama)”数字化项目的汤姆.哈维(Tom Harvey)证实,Anthropic曾聘请多家专业文档扫描公司对纸质图书进行数字化处理。
其中一家合作公司是Datamation Information Services,该公司提供非破坏性扫描和破坏性扫描两种图书数字化服务。
非破坏性扫描通常使用俯拍扫描仪、平板扫描仪或V型扫描设备,在不拆解图书的情况下完成数字化。而破坏性扫描则会直接拆开书籍,将每一页送入高速工业扫描仪进行处理。
由于破坏性扫描效率更高、成本更低,因此AI公司普遍选择这一方式,最终导致数百万本纸质图书被拆毁。
毫无疑问,纸质图书对于AI来说是一座巨大的知识宝库。然而,这种做法也引发了越来越多的伦理争议。
批评者认为,目前尚不清楚AI公司在数字化过程中,是否会区分普通图书与珍贵图书、绝版图书。如果这些稀有书籍被拆毁,它们可能将永久退出流通。
另一个更大的问题在于,这些扫描后的内容最终都会进入AI公司的私有数据库,仅用于训练AI,而普通公众无法访问。
这意味着,人们或许能够获得更加智能的AI,但代价可能是,人类积累的大量知识资源将不再以公开、可获取的形式留给未来世代。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com