就像经典反乌托邦小说《华氏 451 度》中的场景一样,一些人工智能公司不仅仅是在读书,而是在毁掉它们。
随着开发人员竞相构建更强大的人工智能模型,以及版权诉讼的增加,家庭手工业如雨后春笋般涌现,为他们提供数以百万计的实体书,这些书被拆开,扫描到训练数据集中,然后丢弃。

404 Media 最先报道称,人工智能公司正在利用中介机构以匿名方式大规模收购图书。专门从事批量采购的公司宣传他们有能力找到数十万种图书,同时承诺为人工智能客户保密,这反映了这种做法的敏感性。
批评者表示,人工智能公司竞相保存人类创作的知识,以免其被人工智能生成的文本稀释,这通常被称为“人工智能废液”,推动了这种购买热潮。 2023 年生成式人工智能兴起之前出版的书籍尤其有价值,因为它们提供完全由人类编写的高质量训练数据。
需求的激增已经重塑了二手书市场。一位不愿透露姓名的书商告诉 404 Media,在人工智能买家进入市场后,每周的销量从大约 20 本书攀升至数百本。虽然增加的收入是有利可图的,但他表示,他担心不常见和绝版的书籍在被扫描和销毁后会永久丢失。
这位书商告诉 404 Media:“这不仅对我的经济有好处,而且还能清理掉那些不太可能卖掉的旧库存。” “我非常适合这些销售海外库存和外文书籍。另一方面,我不喜欢最终用途,也不喜欢不常见的书籍被制成纸浆。”
这种做法类似于 Anthropic 的“巴拿马计划”,该计划通过破坏性扫描将数百万本书数字化。
去年夏天,在 Bartz 诉 Anthropic PBC 版权诉讼中,旧金山的一位联邦法官裁定,将合法购买的实体书扫描成数字副本,即使原件已被销毁,也构成变革性的合理使用。联邦法官随后在涉及 OpenAI 和 Meta 的单独版权案件中发布了类似的合理使用裁决。
然而,在另一起案件中,同一地区的一名联邦法官本周批准了一项 15 亿美元的版权和解协议,要求 Anthropic 向数千名作者每本书支付约 3,000 美元,因为该公司使用盗版作品来培训克劳德。
为了应对日益强烈的反对声音,包括埃隆·马斯克在内的人工智能开发人员公开反对这种做法,并表示公司应该保持书籍的扫描状态。
马斯克在 X 上写道:“我已要求 SpaceXAI 团队将所有珍本书籍保存在图书馆中,并以艰难的方式扫描它们,而不是仅仅切断书脊并进行扫描。”