人工智能公司正在扫描大量书籍,有时是稀有书籍,并经常在训练模型的过程中销毁它们——现在我们已经了解了哪些公司以及他们是如何做的。

独立科技媒体出版物 404 Media 在一批善本书籍中放置了一个跟踪设备,并观察其运送到位于拉斯维加斯的亚马逊工厂,该公司在那里扫描并销毁印刷书籍以训练人工智能。

周一发布的这项调查首次公开指出了与人工智能培训相关的大量书籍购买的最终去向。

最后一站是亚马逊的VGT3团队。员工告诉该媒体,他们所做的就是接收大量印刷书籍,然后剪掉装订,以便页面更快地送入扫描仪。这本书在这个过程中被毁掉了。该团队极其合适的标志是一只爪子里抓着一本书的恐龙。

为什么印刷书籍突然受到需求

2022 年之前印刷的书籍所载的文本大多不容易在网上获得,而且最重要的是,它们不是机器编写的。根据自己的输出类型训练模型存在“模型崩溃”的风险,即每次递归循环质量都会下降。

因此,2022 年之前的论文是人工智能训练的清洁燃料。

亚马逊并不是唯一一家。一个家庭手工业已经形成,为人工智能实验室提供被剥离、扫描和丢弃的实体书籍——“华氏 451 度”文本被销毁的场景,以供机器使用,Anthropic 内部的“巴拿马计划”已经大规模运行,通过破坏性扫描将数百万本书数字化。

对干净文本的争夺已经进入法庭。一位联邦法官裁定,在合法购买的书籍上训练人工智能可以符合合理使用的条件,Meta 和 OpenAI 也声称 Anthropic 取得了部分胜利。盗版则是另一回事:Anthropic 同意就扫描版盗版书达成 15 亿美元的和解协议,而 Salesforce 现在面临着涉嫌盗版图书的集体诉讼。

由于结构性原因,亚马逊业务保持安静。书商注意到过去一年中批量订单的激增,并怀疑人工智能公司是幕后黑手——买家对价格并不敏感,而且似乎是随机挑选书名。他们的担忧最终被显示目的地的航空标签证实了。

亚马逊表示,它“通过商业渠道购买书籍,以帮助开发和改进客户使用的产品和服务。”