AI公司批量销毁实体书籍,安娜档案馆呼吁加速扫描保护人类知识
知名影子图书馆项目安娜档案馆(Anna's Archive)近日发布了一篇引人深思的博客文章,揭露了AI公司为了训练大语言模型而大量购买并销毁实体书籍的现象。文章指出,AI公司通过购买实体书籍后将其拆解扫描,以获取高质量的训练数据,而这些书籍在扫描完成后往往被直接丢弃或销毁,引发了关于知识保存和文化遗产保护的激烈讨论。
书籍销毁的规模与动机
据安娜档案馆披露,部分AI公司正在大规模采购稀有书籍和学术著作,将其物理拆解后高速扫描,形成训练数据集。这种"破坏性扫描"方式虽然效率最高——不需要逐页翻拍,可以将书脊直接切掉后送入自动扫描仪——但意味着每本书在使用后便无法恢复。安娜档案馆的创始人表示,他们的理想是在出版商完全封锁知识之前,以及AI公司扫描并销毁所有书籍之前,尽可能多地保存人类出版物的数字副本。
HackerNews上的观点碰撞
这篇文章在HackerNews上引发了激烈的讨论,以554个点赞成为当日最热话题。评论区的观点呈现鲜明对立:一方认为,AI公司购买书籍后有权按照自己的方式处理,而且这些公司实际上是在为知识数字化买单;另一方则认为,这种不可逆的破坏行为是对人类文化遗产的粗暴对待,尤其是在AI公司可能垄断这些数字化知识的情况下,公众将无法访问这些被扫描的书籍内容。
数字版权与知识获取的博弈
这一事件背后反映的是AI训练数据版权争议的新篇章。出版商和版权持有者正在加强对AI公司使用受版权保护内容的限制,部分出版商已经明确禁止AI公司为了训练目的扫描其书籍。安娜档案馆的立场是,知识应该属于全人类,AI公司不应该通过破坏书籍的方式独占地获取这些知识。这种观点虽然存在版权争议,但在AI训练数据的获取日益困难的背景下,获得了不少支持。
对AI训练数据生态的影响
实体书籍的破坏性扫描事件揭示了AI行业在训练数据获取方面面临的困境。随着网络公开数据被大量抓取、版权诉讼不断增多,AI公司正在寻找新的数据来源。实体书籍——尤其是那些尚未数字化的稀有书籍——成为了一个重要的数据壁垒。然而,这种不可持续的数据获取方式如果不能被更开放、更合作的模式取代,将会对整个人类知识保存体系造成不可逆的损害。
图书馆与档案馆的角色
面对AI公司的大规模扫描行为,传统的图书馆和档案馆正在重新思考自己的角色。一些机构选择与AI公司合作,在保护版权的前提下提供数字化内容;另一些机构则加强了对珍贵藏品的物理保护,防止被外部机构拆解。安娜档案馆的呼吁提醒我们,无论AI技术的发展如何,保存人类知识的物理和数字形态依旧是一项紧迫的社会使命。
未来可能的解决方案
解决这一困境需要多方协作。可能的出路包括:建立公共领域数字化书籍的开放数据库、制定AI训练数据使用的伦理规范、推动版权法的现代化改革以适应AI训练需求,以及鼓励出版商和AI公司之间建立数据许可的互惠机制。无论如何,在AI公司继续拆解实体书籍的同时,人类知识的保存与传承问题正变得越来越紧迫。