DC娱乐网

现代版焚书?AI公司正通过数据中间商大肆收购2022年前出版的珍稀书籍——这些书

现代版焚书?AI公司正通过数据中间商大肆收购2022年前出版的珍稀书籍——这些书因不含AI生成内容被视为“纯净”训练语料。他们用液压切割机切除书脊,经高速工业扫描仪数字化后,将原书粉碎销毁。
 
整个事件的起点,要回溯到2021年。
 
Anthropic公司联合创始人本·曼恩,为了给初代大模型搭建训练语料库,私自从影子图书馆下载超过七百万本盗版图书填充数据库。
 
大规模侵权行为很快引发大批作者集体诉讼,巨额赔偿与版权风险悬在企业头顶,倒逼团队寻找一条看似合规的取数路径。
 
为规避法律追责,2024年年初,企业内部启动代号为巴拿马计划的隐秘项目,核心目标直白写进内部文件:以破坏性扫描的方式,收录全球范围内所有纸质出版物。
 
为了稳妥落地这套方案,团队专门挖来前谷歌图书项目负责人统筹全流程,整套操作从采购、拆解、扫描到销毁形成闭环流水线,全程严格对外保密实际买家身份。
 
想要大批量、匿名完成海量书籍收购,企业选定了ISBNdb这家第三方服务平台作为中间商。
 
该平台主营业务就是为AI企业批量采购带ISBN编码的纸质图书,可签订严格保密协议隐匿采购方信息,单笔订单体量最高可达到一百万册,完美契合巴拿马计划的隐秘执行需求。
 
可谁也没想到,平台给出的书籍处理方案,充满了对纸质文献的粗暴掠夺。
 
所有完成交割的书籍统一运送至专用处理厂房,由液压切割机直接切透整本书籍书脊,牢固的装订结构被强行破坏,书页全部打散为单张散页。
 
拆解完毕的内页送入工业高速扫描仪逐页录入,依靠高精度OCR技术提取全部文字内容,转化为可用于模型训练的电子文本数据。
 
第一个关键转折,出现在扫描工序结束之后。
 
数字化归档完成并非书籍的最终归宿,所有原版纸质图书没有入库封存、没有捐赠馆藏、没有二次流通,全部直接送入粉碎设备打成纸浆回收。
 
一本本历经岁月留存下来的实体典籍,在完成单次数据提取后彻底从物理世界消失,只留下被锁在企业私有服务器内的电子版文件,普通公众没有任何查阅、使用的权限。
 
项目推进过程中,采购标准有着明确的时间划定,团队只定向收购2022年之前出版的纸质读物。
 
彼时人工智能尚未大规模普及,全网文本内容基本全部出自人类原创书写,不存在AI生成的劣质污染内容,这类书籍被行业视作规避模型逻辑崩塌的纯净优质语料。
 
而在这一百万册大宗订单之内,混杂着大量存世量仅有一本的孤本、绝版地方史料、小众学术专著、冷门外文文献,这些无法复刻的文明载体,一旦实体销毁,便真正彻底断了传承根基。
 
第二个转折,来自项目曝光后的法律判决结果。
 
随着相关版权诉讼推进,美国法院在2025年解封四千余页项目内部卷宗,巴拿马计划的全部操作细节公之于众。
 
面对大量藏书被毁引发的舆论争议,联邦法官最终裁定,企业全款合法购入实体图书,仅留存唯一一份内部电子副本并销毁原件,属于版权法框架内的合理使用,不构成侵权行为。
 
这份判决形成了极具讽刺性的导向:销毁原版反而能规避法律风险,若同时保留实体书与扫描件,反而会面临更高的合规争议,变相鼓励了科技企业毁书取数的行为。
 
事件持续发酵,行业内部出现了明显的观点分裂。
 
部分二手书商只看重大额批量订单带来的短期收益,大批量积压多年的滞销书籍一次性清仓回笼资金,对书籍后续的销毁处置并未过多追问。
 
大量藏书爱好者、图书馆从业者、文史研究者则提出强烈质疑,书籍承载的价值从来不止于纸面文字,原版的装帧版式、前人批注墨迹、纸张年代痕迹,都是数字化扫描无法完整复刻的内容,单纯提取文字本质上是对文献完整性的割裂破坏。
 
不料第三个转折,是科技行业内部出现了对立表态。
 
马斯克公开对此类破坏性扫描行为划清界限,明确要求旗下人工智能研发团队采用无损扫描技术处理珍稀旧书,在完成数据采集之后完整保留所有实体书籍,坚决不依靠摧毁人类文化载体换取模型训练资源,与Anthropic的操作模式形成鲜明对比。
 
即便有不同声音提出反对,巴拿马计划依旧按原有节奏执行,法院文件记录该项目在半年周期内,实际处理销毁的实体书籍总量接近两百万册,远超最初一百万本的订单规模。
 
时至今日,这场由AI算力竞争催生的毁书行动,依旧在行业内埋下隐患。
 
越来越多头部人工智能企业效仿这套路径,通过匿名中间商批量扫货绝版旧书,用物理毁灭的方式抢夺未经AI污染的原始人类创作内容。
 
资本追逐模型迭代速度的过程中,纸质典籍不再是需要守护的文明瑰宝,仅仅沦为可以一次性消耗的训练原材料,海量不可再生的小众孤本,在无人知晓的厂房内无声化为废纸。
 
技术本该为文明延续保驾护航,而非以消耗历史遗存作为发展代价。
 
对此,你有什么看法?
 
信息来源:钛媒体