AI巨头们为了抢“干净”的训练数据,开始疯抢古董旧书了!
因为 2022 年前的老书没有 AI 垃圾污染,AI 公司通过第三方匿名买断,切掉书脊、高速扫描后直接粉碎销毁!
为了给人工智能喂养“干净”的数据,科技巨头们正疯抢市面上那些出版于2022年前的古董旧书。原因听起来有些荒诞:在AI大爆炸之前出版的书籍,尚未被AI生成的内容所污染。它们是纯天然的“有机数据”,是训练下一代大模型的稀缺养分。
这场竞赛已经白热化。大型科技公司不再满足于公开的数字化书库,而是通过第三方代理人,秘密潜入各大图书馆和二手书市场。一旦发现目标藏书,便直接动用匿名资金买断。
到手之后,流程冷酷且高效:工人们切掉书脊,将书页送入高速扫描仪,电子化存档后,原本承载着墨香与岁月痕迹的原书,被直接送入粉碎机销毁。
纸浆,成了这些人类文明精华的最终归宿。这其中不乏绝版的历史文献和孤本。对于科技公司而言,物理销毁是确保独家所有权的必要代价,他们花钱买的不只是阅读权,而是这份数据在这个世界上独一无二的“数字孤本”。
这股从硅谷蔓延开来的焦虑,根源在于大模型训练的“数据荒”。OpenAI和Google等先驱早已将互联网上的公开高质量文本挖掘殆尽。
随着AI生成内容的泛滥,网络世界的语料库正在经历一场“自我污染”。如果AI用AI生成的内容继续训练,模型会快速退化,输出的质量将断崖式下跌,业内称之为“模型崩溃”。
为了保证模型的进化速度,退回“人类知识净土”成为唯一选择。出版于AI写作普及前的书籍,被认为是尚未被机器之手触碰的纯净数据源。这种需求催生了一个隐秘的地下市场,古籍书商和中间商赚得盆满盈钵,他们清楚地知道对方是谁,想要什么,从不问多余的话。
这波抢购潮并非孤立事件。早在2024年,英国作家协会的一项调查就显示,大量知名作者的书籍被用于训练AI而未获许可。如今,科技公司选择直接买断销毁,虽然绕开了版权争议,但引发了更严重的伦理危机。
反对者认为,书籍的命运是人类的共有遗产,为了商业利益将其系统性粉碎,是一种文化暴行。即使有数字副本留存,实体书籍在考证、校勘和文化传承上的物理价值是不可替代的。
一位图书管理员在面对空空如也的书架时感叹,这里曾经存放着某个小镇几代人的记忆,现在它们变成了某个大模型参数里的一串权重值。关于这项操作的合法性,各国法律仍处于灰色地带。美国版权局和欧盟正在推进相关立法,但远水解不了近渴。
这一行为最令人感到魔幻现实的,是科技公司对外展现的巨大反差。一边是AI公司高调签署各种“安全宣言”,承诺负责任地发展技术;另一边,他们在数据采集的隐秘角落里,执行着最粗暴的物理清除。
为了创造出最前沿的文明引擎,先要烧掉历史的原稿,这种实用主义逻辑在商业世界畅通无阻,却让伦理学家感到了深深的寒意。
不仅如此,被销毁的图书种类也颇具深意。科技公司的扫描清单里,大量充斥着20世纪的哲学、历史和社会学著作,以及各种专业领域的工具书。
这些结构化、逻辑严密、富含深度推理的长文本,被视为提升大模型逻辑思维能力的“特效药”。而畅销小说和通俗读物,则因信息密度相对较低,被排在了优先序列之后。
有分析指出,这种选择性收集,会让未来的AI对历史的认知产生算法偏见。因为能被保留下来的数字知识,必须首先经过商业价值的筛选。那些偏门的、冷僻的、虽然深刻但难以量化的知识,可能在实体消亡的同时,失去了数字重生的资格。
讽刺的是,被切碎的书脊上,烫金的字符还若隐若现。那些记录人类探索星辰大海、思考存在意义的思想火花,最终化作了一堆需要被处理的工业废料。而那些吸收了这些纸浆魂魄的AI,未来又将如何看待这段亲手毁灭自己部分肉身来源的历史?
这场争夺战远未结束。随着更多资本涌入古董书市场,书价被不断推高。欧洲一些老牌书店发现,近来经常有神秘访客进店,目光扫过书架,不问价格,只问是否接受整库收购。店主们隐约知道这些书最终的宿命,但给出的价格实在太高了。
当技术发展到了要吞噬自己过去的时刻,我们或许应该停下来想一想,费尽心思创造出的那个无所不知的数字大脑,如果它的一切智慧都建立在被粉碎的过去之上,那它所指向的未来,根基是否从一开始就显得过于单薄。


