AI巨头疯狂大批量收购旧书,扫描完直接销毁,这是技术进步还是数字时代“焚书”?
最近一条行业新闻直接在互联网中炸了锅:多家海外AI企业通过中间商悄悄扫货,大批量收购二手旧书、绝版书籍。
优先收购2022年之前出版的纸质读物,采用工业设备切掉书脊高速扫描,文字提取完成,实体书本直接粉碎销毁。
很多人疑惑:网上资料无穷无尽,为什么非要花钱收购纸质旧书?
核心原因只有一个:互联网正在被AI生成内容污染。
如今网络充斥大量AI产出的同质化水文,如果持续抓取这类文本训练模型,会造成模型退化、逻辑混乱。
而2022年前印刷的书籍,全部是人类原创、经过编辑校对,是稀缺的“纯净高质量语料”。
更深一层的现实考量:
1、规避一部分版权风险。按照海外现有判例,企业合法购入实体图书、仅内部提取文字训练,被认定为“合理使用”;相比直接爬取电子书,法律纠纷门槛更低。
2、构筑独家数据壁垒。不少冷门专著、地方史料存量稀少,收购销毁之后,同行很难获取同源文本,形成别人拿不到的知识库。
但这件事巨大的争议无法回避:
第一,文化载体不可逆的损失。
书本不只是白纸黑字,孤本、旧书的批注、版式、时代印记、装帧信息,扫描文字无法完整复刻。一旦销毁,这份实物文明永久消失。
第二,创作者收益严重失衡。
作者耗费数年心血完成著作,AI企业低价批量购入旧书,免费提取文字训练商业大模型赚取巨额利润,原作者很难分到任何回报。
第三,公共知识私有化。
原本可以流通、图书馆收藏、普通人能借阅的书籍,数字化之后锁进企业私有服务器,仅供AI训练,大众无法查阅。公共知识慢慢变成科技巨头的私有资源。
有人说:文字保存下来就是胜利;
也有人痛斥:只截取文字、毁掉原书,是割裂文明载体,现代版焚书。
技术发展离不开数据,但技术进步不能无视文化传承与创作者权益。
无损扫描、扫描后妥善捐赠旧书、和出版社、作者建立授权分成机制,才是长远之路。
大家觉得:为训练AI扫描旧书,扫描完成直接销毁实体书,可以被接受吗?
