当下AI模型训练的海量数据获取方式,正揭开行业隐秘的争议乱象。以Anthropic公司为代表的AI企业,为高效采集训练文本,采用破坏性扫描模式:批量采购各类纸质书籍,裁切拆除书脊高速扫描数字化后,直接销毁无法复原的实体书本,该流程已被美国法院裁定文书实锤佐证。
书籍数字化本是保护文化的有益举措,能规避纸质书籍霉变、脆损、失传的风险,极大提升知识检索与留存效率。但企业的流水线式操作,彻底背离了数字化的初衷。为压缩成本、提升训练效率,企业将书籍仅视作文字数据载体,忽视了实体书籍的独特价值。版本装帧、手写批注、流传印记等独有文化信息,随书本销毁彻底消失,仅留存单薄的文字内容。
此次事件的核心争议,在于数据私有化与公共文化权益的失衡。企业扫描生成的数字资源仅对内封闭使用,并未向社会公开,公众既失去了可收藏研究的实体书籍,也无法享受数字化成果。即便部分操作被判定为合法,却造成了公共文化资源私有化、稀缺典籍隐性流失的问题。
科技发展不应凌驾于文化传承与公共利益之上。AI迭代升级不能以损毁文明载体为代价,行业亟需建立扫描采书底线规范,平衡技术发展与文化保护,让数字化真正服务于人类知识共享,而非企业的数据垄断。
