Anthropic 的「巴拿马计划」:一条把书变成数据的流水线。
最近看到一个很详细的报道,关于 Anthropic 那个代号叫「巴拿马计划」的项目,之前只知道个大概,这次好多细节都浮出来了。
事情是这样的。Anthropic 大批量采购纸质书,买回来之后切掉书脊,用高速扫描仪把内容数字化,拿去训练 AI。扫完之后,纸质书直接销毁。
细节怎么被扒出来的呢?先说第一个。今年六七月份,有个书商实在好奇,往寄出去的两批书里偷偷塞了定位器。第一批的信号从俄亥俄州到了伊利诺伊州,落点跟一家大型图书扫描商的地址对得上。第二批更远,信号最后出现在美墨边境,附近有一家大型再生纸制造厂。
然后说第二个。几个科技媒体的记者也跟另一个书商合作,往书里放了追踪器,追到了拉斯维加斯的一家亚马逊仓库。记者没停,顺着线索找到了一个在那儿干过活的匿名员工,做了一次深度采访。
那位员工描述的现场,像一条工业流水线。书整卡车拉进来,先堆在暂存区。上线之后第一步扫条码,系统决定留不留,跟书里写了什么没关系。然后到切割工位,员工把书放进防护区,双手移开,按下按钮,刀落下来,书脊切掉。这套动作里每个细节都是为了保护人的手指,跟切纸板、切木料一个逻辑。
书脊一掉,一本书就散成一沓纸,员工把它们摞到推车上,中间用小纸板隔开。推到扫描区,二十多台机器一张一张地翻,动静跟点钞机差不多。
扫完之后呢?散页直接倒进一个大纸箱,不同的书、不同的语言、不同的年份,全混在一起。到了这一步,一本书从物理上讲,再也拼不回去了。
更魔幻的是,同一栋楼里,另一边在干按需印刷的生意。一边把纸印成书,一边把书切成纸。
有意思的是,这条流水线扫描精度只要 200dpi 灰度,不用彩色,不用高清。它要的只是文字能被机器认出来。而且员工看到的那些书,大量是日文、德文、俄文的旧书,有图书馆淘汰的,有全新没拆封的,还有英国议会的文件,几张纸订书钉一钉的那种。
这些东西在我们眼里可能不值一提,但对 AI 模型来说,网上能抓到的数据各家都有了,真正稀缺的,恰恰是这些从来没进过互联网的文字。一本没人翻过的旧教材,一份地方县城的年度报告,一种小语种的印刷品,对模型来说可能比畅销书管用得多。
报道里还提到一个旧书店老板哈珀,这一年靠这类大订单卖了三五万美元。有人骂他,他说平台有履约指标,一百本的单子取消两本就会被封号,他没多少空间去想道德问题。而且大学这几年经费砍得厉害,采购一直在掉,反倒是这些订单撑住了他的生意。
那位匿名员工也说,他很不喜欢这件事,看到里面很多书的时候特别想带走。他最介意的是,这些书扫完就没了,世界上能读到的纸质副本又少了一些。
文字留下来了,实物没了。这两件事同时成立。