DC娱乐网

大模型的真面目藏不住了:它们开始吃纸了。 最近日本古书界爆出一个让人脊背发凉的

大模型的真面目藏不住了:它们开始吃纸了。

最近日本古书界爆出一个让人脊背发凉的诡异现象:大批神秘买家正在日本多地扫荡式购买二手书。从历史哲学、医学法律,到偏远地区的地方志甚至几十年前的政治小册子,只要是带字的,几乎来者不拒。

最先发现不对劲的,是东京那些开了几十年旧书店的老头。今年 8 月开始,他们的线上店铺涌进一批订单。一家店原本一天也就卖个十来本小说、漫画,现在一天能出 100 册。有的店单日销售额直接翻了 5 倍。店主一开始以为是生意好了,数钱的时候却越数越心慌。

因为这些单子太怪了。下单的账号五花八门,看上去八竿子打不着,可寄件地址最后全凑到一块儿去了 —— 统统发往冈山县同一个物流中心。

买的书也毫无章法,哲学、历史、医学、法律,外加一堆 "江户时代生活文化"" 三十年前政坛轶事 " 这种放二十年都未必有人翻的冷门玩意儿。

更耐人寻味的是,西日本有一家小旧书店,直接收到一封海外企业的邮件,开门见山就问:你们能不能一次给我凑几万册?

东京旧书商业协同组合坐不住了。业内一通气,好家伙,全日本的旧书店都在遇到同一档子事。大家嘴边上挂着同一个猜测:这是奔着训练 AI 去的。

日本电视台的记者扒了进出口数据,顺着那家收货物流中心背后的日本大型图书批发商往下挖,挖出一条明晃晃的记录:从去年开始,这家批发商的集团子公司,前前后后往美国发了 50 吨以上标注为 "日本书籍" 的货物。

一本厚精装书按 500 克算,这一趟就是 10 万册书。10 万册被翻过、压在仓库角落、等着慢慢烂掉的旧书,打包上船,漂洋过海,进了美国的仓库。

可书运到美国之后干嘛去了?今年 1 月,《华盛顿邮报》顺着作家起诉 Anthropic 的官司,扒出了超过 4000 页法庭文件。里面藏着一个代号 "巴拿马计划"的秘密项目。文件里有一句话:"巴拿马计划,就是我们对全世界所有图书进行破坏性扫描的行动。" 另一句更直白:"我们不希望外界知道我们在做这件事。"

怎么个破坏性扫描法?批量买书,成百上千万册地买。然后切掉书脊,往高速扫描仪里一塞,整本变成电子文本。扫完,原书直接粉碎。

Anthropic 在文件里跟供应商提过一个数:希望对方 6 个月内能消化 50 万到 200 万本书。牵头这事的人叫汤姆・特韦,2024 年 2 月入职,之前在 Google Books 干合作。买货渠道包括美国的 Better World Books 和英国最大的二手书商 World of Books。

也就是说,日本旧书店老板们今年 8 月才闻到的味道,硅谷其实已经咀嚼了两年。

那问题来了:互联网上的文章还不够喂吗?凭什么非得上街抢纸书?

答案就是:纸是干净的。

斯坦福的数据扎心:2025 年初以后新冒出来的互联网内容,一半以上是 AI 生成的。整个互联网正在被 AI 自己拉的屎埋掉。如果大模型天天拿 AI 写的东西训练 AI,几代下去,模型会越来越糊涂、越来越空心,学术界管这个叫 "模型崩溃"。

而 2022 年 ChatGPT 横空出世之前印出来的纸书,物理上就不可能混进 AI 字。它们是人类亲手写、亲手编、亲手校对过的最后的 "原生语料"。

所以你就明白了,为什么买家专挑冷门专业书下手,热门小说早被扫过 N 轮,那些躺在地方书店里二十年没人碰的哲学、医学、地方志、政坛小册子,才是真正没被开采过的矿。

一本地方县志、一本几十年前的政坛小册子、一本印了 2000 册卖不动的医学专著,它在世界上可能就存那么几本。它躺在旧书店货架上,你嫌它破、嫌它灰、嫌它卖不动;可一旦它被塞进液压切纸机,从这个世界上物理消失,就再也回不来了。

旧书店老板那句话说得最实在:"销售额涨了是开心,可这些书以后会变成什么样,我心里五味杂陈。"

你现在回头看这件事,会发现它根本不是一个 "日本旧书店促销" 的社会新闻。

它是一场静悄悄、贴着合法标签进行的人类纸质文明大回收。AI 公司不需要跟作者打招呼,不需要跟出版社打招呼,甚至不需要让你知道。它们只需要付钱、下单、走物流中心、切书脊、扫描、粉碎。几万、几十万、几百万册地吃下去,吐出一个更像人、却再也不知道人原本是怎么写字的模型。

人类花了 500 年把知识印在纸上。现在,最聪明的机器正蹲在纸堆上,一本接一本,往肚子里咽。