DC娱乐网

赔了15亿美元,但法官说 AI 训练不算偷

2026年7月20日,旧金山的一名联邦法官,正式批准了Anthropic和数千名作家之间的一桩和解协议。金额是15亿美元

2026年7月20日,旧金山的一名联邦法官,正式批准了Anthropic和数千名作家之间的一桩和解协议。

金额是15亿美元。

从数字上上,这是美国版权诉讼史上最大的一笔赔偿——所以新闻标题铺天盖地,AI公司盗版训练终于遭了报应。

但如果你去翻那份判决书,会发现一件很有意思的事。

法官说,AI用书籍来训练这件事本身,具有极强的「转换性」,可以构成合理使用。

意思就是——AI学东西,不算偷。

那15亿罚的到底是什么?

是为了给AI搞学习材料,去「偷书」这件事。

这个分界线,才是整件事最值得聊的地方。

01

事情要从2023年说起。

大西洋月刊发了一篇报道,有人发现AI公司用的训练集「Books3」里,包含近20万本盗版图书,惊悚小说家安德里亚·巴茨搜了一下自己的名字,发现自己的书赫然在列。

于是她起诉了Anthropic。

随着证据浮出水面,细节一个比一个离谱。

先是Anthropic联合创始人本杰明·曼恩,从盗版网站下载了至少500万本图书。

2022年7月,一个新盗版网站上线,他又下载了至少200万本,还把链接发给了同事,附了一句话

「真是太及时了!!!」

三个感叹号。

而这事儿, Anthropic的CEO达里奥·阿莫代伊也知情。

有人问他为什么不买正版授权,他的回答概括起来就一个意思——太麻烦了。

买正版太麻烦了,所以就去偷……

这话不是我说的,是CEO自己说的。

2025年6月,法官裁定,从盗版网站下载书籍不受合理使用保护,每一个已知是盗版的下载行为,都是一次侵权。

但最有意思的部分来了。

在同一份判决里,法官还做了一个裁定,用合法获取的书籍来训练AI,属于极具变革性的创作行为,属于合理使用。

这就产生了一个非常微妙的分界线。

AI学东西,可以。但你不能去偷书给它学。

法院在训练行为与语料取得之间,划了一条清晰的线。这条线,才是15亿美元真正的意义所在。

它不是给AI训练定了一个价。它是说,不管你的目的是什么,你去偷这件事本身,该赔就得赔。

02

然而故事还没完。

2026年1月,华盛顿邮报曝光了一个项目「Project Panama」,翻译过来叫巴拿马项目。

核心就是Anthropic的员工把买来的实体书,一本一本切开书脊,逐页扫描成电子版,然后把切碎的纸页送去回收。

是的,你没看错——他们把书切了。

在一年多的时间里,Anthropic花了几百上千万美元,购买并破坏性扫描了数百万本实体书。

这样他们就可以说,这些电子版是合法获得的。

你说这算不算一种黑色幽默?

等一下,前面刚说完他们偷书不对,现在人家买了书,又说不行,那我们到底想讨论什么?

这个事的荒谬点,不在法律细节上。

Anthropic没有去跟出版社谈授权,没有去建合法的数据采购渠道,而是选择花几千万美元,买几百万本书,切开,扫描,销毁。

他们宁愿雇人一本一本切书,都不愿意去试试能不能买到授权吗?

不是市场上完全没有授权渠道。

隔壁OpenAI就跟新闻集团、迪士尼、美联社签了一堆协议,微软也跟哈珀柯林斯达成了用非虚构类图书训练AI的合作。

但在图书领域,能规模化买到几百万本训练授权的渠道,就是不存在。

哈珀柯林斯的协议是opt-in的,单个出版社的量级也有限,而Anthropic需要的,是一个没人建起来过的市场。

所以一家几千亿美元市值的公司,只能像地下工厂一样,在仓库里切书。

有一说一,这不是在同情他们,是觉得这件事挺荒诞。

而且他们真的是一本一本切开扫描的。

数百万本。

想一想这个画面,仓库里堆满了被切开的书,纸页散落一地,然后被送去回收,这些书曾经被人写过、被人编辑过、被人买回家读过,然后它们被切开,变成训练数据,被销毁。

这画面太赛博朋克了,赛博朋克到有点让人心里发毛。

03

说到这儿你可能会问,其他AI公司呢?OpenAI不也干了一样的事?

对,OpenAI也被作者起诉了。

Authors Guild在2023年就告了OpenAI,2025年12月普利策奖得主约翰·卡雷鲁又牵头把六家AI公司一起告了,但OpenAI没有像Anthropic这样和解。

差别在哪?

两个原因。

第一,证据——毕竟Anthropic被挖出来的东西太实锤了。

创始人亲自下载盗版图书,CEO说买正版太麻烦,这种级别的内部邮件被翻出来,你在法庭上很难再说什么,咱们总嘲讽美国还在用邮件办公,但这事在法律场合上,是真的有用的,公私分明了属于。

第二,策略不同。OpenAI一边打官司,一边疯狂签授权协议。新闻集团、迪士尼、美联社、FT……签了几十家。

不管这些协议在法庭上有多大用,至少在舆论上,它能说「我们在努力建立合法渠道」。Anthropic的选择是,先偷了再说。

结果就是,Anthropic成了第一个扛不住的那个。

15亿赔了,书也切了,你觉得这事儿算完了吧。

并没有。

还有律师费这出戏。

最开始,原告律师团队说要20%,就是3亿美元,说已经是克制的报价了。

但作者们不干了,整个和解覆盖约50万部作品,每部作品平均分到3000美元左右,作者还不能全拿,版权方还要分走一部分,作者辛苦写了一本书,被偷去训练AI了,平均每本书最后可能拿到一千多美元。

3亿这个报价,作者觉得太多,法官觉得太多,连Anthropic都觉得太多。

最终法官把律师费砍到了约1亿美元,大概占6.8%。三个原告代表每人要的5万美元服务奖,也被砍到了1.5万。

你看,这个故事里,受害者在互相抢食,被告反而成了最安静的那个。

04

作为围观这笔巨额和解看热闹的,我觉得其实挺矛盾。

一方面,法官的逻辑在法学层面上是自洽的。

AI训练确实和人类学习有相似之处,都是通过阅读大量文本来理解语言规律,所以从转换性使用的角度看,法官的推理有道理。

如果一刀切说所有训练都算侵权,那整个行业都别玩了,也不现实。

但另一方面,你让我真心实意地说一句「AI学东西就是合理使用」,我又说不出口。

因为我认识太多写作者了,大家知道写一本书要花多少时间,然后你的书被切开,变成训练数据,生成一个能模仿你风格的AI,而你只拿到了3000美元——不,扣完版权方和律师费,可能只有一千多。

法官说AI训练不会替代原作的市场价值,这话从法理上可能没错,但从情感上它就是不对的,因为它替代了一种更微妙的东西,替代了你作为写作者的独特性。

坦率的说,如果每个AI公司训练模型都需要给每个版权人付费,那AI不会有今天的发展速度,这中间确实需要一个平衡。

只是这个平衡,是不是太偏向大公司了一点?

去年看过李飞飞的《我看见的世界》,里面有一段话,她说「视觉智能的研究建立在无数人无意识贡献的数据之上,每一张被标注的图片都是某种意义上的劳动」。

「但数据贡献者从来没拿到过钱。」

这个困境在AI时代被放大了——当你的作品成为训练数据,你的劳动成为了模型能力的一部分,你该不该拿到报酬?

没有人能给出确定的答案。

但至少有一点是确定的,你偷了东西,就得赔。

15亿美元,不是AI训练的价格,它更想是一张账单,账单上写的是,「你为了训练AI,去偷了几百万本书,这是偷东西的代价。」

至于AI学习本身值多少钱,这笔账还没人算得清。

也许永远也算不清。

只是下次再用什么数据集训练模型的时候,想想那个在盗版网站下载了500万本书还发消息说「真是太及时了」的联合创始人以及「嫌麻烦」的CEO

他可能真的觉得,自己只是个爱学习的读书人。

读书人的是,怎么能算偷呢?

….

对了。

写这篇文章的时候,我一直在想那个被切开的书的画面。

数百万本书,被切开书脊,逐页扫描,然后送去回收。

每一本都曾经是某个人花了好几年写出来的。

然后它们变成了一堆纸浆。

我不知道这个画面能不能留在你脑子里。

但它大概会留在我脑子里很久。