DC娱乐网

互联网技术AI开始“吃”倒闭公司的聊天记录 【群聊 posthumous:当A

互联网技术AI开始“吃”倒闭公司的聊天记录 【群聊 posthumous:当AI开始啃食倒闭公司的"数字遗骸"】

一家初创公司死了。代码停更,服务器关停,工位收拾干净,创始人发完那封"各位,我们要说再见了"的邮件,故事本该到此结束。

但在2026年的夏天,故事有了续集——死后第八天,收购方HubSpot还没捂热这笔交易,Warmly的CEO就收到了另一封邮件:有人出价30万美元,想买这家公司"活着时的聊天记录"。

Slack里那些吐槽、GitHub上那些commit、Google Drive里那些改了八版的PPT、Zoom里那些开了没人记得结论的会——这些原本会随着公司死亡一起进垃圾桶的东西,突然成了抢手货。

AI实验室们饿坏了。它们把互联网"刮"得差不多了,现在盯上了企业内部的"运营废气"(operational exhaust)。

一、AI的"胃口"是怎么被喂大的

这事得从头说。

过去几年,大模型训练靠的是互联网公开文本——新闻、维基百科、论坛、书籍。但Protege的CEO鲍比·塞缪尔斯说了一句大实话:AI实验室已经基本"刮完了整个互联网"。

更直观的数据来自Epoch AI的估算:可用于训练的高质量公共文本总量约300万亿token,按当前节奏,可能在2026-2032年间耗尽;如果训练规模继续激进扩张,这个时间甚至可能提前到2027年。

与此同时,AI的方向变了。它不再满足于"回答问题",它要做"数字员工"——自主处理客服、排查故障、核对发票、更新CRM。而"像人一样工作"这件事,光靠维基百科学不会。

模型需要知道的,不是"IT工单是什么",而是"当一个真实员工看到'网站登不上去'的工单时,他如何在Slack里这种"真人如何完成工作"的轨迹,公开互联网上没有。它只活在各家公司的内部系统里。

于是,AI数据公司的猎枪,转向了那些倒闭的、被收购的、正在清算的初创公司。

二、Warmly事件:一个标志性样本

Warmly是一家做B2B网站访客识别的AI智能体公司,2026年6月30日宣布被HubSpot收购。

8天后,Mercor——这家替OpenAI、Anthropic、Google等实验室训练模型的AI数据工厂——给Warmly的CEO马克斯·格林沃德发邮件:最高30万美元,买或授权Warmly的Slack聊天、GitHub记录、Asana内容、Google Drive文件、员工会议转录。

接下来几天,类似的接洽来了四份。格林沃德全部拒绝。

几个细节值得玩味:

第一,HubSpot明确表示,这是一笔以人才为目标的收购,交易中未取得任何形式的数据。也就是说,买家Mercor想要的,恰好是HubSpot不要的那部分——一家公司"怎么干活"的全过程。

第二,30万美元这个数字,在行业里其实不算高。Forbes等媒体报道,这类数据集的成交价大概在5万到10万美元区间浮动,SimpleClosure等平台经手的近100笔交易也印证了这个区间。Mercor开到30万,已经算"诚意价"。

第三,格林沃德拒绝的理由,报道里没细说,但任何一个有点常识的创始人都会立刻想到:Slack里有客户信息,邮件里有员工姓名,会议里可能出现商业机密,医疗企业的数据甚至涉及患者隐私……这堆东西根本不是你想卖就能卖的。

三、"运营废气"市场,正在规模化

Warmly不是孤例。

Protege披露的数据很说明问题:该公司今年以来处理的数据交易总额至少1亿美元,去年同期约3000万美元——一年涨了30多倍。

SimpleClosure专门帮初创公司"善后",他们新推出了"Asset Hub"平台,把代码、文档、Slack记录、邮件线程打包成可授权资产。CEO多里·约纳说:"这些公司有一种淘金热的感觉,他们试图拿到真实世界的数据。"

数据公司Buildloop总结得更直白:基础模型擅长语言,但智能体需要的是工作流上下文——决策、辩论、交接、升级。这些东西只活在企业内部沟通里。

💡 一个冷峻的判断:当一家公司经营失败,它的"尸体"上最值钱的,不再是代码、专利或客户名单——而是它作为一个组织曾经如何思考、如何沟通、如何解决问题的完整轨迹。这对那些正活着的公司意味着什么?意味着你员工的每一次Slack吐槽、每一封措辞微妙的邮件、每一个Zoom会议里的欲言又止,都在被某个AI数据公司的雷达扫描着。

四、匿名化:一道脆弱的防火墙

defenders of this trade会说:别担心,数据会做"严格的匿名化处理"。

Protege的确是这么做的。他们强调"隐私优先",所有数据去标识化,遵守HIPAA,合同明确限定用途,数据持有者保留所有权。

理论上无懈可击。但实践中,三个问题绕不过去:

问题一:员工同意了吗?

Slack里的发言、邮件里的讨论,员工在敲键盘时,默认受众是同事,不是AI训练集。当这些信息被打包出售,作为数据主体的员工,既没有知情权,也没有同意权,更没有收益权。Center forAI and Digital Policy创始人马克·罗滕贝格说得很重:"员工隐私仍然是一个关键问题,因为这不仅仅是泛化的数据,这是可识别的个人。"

问题二:匿名化能走多远?

匿名化可以在技术上抹掉姓名、邮箱、客户名称。但工作流的"指纹"很难抹掉——某个工程师的debug思路、某个销售的报价话术、某个设计师的审美偏好,这些"行为特征"本身就是可识别的。哪怕名字被替换,熟悉的人一看就知道"这肯定是老张"。

问题三:谁有权卖掉这些数据?

在公司清算场景下,创始人是唯一决策者。他可以单方面把团队的集体智慧"变现"成30万美元装进自己口袋。而那些贡献了这些智慧的员工——他们可能已经被裁员、已经跳槽、可能已经在对前公司咬牙切齿——他们对这笔交易没有任何话语权。

一个被刻意忽略的真相:当公司倒闭,员工失去的不仅是工作,还有对自己"数字劳动"的控制权。他们的聊天记录、邮件、会议发言,被创始人当作公司资产一键出售,而他们本人连被通知的资格都没有。

五、这门生意的真正危险

我并不天然反对"企业数据资产化"。如果一家活着的公司,在员工知情同意、客户授权、严格匿名化的前提下,把自己的工作流数据授权给AI实验室,并从中获得收益——这完全可以是一门正经的生意。

但当下这门生意的爆发点,恰恰在最不正规的角落:

- 目标公司处于"倒闭或被收购"的混乱期,治理机制松弛- 谈判对手是现金紧张的创始人,30万美元的诱惑可观- 员工四散,无人主张权利- 数据横跨多个司法辖区,合规模糊地带众多

这就形成了一个对AI实验室极其有利的淘金窗口:在法律灰色地带,以相对低廉的价格,批量获取高质量的真实工作流数据。

更深远的问题是——当"公开互联网"被吃完,AI公司转向"私有企业内部数据"时,整个行业的权力结构会如何变化?

答案已经浮现:

1. 数据掮客崛起:Mercor、Protege、SimpleClosure这类中间商,将成为AI产业链上新的"石油寡头"2. 模型能力分化:谁能拿到更多高质量私有工作流数据,谁的智能体就更"像人";拿不到的,只能停留在"像 chatbot"3. 合规成本飙升:未来AI训练成本里,"数据清洗与合规"这一项会越来越大,小模型公司进一步被甩开4. 监管焦点转移:版权诉讼从"爬网页、扫书"转向"企业内部数据使用边界"——员工是否知情?客户是否同意?去标识化做到什么程度?

六、写在最后:你敲下的每一个字,都在被估价

回到Warmly那个场景。

2026年6月30日,这家公司的员工可能还在Slack里正常沟通、在Zoom里正常开会、在邮件里正常吐槽。他们不知道,8天后,这些日常沟通的"全部存档",会被标价30万美元摆上货架。

他们更不知道的是:在AI实验室眼里,他们不是一个"团队",而是一台"工作流数据发生器"。他们每一次灵光乍现的讨论、每一次措辞谨慎的回复、每一次深夜debug的协作——这些人类工作中最珍贵、最不可言说的" tacit knowledge"(默会知识),正被资本重新发现、重新定价、重新打包。

这事儿荒诞吗?挺荒诞的。

但这事儿可怕吗?更可怕。

因为当一家公司倒闭,它的"数字灵魂"被切片出售时,那些创造这些灵魂的普通员工,既没有得到一声感谢,也没有得到一分钱。他们只是被悄悄地从自己的数据里,剥离了出来。

所以下次你在Slack里敲下一段消息,在邮件里写下一句评论,在Zoom里说出一句想法——请记住:

在2026年,你正在用自己的日常工作,为自己从未签过合同的AI模型,无偿贡献训练数据。

而当你所在的公司某一天关门大吉,这些碎片会被人捡起来,擦干净,标个价,卖给AI实验室。

至于你?你早就去下一家公司,继续敲Slack了。

一个朴素的倡议:企业数据资产化的大潮不可逆转。但至少在制度设计上,应当明确——员工对其在工作场所产生的行为数据,享有知情权、同意权、以及合理的收益分享权。否则,"AI吃倒闭公司聊天记录"这门生意,终将从"技术创新"滑向"数字时代的圈地运动"。群聊已死,群聊万岁。只是这一次,埋单的永远是那些没有被询问过意见的人。