DC娱乐网

正常的模型蒸馏,当然是一种技术。 但如果是绕过限制、批量调用别人的顶级模型,把对方模型生成的答案、推理信息大规模提取下来,再用于训练自己的模型 —— 这不就是 AI 时代的“偷窃”? 以前偷的是代码,后来偷的是数据,现在甚至可以按 API 调用次数,把别人的模型能力一勺一勺“偷偷搬”走。 A ​

正常的模型蒸馏,当然是一种技术。

但如果是绕过限制、批量调用别人的顶级模型,把对方模型生成的答案、推理信息大规模提取下来,再用于训练自己的模型 —— 这不就是 AI 时代的“偷窃”?

以前偷的是代码,后来偷的是数据,现在甚至可以按 API 调用次数,把别人的模型能力一勺一勺“偷偷搬”走。

Anthropic 再次点名多家中国大模型公司,曝光其所谓的“蒸馏”操作。

1)阿里:规模最大:

Anthropic 称,5 月至 7 月,相关交互超过 1.51 亿次,峰值接近每天 300 万次。其指称,相关操作主要通过大量调用 Claude Opus 4.6、4.7,提取模型输出及推理信息,用于训练 Qwen 3.5、3.6 和 3.7。

2)月之暗面:直接拿 Claude 给 Kimi 用户代答。

据 Anthropic 称,10 天内,近 30 万条真实用户请求被转交给 Claude,其中部分请求甚至包含企业内部代码和有效凭证。5 月至 7 月,相关交互超过 2300 万次。

3)DeepSeek:同样大量调用 Claude。

Anthropic 称,其会识别使用 Claude Code、OpenCode 等工具的用户,再挑选部分请求转给 Opus。仅 14 天,相关交互就超过 1210 万次。

4)智谱:重点提取和清洗 Claude 的推理过程。

据 Anthropic 称,智谱曾尝试从 Fable 进行蒸馏,但发现其防护较强后,转向 Opus 4.6 以及另一家美国公司的模型。17 天内产生超过 340 万次交互。

5)小米:把真实用户数据重新喂给 Claude。

Anthropic 称,相关数据包括 MiMo 用户产生的真实对话和编程记录,再利用 Claude 生成 SFT 和强化学习数据。20 天内超过 40 万次请求。

Anthropic 甚至怀疑,MiMo-V2-Pro 的免费试用期可能被用来吸引更多海外开发者,从而获取训练素材。

6)商汤:直接购买第三方用户与 Claude 的聊天记录。

据 Anthropic 称,这些数据来自代理和中转服务,而且部分用户可能并不知道自己的对话会被保存并出售。

7)MiniMax:疑似通过关联不明显的第三方公司运营模型中转服务。

更耐人寻味的是,这个平台只提供 Anthropic 和 OpenAI 的模型,却没有 MiniMax 自己的模型。

Anthropic 据此推测,这套服务可能主要用于收集美国模型的用户交互数据,再将这些数据用于训练。

如果这些指控属实,那么这已经不是传统意义上的“模型蒸馏”了。

它更像是一条完整的产业链:

调用别人的模型 → 大规模获取输出 → 筛选用户请求 → 清洗数据 → 训练自己的模型。

如果这些指控属实,这种行为在实质上更接近偷窃,而不是正常的模型蒸馏。

孔乙己:“窃书不能算偷。”

问题也就变成了:当一家公司的模型能力,是通过大规模“偷偷搬运”另一家公司的模型能力训练出来的,究竟应被视为“遥遥领先的创新”还是“不可容忍的盗窃”?