DC娱乐网

anthropic 的报告里关于中国一众开源模型的蒸馏话题,可能最搞笑的事了 可以把蒸馏简单理解为通过问老师问题而进行学习,大家应该都知道,学习是一个过程,只有沉淀出背后的结构,才能把学习效果内化 鉴于中国各大模型基本上都是开源的,架构自然都是公开的。感情中国花重金蒸馏,目的是帮全世界不断 ​

anthropic 的报告里关于中国一众开源模型的蒸馏话题,可能最搞笑的事了

可以把蒸馏简单理解为通过问老师问题而进行学习,大家应该都知道,学习是一个过程,只有沉淀出背后的结构,才能把学习效果内化

鉴于中国各大模型基本上都是开源的,架构自然都是公开的。感情中国花重金蒸馏,目的是帮全世界不断解密 Claude 或 openai 模型背后的架构而且通过这些“蒸馏”,竟然把模型能力迫近到前沿

这完全是在扯淡,更是对中国 LLM 的正向设计能力的无耻抹黑开源界应该对此感到愤怒才对如果没有中国 LLM 的开源,全世界学会如何正向设计大模型,不知道猴年马月

现代前沿的 LLM,参数量已经在3T 这个数量级了,这是一个极端极端复杂的高维函数/结构,要想通过它的低维投影来还原/窥探它的高维结构,需要的数据会惊人的大什么狗扯的1.5亿次,就是15亿次也是搞笑

无非是为了更广泛的影响普通大众,调动它们的政治力量,真是可耻至极

靠蒸馏来迫近 AGI, 理论上就不可能即便有哪个疯子靠蒸馏来建构大模型,也只能使团队变成不具备迭代能力的“一次性团队”因为只有正向设计模型,才具备迭代能力

当然,如果只是用一用,看看其他 LLM 各方面的表现如何,或者跟自己模型在某些方面进行对比分析等等倒是很正常,这些事再普通不过了

不用说各个大厂,有了新模型,我只有有机会都会各种深度试用一下还会把之前的各种成果拿出来验证,看最新模型的思考过程

只有傻子才闭门造车,完全不看外界模型的进化而且因为中国模型开源,相当于完全默认了可以被无限蒸馏自由蒸馏中国如果真的完全不去看美国闭源模型的进步,那才真是纯大傻子了

美国试图造一个“工业级蒸馏”,来建立完全单方面的垄断优势,简直是痴人说梦,异想天开

也可以说,无耻至极,人类公敌

LLM,本身就是对人类知识的蒸馏