DC娱乐网

刷HuggingFace的时候瞟了一眼,有个模型的热度把我惊到了。你要是对这个圈子有点概念就知道,这数字放在开源模型里属于离谱那一档。 这个模型叫Qwen3.8-27B,阿里的。我一开始没反应过来,以为就是又一个参数大一点的版本。仔细一看不是那么回事,它是个原生视觉语言模型,图片、视频都能理解,从STEM图表到 ​

刷HuggingFace的时候瞟了一眼,有个模型的热度把我惊到了。你要是对这个圈子有点概念就知道,这数字放在开源模型里属于离谱那一档。

这个模型叫Qwen3.8-27B,阿里的。我一开始没反应过来,以为就是又一个参数大一点的版本。仔细一看不是那么回事,它是个原生视觉语言模型,图片、视频都能理解,从STEM图表到一小时的视频都能处理。而且它有个挺实用的设计——思考模式默认开着,但你可以按请求关掉,还能调节推理深度。

有意思的是它的架构。它不是那种堆注意力层的老路子,用了什么Gated DeltaNet,混合了线性注意力。我不太懂这玩意儿的原理,但看参数配置,64层,27B参数,上下文长度原生就有26万token,还能扩到100万。什么概念呢,一般开源模型也就几万token的上下文,它这直接能吞下一整本书还多。

这模型最狠的地方在于智能体能力。官方说它在长周期任务里表现更好,能自己规划、处理环境反馈,端到端把复杂任务做完。现在大家都在搞AI智能体,但大多数模型跑几步就迷路了,这个看起来是专门为解决这个问题来的。

不过说实话,这热度我是不太信的。可能他们统计口径比较宽,或者很多人下载了试试就扔了。但不管怎么说,能到这个量级,说明真有人拿它干活,不是光看看热闹。

人工智能 开源 大模型 阿里