DC娱乐网

DeepSeek超128K静默错误修复 MLX-LM修复DeepSeek-V3.

DeepSeek超128K静默错误修复
MLX-LM修复DeepSeek-V3.2与GLM在超过128K上下文时可能出现的Top-K静默损坏,并补上稀疏聚合预填充。今天还关注DeepSeek V4.1的NVIDIA验证、Qwen3.5在AMD上的MTP在线量化、GLM-5.3检查点命名和MiniCPM5接入。
我的判断:先处理会影响安全或正确性的变化,再评估性能与便利性;所有主分支能力都应等待版本并做最小回归。
你更想先验证第一条,还是先试第二条?
mlx-lm sglang Qwen35 transformers ms-swift vllm qwen-code AI工程 大模型