9月14日起所有V4 Pro的请求会被重新路由到V4.1 Flash。
所以未来一段时间内,直到V4.1 Pro上线,DeepSeek API将只提供这一个模型。
推理效率方面,V4.1 Flash的KV Cache缓存大小相比上一代模型,对HBM的需求减少到1/4,对SSD的需求减少到1/8。
从初代V1到V4.1 Flash,KV Cache足足缩小到原来的1/437。
9月14日起所有V4 Pro的请求会被重新路由到V4.1 Flash。
所以未来一段时间内,直到V4.1 Pro上线,DeepSeek API将只提供这一个模型。
推理效率方面,V4.1 Flash的KV Cache缓存大小相比上一代模型,对HBM的需求减少到1/4,对SSD的需求减少到1/8。
从初代V1到V4.1 Flash,KV Cache足足缩小到原来的1/437。