DSV4F4.1技术细节啥的也有了,看着还挺有意思的,总参数552B,输入A8B,输出A16B,KV Cache每Token只占不到1KB,本地1M上下文理论上来说只需要1GB显存,可以忽略不计,普通Q4量化就能在DGX Spark双机或者256G Mac Studio上跑

DSV4F4.1技术细节啥的也有了,看着还挺有意思的,总参数552B,输入A8B,输出A16B,KV Cache每Token只占不到1KB,本地1M上下文理论上来说只需要1GB显存,可以忽略不计,普通Q4量化就能在DGX Spark双机或者256G Mac Studio上跑
