英伟达最硬的地方不是开发者数量,而是底层库和系统经验
网页链接
很多人讲 CUDA,只讲 600 万开发者。这个说法有用,但我觉得不是最核心。
开发者数量是外层护城河,真正硬的是中间层:cuDNN、cuBLAS、NCCL 这些库(图1)。
大模型训练和推理里,很多高性能计算并不是普通开发者自己从零写的,而是调用英伟达已经优化好的底层库。这些库背后是大量工程经验:矩阵乘法怎么调,通信怎么做,显存怎么管,算子怎么融合,不同 GPU 架构怎么榨性能。
这部分过去非常稀缺,因为会写高性能 GPU kernel 的人本来就少,能长期针对每代硬件调优的人更少。英伟达长期把这些能力沉淀进库里,所以别人很难追。
现在这层壁垒也在发生变化。Triton、TileLang 这类工具,本质上是在降低 kernel 编写门槛;AI agent 又进一步降低调优成本。过去需要少数顶级工程师反复手调的东西,未来可能变成自动搜索、自动生成、自动 benchmark、自动迭代(图2)。
这不是说 cuDNN、cuBLAS 明天就没价值了。英伟达仍然最懂自己的硬件,它自己也会用 AI 提高优化效率——而且别忘了,它每年换一代架构,等于每年给追赶者重置一次终点线。
但稀缺性的来源变了:过去稀缺的是"人类专家",未来稀缺的是"数据、硬件细节、系统闭环、真实 workload"。这对英伟达仍然有利,因为它掌握最多底层信息;但这不再是只有英伟达能玩的游戏。
所以我更倾向于把 CUDA 的库层优势理解成:领先时间差,而不是永久壁垒。

