DC娱乐网

「模型纪年」新增外部AI测评列表, 网页链接我个人看得比较多的是Artifici

「模型纪年」新增外部AI测评列表, 网页链接

我个人看得比较多的是Artificial Analysis、OpenRouter Rankings、大模型竞技场(Arena.ai)。

这样可以节省一些工作,不用重复跑一些跟公开评估集类似的任务。

但考虑到细分场景很多,且偏好影响很大,这些只是一个参考维度,不要作为定论。

比方说,目前编程“差评如潮”Gemini,在部分细分领域一直是顶尖,尤其是图像识别、文字风格模仿。

目前大部分人的评价集中在编程中的一部分能力。如果真想挑出什么模型适合自己,得有自己的评估集。