DC娱乐网

OpenAI推理教父:我们严重低估了AI能力 现在我们手里的 AI,可能比平时看

OpenAI推理教父:我们严重低估了AI能力
现在我们手里的 AI,可能比平时看到的表现还要强。甚至到今天,我们都还没有充分测试出,这些模型在更长的推理时间和更高的计算预算下,到底能做到什么。

看完 Z Finance 整理的这期 No Priors 播客之后,我对这件事的感受更强烈了。

之所以会有这个疑问,是因为这期播客里,OpenAI 研究科学家 Noam Brown 提到了一个和我们平时认知很不一样的判断。

Noam Brown 也是推动推理时计算扩展成为行业重要方向的研究者之一。在他看来,现在很多模型的能力,已经很难再靠一次固定条件下的测试来判断。

因为对于一些任务,你给模型更多时间、更多 Token,或者更高的计算预算,它的表现还会继续提升,而且可能要很久才会接近性能平台期。

我一开始看到这里的时候,觉得也挺正常。多给模型一点思考时间,答案好一点,好像没什么奇怪的。

可如果增加推理时间之后,模型的表现还能持续提升,那我们平时用几分钟测试一个模型,再很快判断它强不强,看到的其实只是它在当时那点时间和预算下的表现。

这也解释了为什么到了今天,很多模型评测已经越来越难完整说明一个模型到底有多强。

大家经常会在新模型发布时看到一张成绩表,上面列着数学、编程、推理等各种测试,不同模型后面都有对应分数。

行业里通常把这类标准测试叫 Benchmark,简单理解,就是用同一组任务来比较不同模型的表现。
人工智能 AI ChatGPT OpenAI 大模型 AIGC 前沿 科技