这是一篇打破GPT“涌现”概念神话的论文,终于说出了我一直以来的一个直觉,这才是比较符合事物发展规律��
一句话总结,所谓GPT“涌现”能力,是因为人为修改了“达标”的评价标准,给人"涌现"的错觉
一旦使用更合理的评价指标,就会发现GPT能力值随着模型增大是线性增长的,从评价指标上直接解构了“涌现”
先说说什么是“涌现”,这是LLM引起爆炸式关注的一个非常重要的原因,“涌现”来自于复杂系统: 秩序从复杂系统中演进出来
当大模型的规模量级逐渐升高,到达某个临界点时会突然质变 ,无中生有出来一种新的能力的现象,就叫做“涌现”,比如在八位数加法这个任务上,随着模型规模变大,当计算训练量超过 10^23 flop 之后,准确度突然开始飞跃,突然涌现出 100% 正确的加法
类似的,微软和openAI也发了很多论文论述GPT突然“涌现”出来的多种能力,比如空间想象能力,推理能力,甚至简单的debug能力
回到论文,<Are Emergent Abilities of Large Language Models a Mirage? 为什么说GPT的“涌现”是海市蜃楼?
因为一旦使用更合理的评价指标,就会发现GPT能力值随着模型增大是线性增长的,并不是突然增长
举个例子,涌现能力的文章中,评价标准一般是非黑即白,“exact match”��是精确对应,但exact match这个评价标准就是一个非黑即白非线性的标准,比如说一个模型只预测对了一大部分,只要没达到精确对应,分数都是0,只有0和1的区别
在这个非线性标准下,意味着LLM模型能力一旦过了一个门槛,能力分数就会突然惊人的爆发,也就是所谓的“涌现”,可是把标准修改为精准答对,分数的爆发并不代表真实能力爆发
(如图)论文里举的例子是把精确答案的评价标准修改成了“edit distance”,也就是和标准答案之间的距离,结果发现随着模型的增大,离标准答案的距离也越来越近,所以实际上这项能力就是线性增长的。这就是典型的因为非线性评价指标得到了“涌现”的表象
论文的总结语说的非常有力:emergent abilities may be creations of the researcher’s choices, not a fundamental property of the model family on the specific task(“涌现”能力的出现是人为���意标准下的���选,而不是模型自己的真实能力)
这篇论文为什么这么重要?
因为在根本上否定了涌现,让我们把时间线拉长时可以不用再考虑AI能力突变这样的神话故事,LLM模型的能力发展更顺滑,可预测性变得更高,这可以让我们更冷静而客观的看待AI的发展速度了
统计推理能力也是如此,以后AI也许会发展出来的“组合”能力也是如此(组合能力就是想象力创造力的重要基础能力,详见我三月关于“想象力”的推文)。我们可以发展出更好的评价标准,来很好的预测LLM在统计推理和想象力创造力上的长足线性发展。任何新能力达到某个阈值之后,也能逐渐被人类所注意到,而不是突然“涌现”
这也是为什么我一直认为AI的能力值和准确率,都是随着算力scaling up的(见引文),不存在突然涌现的东西,顶多只有线性增长之后达到了人类认知的某个门槛而已。
还是那句话,AI的能力并不是一蹴而就的,降低cross entropy loss机器学习损失函数,每前进一步其实都异常的艰难,耗费的算力都是指数级上升,真的是路漫漫其修远兮,吾将上下而求索