离谱,有人在一张 8GB 显存的笔记本显卡上,从零训出了一个会「边读边学」的模型 mini-AGI。
仓库 9 月 19 号才建起来,作者是 Alexey Borsky,代码主要由 Claude Opus 5 写完、调完、验完。
现在的模型基本都是训完就定型:预训练烧完一轮算力,权重冻住,之后你跟它说什么它都不会真的记住,全靠把上下文一次次喂回去。mini-AGI 反着来,它一直在读,读到的东西直接进参数,读完 3.18 亿个字符之后,内部的专家池已经自己长到了 169 个。
最卡人的显存问题它是这么绕开的:权重就是磁盘上的普通文件,用到哪块再分页调进显卡,所以模型能长多大取决于你硬盘还剩多少,而不是显卡有几个 G。参考机器就是一张 RTX 3070 笔记本显卡。
持续学习最怕学新的忘旧的,作者试出来一个很朴素的办法,把主干的学习率压到专家的十分之一,遗忘幅度从 2.23 nats 掉到 0.0067 nats,等于旧本事基本没丢。