Why Recurrent Models Fail to Improve with More Thinking Steps
An analysis by Machine Intelligence examines why recurrent models fail to improve with additional thinking steps, despite the expectation that more loops in latent space would grant more computation time. The piece cites Ilya Sutskever and Dario Amodei, noting that many models only perform well at the recurrent depth seen during training and may diverge when run longer. It contrasts this with the current Transformer approach of generating tokens to allocate computation dynamically.
Coverage timeline
机器之心机器之心
编辑|山辉 十多年前,Ilya Sutskever 说过这么一句话。 「 模型就是想学习。 」 Dario Amodei 在采访中转述 Ilya Sutskever 的说法。图源:Dwarkesh Podcast。 只要解决好数据和算力的问题,模型会自己找到学习的方法。 后来发生的事情我们都知道。模型越做越大。训练数据越用越多,算力投入一路上涨,模型能力被一层层解锁。 但当研究者把目光聚焦在 循环网络 和 隐空间 上时,一切都变了。 循环模型能够在隐空间中反复计算,按照设想,同一组网络层多运行几轮,模型就能获得更多计算时间,遇到难题也可以多「想」一会儿。 但现实并不如此美好。 不少模型只擅长使用训练时见过的循环深度,如果再让它多算几轮,它就可能开始在错误的路上狂奔。 因此,有人戏言: 有些模型,就是不想学 。 靠「多说」来「多想」 点开一个大模型的「深度思考」,你会看到长长的文字。 这里面看上去有很多「废话」,模型总在一边尝试一边推翻,有时候还会说出「我需要重新思考这个问题」。 这展现了模型的推理过程,虽然不能直接当作模型内部的完整计算过程来看,但也说明了,当前 Transformer 解决难题最成熟的办法,就是让模型 一边说一边想 。 因为标准 Transformer 有点像一栋楼层固定的大楼。 信息从一楼进入,依次经过每一层,最后从顶楼出来。无论面对的是 「 1+1 等于几 」,还是一道复杂的数学证明,每次生成下一个 Token 时,它走过的网络深度基本相同。 一趟不够怎么办?那就多走几趟。 模型先生成一个 Token,再带着此前的上下文进入下一轮计算。输出越长,同一套网络被调用的次数越多,模型也就多了几次拆解问题、检查答案和修订答案的机会。 这套办法相当好用。它让原本网络深度固定的 Transformer,也能 根据题目难度灵活分配计算量 :简单问题少说,复杂问题多说,实在不行就自己的几个答案来回打架。 不过,这种思考方式也有点不方便。 模型内容存在的是高维连续的隐状态,因为中途必须要「说」,所以许多中间计算也要被组织成一条可以输出的序列。哪怕某些步骤根本没有说出来的必要,模型也得先生成点什么,才能继续往下走。 于是,另一条路出现了。 直接在网络层循环 循环模型的想法很直接。 既然走一遍网络不够,那就 回到某些网络层再走一遍 。每循环一次,模型都会更新一轮隐状
