球友会

最新动态

GPT-6催动循环Transformer技术,阿里已抢先布局

GPT-6 Astra一经推出,循环深度技术迅速引起了广泛关注。最初由《信息》网站报道,Astra引入了这种循环深度的技术,使同一组Transformer层得以重复工作,而无需扩大参数规模,从而实现更深的计算。这意味着模型不必通过增加参数数量来提升能力,而是通过利用现有参数进行多轮运算。然而,这一创新立刻引发了争议,因为循环处理发生在隐藏状态中,可能导致思维链不可读,增加了监测模型的难度,因此,OpenAI遭到安全专家的强烈批评,甚至其首席科学家Jakub Pachocki不得不亲自作出回应,并透露他正在撰写一篇详细解释的文章。

在等待解释的同时,我们回到循环Transformer技术的核心:这种方法是否真的能提升模型的性能?学术界对此已有尝试,但通常在相同算力下,使用循环模型的结果不如常规Transformer。问题在于普遍存在的计算冗余。值得注意的是,阿里巴巴早在11个月前就针对这一问题发布了相关研究,提出了两篇论文。一篇是MeSH,专注于循环内部的信息管理,旨在解决循环中的冗余问题;另一篇是SpiralFormer,探讨在循环间如何优化计算的精度,使每一次运算都能发挥最佳效果。

循环Transformer的吸引力在于,它为大型模型提供了一种新的增强手段。过去通过增加参数来扩展深度,而现在能通过循环重复来实现相同的效果。尽管实验结果尚需验证,但确实减少了所需的参数存储。

在Astra之前,Claude Mythos曾一度使循环架构成为焦点,并在图搜索任务中取得了显著成绩。这项测试要求模型在复杂的关系网络中从起始点出发,逐层寻找相连节点,挑战模型的多步信息处理能力。巧合的是,循环架构正好擅长在隐藏状态中处理连续的信息,这使得外界迅速将两者联系在一起。尽管官方未明确是否采用循环架构,但当前行业期待的都是相同目标,即不必持续扩展模型,通过内部多次计算即可提升能力,这使得循环架构成为下一代高效大模型的发展方向之一。

然而,循环多次计算与实际获得结果之间仍存在差距。从一张图可以看出,信息在模型模块间流动的过程中的变动情况,初次核心循环的输出显著,而后续输出却逐渐减小,这并不代表模型的计算能力减弱,矩阵运算和注意力机制依然在持续进行。这正是计算冗余的尴尬体现:尽管循环增加,后续的计算增量却有限。来自阿里及合作高校的研究团队则专注于解决这一问题,探讨如何提高后几轮的计算效率。

他们首先提出了解决方案MeSH,已被ICLR 2026接受。早在2025年10月,他们就开始对循环Transformer进行深入研究。通过Pythia-1.4B级别的实验,循环结构在权重共享的基础上,减少了约33%的非嵌入参数,并且加入MeSH后,零样本下游平均准确率反而比普通Transformer提高了1.06个百分点。尽管减少了三分之一的非嵌入参数,但性能却有所提升,而新增加的路由器参数仅占普通Transformer非嵌入参数的0.005%。与基础循环模型相比,额外的计算开销也仅在0.014%左右,展现了小投入高回报的效果。

MeSH团队通过深入分析模型每一轮的运算,发现后续循环的活跃度逐渐降低,并在不同循环间的表示相似度上取得新发现。

[无下一篇]

每次训练结束后,教练都会带我们进行总结,针对每个学员的技术问题进行分析,并给出改进意见,提升效果明显!...