革命性突破!斯坦福UCSD联合打造TTT架构,5年磨一剑,Transformer时代终结?
TTT:全新提出的Test-Time-Training layers架构,由斯坦福、UCSD、UC伯克利和Meta的研究人员共同研发,一夜间颠覆了Transformer和Mamba的主导地位,为语言模型带来了革命性的改变。TTT架构创新性地通过梯度下降压缩上下文,替代传统注意力机制,具备训练大规模语言模型(数十亿token)的能力,同时保持稳定的线性复杂度且表现出超越传统Transformer的记忆能力和效率。实验结果表明,TTT层在短上下文和长上下文测试中均取得了优异性能,特别是在处理长上下文场景下,其性能优势更为显著,将为长视频建模等应用领域的突破提供新机遇。经过五年持续研发,TTT层的成功是团队持续创新与努力的结晶,有望为AI领域尤其是长视频处理技术带来革新,开启新的应用之路。