革命性突破!斯坦福UCSD聯合打造TTT架構,5年磨一劍,Transformer時代終結?
TTT:全新提出的Test-Time-Training layers架構,由斯坦福、UCSD、UC伯克利和Meta的研究人員共同研發,一夜間顛覆了Transformer和Mamba的主導地位,爲語言模型帶來了革命性的改變。TTT架構創新性地通過梯度下降壓縮上下文,替代傳統注意力機制,具備訓練大規模語言模型(數十億token)的能力,同時保持穩定的線性複雜度且表現出超越傳統Transformer的記憶能力和效率。實驗結果表明,TTT層在短上下文和長上下文測試中均取得了優異性能,特別是在處理長上下文場景下,其性能優勢更爲顯著,將爲長視頻建模等應用領域的突破提供新機遇。經過五年持續研發,TTT層的成功是團隊持續創新與努力的結晶,有望爲AI領域尤其是長視頻處理技術帶來革新,開啓新的應用之路。