"佛系"優化器C-AdamW:一行代碼,讓大模型訓練速度狂飆1.47倍!
在 AI 的世界裏,"大力出奇跡" 似乎成了金科玉律。模型越大,數據越多,算力越強,彷彿就能越接近智能的聖盃。然而,這狂飆突進的背後,也隱藏着巨大的成本和能耗壓力。爲了讓 AI 訓練更高效,科學家們一直在尋找更強大的優化器,就像一位教練,引導模型的參數不斷優化,最終達到最佳狀態。AdamW 作爲 Transformer 預訓練的默認優化器,多年來一直是業界標杆。然而,面對日益龐大的模型規模,AdamW 也開始顯得力不從心。難道就沒有一種方法,既能提升訓練速度,又能降低能耗嗎?別急