騰訊混元新研究聚焦在線大模型強化學習的批大小設置:當模型自生成訓練數據、rollout生成與訓練縮放節奏不一致時,經典臨界批大小理論需在新場景重推。研究覆蓋GRPO與PPO等主流算法並給出務實結論,爲大規模GPU集羣下提升訓練效率提供參考。
英偉達開源Polar強化學習訓練框架,核心創新在於使Codex、Claude Code等主流代碼智能體無需修改原生代碼即可接入GRPO訓練。該框架解決代碼智能體從單步任務向複雜長流程任務(如倉庫級修改、OS交互)演進時的行業痛點,打破了智能體強化學習的“圍牆”。
英偉達研究團隊推出開源AI框架Polar,旨在讓現有智能體框架(如Codex、Claude Code、Qwen Code)無縫接入廣義相對策略優化(GRPO)訓練方法。GRPO是一種強化學習優化技術,通過獎勵信號調整模型策略,提升多步決策任務表現。Polar不改變原有工具調用、上下文組織和補丁提交方式,顯著增強代碼智能體的性能。
騰訊發佈Training-Free GRPO技術,通過外部知識庫替代參數微調,在模型參數凍結狀態下實現性能優化。該方法將經驗知識轉化爲token級先驗信息,顯著降低訓練成本,在DeepSeek-V3.1-Terminus模型上達到與昂貴微調相當的提升效果。
Alibaba
$1
輸入tokens/百萬
-
輸出tokens/百萬
32
上下文長度
oberbics
本模型是基於Meta的Llama-3.1架構微調的文本生成模型,使用TRL庫和GRPO(Group Relative Policy Optimization)方法進行強化學習訓練,專門針對論證生成任務進行了優化。
Thrillcrazyer
Qwen-1.5B_THIP是基於DeepSeek-R1-Distill-Qwen-1.5B在DeepMath-103k數學數據集上使用TRL框架進行GRPO方法微調的數學推理模型。該模型專門針對數學問題解決進行了優化,具備較強的數學推理能力。
Salesforce
GTA1是基於GRPO強化學習訓練的GUI接地模型,專門用於圖形用戶界面自動化操作。相較於依賴冗長思維鏈推理的方法,GRPO直接激勵可操作和有根據的響應,在多個基準測試中表現出卓越的接地性能。
openmed-community
基於Arcee的AFM-4.5B的輕量級醫療微調模型,採用三階段訓練方法(SFT→DPO→GRPO-CoT)進行優化,專門用於醫療教育和研究場景。
GTA1是基於強化學習(GRPO)訓練的最先進GUI接地模型,專門用於圖形用戶界面自動化任務。與依賴冗長思維鏈推理的方法不同,GRPO直接激勵可操作和有根據的響應,在多個挑戰性數據集上展示了卓越的接地性能和代理性能。
Jackrong
基於microsoft/phi-4(14B)基礎模型的三階段訓練GRPO推理測試模型,通過SFT→RLHF→SFT流程微調,具備優秀的多步推理能力
lastmass
MedGemma-GRPO是MEDGemma模型的微調版本,專為臨床病例推理任務設計。該模型結合監督微調(SFT)和組相對策略優化(GRPO),旨在引導模型遵循邏輯診斷路徑,在合成醫療案例數據集上訓練,特別適用於複雜心血管、血栓和自身免疫性疾病的診斷推理。
Azzindani
這是一個專門針對印尼法律領域優化的語言模型,基於DeepSeek-R1-0528-Qwen3-8B使用GRPO方法在印尼法律問答數據集上微調而成,專注於提升法律推理和結構化思維能力。
ykarout
該模型是基於DeepSeek-R1-0528-Qwen3-8B的微調版本,使用TRL和GRPO方法進行訓練,專注於數學推理能力的提升。
OptimusePrime
Magistral-Small-2506-Vision 是一個基於 Mistral Small 3.1 進行 GRPO 訓練的推理微調版本,具備視覺能力的實驗性檢查點。
HelloKKMe
GTA1是基於強化學習(GRPO)訓練的最先進GUI定位模型,通過直接激勵可操作響應而非冗長推理,實現精準界面元素定位。
kartd
這是一個基於Qwen-14B模型微調的版本,使用GRPO方法進行訓練,適用於文本生成任務。
GTA1是一個基於強化學習(GRPO)的GUI定位模型,通過直接獎勵成功點擊來實現精準定位,避免冗長的思維鏈推理。
Jakala
J-1是基於Gemma 3 4-B模型,使用GRPO方法在意大利語數學和推理問題上進行訓練的推理模型。在Invalsi ITA測試數據集上,性能從基礎模型的57%提升到了79%,顯著提升了意大利語推理能力。
lmstudio-community
INTELLECT 2是由PrimeIntellect推出的大語言模型,支持40960 tokens的上下文長度,採用QwQ架構和GRPO強化學習框架訓練。
E1-Math-1.5B是基於DeepSeek-R1-Distilled-Qwen-1.5B微調的語言模型,支持彈性推理和GRPO方法,適用於預算受限的推演場景。
mlxha
本模型是基於Qwen/Qwen3-4B在medmcqa-grpo數據集上使用GRPO方法微調得到的醫療問答大語言模型。它專門針對醫學選擇題場景進行優化,具備較強的醫學推理能力。
AITeamVN
基於Qwen2.5-7B-Instruct微調的越南語檢索增強生成(RAG)專用大模型,採用GRPO優化方法訓練
XGenerationLab
XiYanSQL-QwenCoder-3B-2504是XGenerationLab發佈的最新SQL生成模型,通過微調和GRPO訓練優化,支持多種方言,具有高效準確的SQL生成能力。
析言SQL-QwenCoder-2504是最新的SQL生成模型,結合微調與GRPO訓練,在SQL生成上兼具效率與準確性,支持多方言,開箱即用,在不同方言和域外數據集上表現出色。