腾讯混元新研究聚焦在线大模型强化学习的批大小设置:当模型自生成训练数据、rollout生成与训练缩放节奏不一致时,经典临界批大小理论需在新场景重推。研究覆盖GRPO与PPO等主流算法并给出务实结论,为大规模GPU集群下提升训练效率提供参考。
英伟达开源Polar强化学习训练框架,核心创新在于使Codex、Claude Code等主流代码智能体无需修改原生代码即可接入GRPO训练。该框架解决代码智能体从单步任务向复杂长流程任务(如仓库级修改、OS交互)演进时的行业痛点,打破了智能体强化学习的“围墙”。
英伟达研究团队推出开源AI框架Polar,旨在让现有智能体框架(如Codex、Claude Code、Qwen Code)无缝接入广义相对策略优化(GRPO)训练方法。GRPO是一种强化学习优化技术,通过奖励信号调整模型策略,提升多步决策任务表现。Polar不改变原有工具调用、上下文组织和补丁提交方式,显著增强代码智能体的性能。
腾讯发布Training-Free GRPO技术,通过外部知识库替代参数微调,在模型参数冻结状态下实现性能优化。该方法将经验知识转化为token级先验信息,显著降低训练成本,在DeepSeek-V3.1-Terminus模型上达到与昂贵微调相当的提升效果。
Alibaba
$1
输入tokens/百万
-
输出tokens/百万
32
上下文长度
oberbics
本模型是基于Meta的Llama-3.1架构微调的文本生成模型,使用TRL库和GRPO(Group Relative Policy Optimization)方法进行强化学习训练,专门针对论证生成任务进行了优化。
Thrillcrazyer
Qwen-1.5B_THIP是基于DeepSeek-R1-Distill-Qwen-1.5B在DeepMath-103k数学数据集上使用TRL框架进行GRPO方法微调的数学推理模型。该模型专门针对数学问题解决进行了优化,具备较强的数学推理能力。
Salesforce
GTA1是基于GRPO强化学习训练的GUI接地模型,专门用于图形用户界面自动化操作。相较于依赖冗长思维链推理的方法,GRPO直接激励可操作和有根据的响应,在多个基准测试中表现出卓越的接地性能。
openmed-community
基于Arcee的AFM-4.5B的轻量级医疗微调模型,采用三阶段训练方法(SFT→DPO→GRPO-CoT)进行优化,专门用于医疗教育和研究场景。
GTA1是基于强化学习(GRPO)训练的最先进GUI接地模型,专门用于图形用户界面自动化任务。与依赖冗长思维链推理的方法不同,GRPO直接激励可操作和有根据的响应,在多个挑战性数据集上展示了卓越的接地性能和代理性能。
Jackrong
基于microsoft/phi-4(14B)基础模型的三阶段训练GRPO推理测试模型,通过SFT→RLHF→SFT流程微调,具备优秀的多步推理能力
lastmass
MedGemma-GRPO是MEDGemma模型的微调版本,专为临床病例推理任务设计。该模型结合监督微调(SFT)和组相对策略优化(GRPO),旨在引导模型遵循逻辑诊断路径,在合成医疗案例数据集上训练,特别适用于复杂心血管、血栓和自身免疫性疾病的诊断推理。
Azzindani
这是一个专门针对印尼法律领域优化的语言模型,基于DeepSeek-R1-0528-Qwen3-8B使用GRPO方法在印尼法律问答数据集上微调而成,专注于提升法律推理和结构化思维能力。
ykarout
该模型是基于DeepSeek-R1-0528-Qwen3-8B的微调版本,使用TRL和GRPO方法进行训练,专注于数学推理能力的提升。
OptimusePrime
Magistral-Small-2506-Vision 是一个基于 Mistral Small 3.1 进行 GRPO 训练的推理微调版本,具备视觉能力的实验性检查点。
HelloKKMe
GTA1是基于强化学习(GRPO)训练的最先进GUI定位模型,通过直接激励可操作响应而非冗长推理,实现精准界面元素定位。
kartd
这是一个基于Qwen-14B模型微调的版本,使用GRPO方法进行训练,适用于文本生成任务。
GTA1是一个基于强化学习(GRPO)的GUI定位模型,通过直接奖励成功点击来实现精准定位,避免冗长的思维链推理。
Jakala
J-1是基于Gemma 3 4-B模型,使用GRPO方法在意大利语数学和推理问题上进行训练的推理模型。在Invalsi ITA测试数据集上,性能从基础模型的57%提升到了79%,显著提升了意大利语推理能力。
lmstudio-community
INTELLECT 2是由PrimeIntellect推出的大语言模型,支持40960 tokens的上下文长度,采用QwQ架构和GRPO强化学习框架训练。
E1-Math-1.5B是基于DeepSeek-R1-Distilled-Qwen-1.5B微调的语言模型,支持弹性推理和GRPO方法,适用于预算受限的推演场景。
mlxha
本模型是基于Qwen/Qwen3-4B在medmcqa-grpo数据集上使用GRPO方法微调得到的医疗问答大语言模型。它专门针对医学选择题场景进行优化,具备较强的医学推理能力。
AITeamVN
基于Qwen2.5-7B-Instruct微调的越南语检索增强生成(RAG)专用大模型,采用GRPO优化方法训练
XGenerationLab
XiYanSQL-QwenCoder-3B-2504是XGenerationLab发布的最新SQL生成模型,通过微调和GRPO训练优化,支持多种方言,具有高效准确的SQL生成能力。
析言SQL-QwenCoder-2504是最新的SQL生成模型,结合微调与GRPO训练,在SQL生成上兼具效率与准确性,支持多方言,开箱即用,在不同方言和域外数据集上表现出色。