英伟达开源Polar强化学习训练框架,核心创新在于使Codex、Claude Code等主流代码智能体无需修改原生代码即可接入GRPO训练。该框架解决代码智能体从单步任务向复杂长流程任务(如仓库级修改、OS交互)演进时的行业痛点,打破了智能体强化学习的“围墙”。
英伟达研究团队推出开源AI框架Polar,旨在让现有智能体框架(如Codex、Claude Code、Qwen Code)无缝接入广义相对策略优化(GRPO)训练方法。GRPO是一种强化学习优化技术,通过奖励信号调整模型策略,提升多步决策任务表现。Polar不改变原有工具调用、上下文组织和补丁提交方式,显著增强代码智能体的性能。
苹果与威斯康星大学麦迪逊分校联合推出RubiCap AI训练框架,专攻“密集图像描述”,旨在让AI精准描述图像细节,如“桌上的红苹果”。该框架采用强化学习,以小博大,利用Qwen2.5作为“裁判”提升训练效果。
腾讯混元3D团队开源了强化学习后训练框架WorldCompass,旨在提升世界模型在交互中的准确性和用户体验。该框架针对当前世界模型在处理复杂指令时易出现偏差的问题,通过强化学习优化模型表现。
一个高效的强化学习框架,用于训练推理和搜索引擎调用的语言模型。
HOMIE 是一种新型的人形机器人遥操作系统,集成人体运动捕捉与强化学习训练框架,用于实现精准的行走与操作任务。
基于深度强化学习的模型微调框架
多目标强化学习框架,文本转图像生成
Deepseek
$4
Input tokens/M
$16
Output tokens/M
32
Context Length
Iflytek
$2
-
Alibaba
$1.6
128
$1
8
Baichuan
Baidu
64
Openai
$105
$420
200
$21
$84
PrimeIntellect
INTELLECT-3是一个拥有1060亿参数的混合专家(MoE)模型,通过大规模强化学习训练而成。在数学、编码和推理基准测试中展现出卓越性能,模型、训练框架和环境均以宽松许可协议开源。
Mungert
PokeeResearch-7B是由Pokee AI开发的70亿参数深度研究代理模型,结合了AI反馈强化学习(RLAIF)和强大的推理框架,能够在工具增强的大语言模型中实现可靠、对齐和可扩展的研究级推理,适用于复杂的多步骤研究工作流程。
PokeeAI
PokeeResearch-7B是由Pokee AI开发的70亿参数深度研究智能体,结合基于AI反馈的强化学习(RLAIF)与推理框架,能够执行复杂的多步骤研究工作流程,包括自我修正、验证和综合分析。
yujieouo
G²RPO是一种新颖的强化学习框架,专门用于流模型的偏好对齐,通过粒度化奖励评估机制显著提升生成质量
EpistemeAI
本模型基于GPT-OSS-20B,借助Unsloth强化学习框架进行微调,旨在优化推理效率,同时减少在从人类反馈中进行强化学习(RLHF)式训练期间出现的漏洞。微调过程着重于对齐的鲁棒性和效率,确保模型在不产生过多计算开销的情况下保持推理深度。
foreverlasting1202
QuestA是一个通过问题增强方法提升大语言模型推理能力的创新框架。它在强化学习训练过程中融入部分解决方案,显著提升了模型在数学推理等复杂任务上的表现,特别是在小参数模型上实现了最优结果。
OpenGVLab
InternVL3_5-38B是开源多模态模型InternVL3.5系列中的一员,在多功能性、推理能力和推理效率方面取得了显著进展。它支持多语言,可应用于图像文本到文本的任务,采用级联强化学习框架和视觉分辨率路由器技术优化性能。
InternVL3.5-4B是开源多模态模型系列中的中等规模版本,在通用性、推理能力和推理效率上取得显著进展,支持GUI交互等新能力。该模型采用级联强化学习框架和视觉分辨率路由器技术,实现了高效的多模态理解与推理。
InternVL3.5-4B是开源多模态模型系列的中等规模版本,包含4.7亿参数,采用先进的级联强化学习框架和视觉分辨率路由器技术,显著提升了多模态推理能力和效率。
spiral-rl
Spiral-Qwen3-4B是基于自博弈强化学习框架SPIRAL在多游戏场景下对Qwen3基础模型进行训练得到的模型,在双人零和文本游戏中展现高级推理策略,并在数学和通用推理基准测试中表现优异。
zhuyaoyu
CodeV-R1-Qwen-7B是基于CodeV-R1框架,在Qwen/Qwen2.5-Coder-7B-Instruct基础上通过强化学习微调得到的模型,专注于Verilog相关任务,能有效解决电子设计自动化中自动生成硬件描述语言的难题。
ByteDance
ContentV是一个高效的视频生成模型框架,通过极简架构、多阶段训练策略和经济高效的强化学习框架,在有限计算资源下实现高质量视频生成。
Ricky06662
VisionReasoner是基于强化学习的统一视觉感知与推理模型,通过强化学习框架将视觉感知和推理任务整合到一个统一的系统中,为视觉领域的复杂任务提供了创新的解决方案。
lmstudio-community
INTELLECT 2是由PrimeIntellect推出的大语言模型,支持40960 tokens的上下文长度,采用QwQ架构和GRPO强化学习框架训练。
yongchao98
R1-Code-Interpreter是首个使用多轮监督微调与强化学习训练大语言模型进行逐步代码推理的框架,支持144个不同的推理和规划任务,使模型能够自主决定何时以及如何调用代码。
NousResearch
Nous Research使用Atropos强化学习框架微调的实验性模型,基于WildChat数据集在'提升迷宫'环境中训练,探索认知反馈机制。
这是一个实验性金融分析模型,通过Atropos强化学习框架优化金融基本面预测能力
jobs-git
SkyReels V2是全球首个采用扩散强制框架的无限长度电影生成模型,融合多模态大语言模型、多阶段预训练、强化学习与扩散强制技术实现全面优化。
由Nous Research使用Atropos强化学习框架微调的实验性模型,专注于提升Llama-3.1 8B模型在推理模式下的工具调用性能
由Nous Research使用Atropos强化学习框架微调的实验性语言模型,基于WildChat数据集,专注于探索自我参照和认知反馈机制。