7月2日,开源强化学习基础设施项目AReaL发布2.0版,旨在打通基础模型训练与智能体应用间的链路,为Agent场景提供强化学习训练支撑。2.0版面向真实业务,提供持续学习基础设施,可记录、整理Agent在任务中的交互过程并接入后续训练流程,让智能体在使用中持续进化。
英伟达开源Polar强化学习训练框架,核心创新在于使Codex、Claude Code等主流代码智能体无需修改原生代码即可接入GRPO训练。该框架解决代码智能体从单步任务向复杂长流程任务(如仓库级修改、OS交互)演进时的行业痛点,打破了智能体强化学习的“围墙”。
英伟达研究团队推出开源AI框架Polar,旨在让现有智能体框架(如Codex、Claude Code、Qwen Code)无缝接入广义相对策略优化(GRPO)训练方法。GRPO是一种强化学习优化技术,通过奖励信号调整模型策略,提升多步决策任务表现。Polar不改变原有工具调用、上下文组织和补丁提交方式,显著增强代码智能体的性能。
郝建邺认为,AI若不能从“存储”跨越到“记忆”,就无法成为真正的智能伙伴。其创立的忆纪元科技(MemoraX AI)成立仅一个月,便完成千万美元种子轮融资,由L2F光源创业者基金、钟鼎资本联合领投。资金将主要用于Agentic RL(智能体强化学习)技术的研发,旨在突破大模型仅作为“高效搜索引擎”的局限。
JaxMARL - 多智能体强化学习库
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Anthropic
$7
$35
200
$21
$105
Alibaba
$4
$16
$1
$10
256
Baidu
-
32
Xai
$1.4
$10.5
Deepseek
$12
128
$54
$163
$8.75
$70
400
$1.75
$14
$15
Chatglm
$8
$2
open-thoughts
OpenThinker-Agent-v1 是一个基于 Qwen3-8B 进行后续训练的开源智能体模型,专为终端操作和软件工程任务而设计。它首先在高质量监督微调数据集上进行训练,然后通过强化学习进一步优化,在 Terminal-Bench 2.0 和 SWE-Bench 等智能体基准测试中表现出色。
PokeeAI
PokeeResearch-7B是由Pokee AI开发的70亿参数深度研究智能体,结合基于AI反馈的强化学习(RLAIF)与推理框架,能够执行复杂的多步骤研究工作流程,包括自我修正、验证和综合分析。
agentica-org
DeepSWE-Preview 是一个完全开源的、先进的编码智能体,通过强化学习训练,在软件工程任务中表现卓越。
somya17ban
这是一个使用 stable-baselines3 库训练的 PPO 智能体模型,专门用于解决 CartPole-v1 强化学习任务。
honestlyanubhav
一个基于Unity ML-Agents训练的深度强化学习智能体,专门用于双人足球游戏场景。
Mouryahimanshu
这是一个基于PPO算法的深度强化学习智能体,用于玩哈吉游戏,使用Unity ML-Agents库训练。
xwm
基于Llama-3.1-8B-Instruct微调的强化学习模型,采用元计划优化技术提升智能体规划能力
PampX
这是一个基于Unity ML-Agents库训练的PPO智能体模型,专门用于哈吉游戏中的强化学习任务。
Aitor
这是一个基于PPO算法的强化学习智能体,专门训练用于在Unity的ML-Agents金字塔环境中进行导航和任务解决。
PraveenKishore
这是一个使用Unity ML-Agents库训练的PPO算法智能体模型,专门用于金字塔环境中的强化学习任务。
damilare-akin
这是一个基于PPO算法的强化学习智能体,专门为Unity的蠕虫游戏训练而成。
rram12
这是一个基于PPO算法的强化学习智能体,专门训练用于在Unity的ML-Agents金字塔环境中导航和完成任务。
michael20at
这是一个使用PPO算法在Unity ML-Agents金字塔环境中训练的强化学习智能体模型
adil-o
curt-tigges
一个基于PPO算法的强化学习智能体,专门训练用于玩贪吃蛇游戏
这是一个基于PPO算法的强化学习智能体,专门为Unity ML-Agents的金字塔环境训练而成。
rebolforces
这是一个基于PPO算法的强化学习智能体,专门训练用于解决Unity ML-Agents中的PushBlock游戏任务。
一个基于PPO算法训练的深度强化学习智能体,用于Unity的PushBlock游戏环境
Mahmoud7
这是一个基于PPO算法的强化学习智能体,专门训练用于Unity ML-Agents的金字塔环境。