快手KwaiKAT团队发布旗舰Agentic Coding模型KAT-Coder-Pro V2.5,直击“跑分高落地差”痛点。通过升级长程工程能力、通用Agentic能力及大规模Agentic强化学习体系,推动AI从单点代码补全迈向独立完成软件工程与复杂业务流。关键创新为自研AutoBuilder流水线,将运行仓库环境构建成训练支撑。
MiniMax与腾讯云合作,成功部署了具备百万级吞吐、十万级并发能力的Agent强化学习沙箱,并在测试环境中实现全量平稳运行。这标志着AI智能体底层基建能力取得重要突破,为其大规模应用提供了关键支撑。
Cursor发布新一代智能编码模型Composer1.5,在推理深度、响应速度及处理复杂长任务方面实现显著突破。新模型基于强化学习进行大规模后训练,计算量远超以往,带来智能跃迁。
阿里巴巴发布Qwen3-Max-Thinking推理模型,参数量超万亿,在复杂推理、事实知识及智能体能力上实现显著提升。该模型采用大规模强化学习训练,引入自适应工具调用和测试时扩展技术,综合性能已媲美GPT-5.2-Thinking等国际顶尖模型。
Tülu 3 405B 是一个大规模开源语言模型,通过强化学习提升性能。
DeepSeek-R1-Zero 是一款通过大规模强化学习训练的推理模型,无需监督微调即可实现卓越推理能力。
大规模强化学习用于扩散模型
Google
$0.7
Input tokens/M
$2.8
Output tokens/M
1k
Context Length
$2.1
$17.5
Openai
$0.63
$3.15
131
Deepseek
$4
$16
32
Iflytek
$2
-
Alibaba
$1.6
128
$525
$1050
$1
8
Baichuan
Baidu
64
$105
$420
200
$21
$84
4
PrimeIntellect
INTELLECT-3是一个拥有1060亿参数的混合专家(MoE)模型,通过大规模强化学习训练而成。在数学、编码和推理基准测试中展现出卓越性能,模型、训练框架和环境均以宽松许可协议开源。
OpenMMReasoner
OpenMMReasoner是一个完全透明的两阶段多模态推理方案,涵盖有监督微调(SFT)和强化学习(RL)。该方案通过精心构建高质量数据集,在多个多模态推理基准测试中超越了强大的基线模型,为未来大规模多模态推理研究奠定了坚实的实证基础。
BAAI
Emu3.5是北京智源人工智能研究院开发的原生多模态模型,能够跨视觉和语言联合预测下一状态,实现连贯的世界建模和生成。通过端到端预训练和大规模强化学习后训练,在多模态任务中展现出卓越性能。
recursechat
DeepSeek-R1是通过大规模强化学习训练的推理模型,在数学、代码和推理任务上表现出色,无需监督微调即可展现强大的推理能力,包括自我验证、反思和生成长思维链等。
wwwyyy
TimeZero是一种基于推理引导的大规模视觉语言模型(LVLM),专为时间视频定位(TVG)任务设计,通过强化学习方法实现动态视频-语言关系分析。
Open-Reasoner-Zero
首个专注于可扩展性、简洁性和易用性的大规模推理导向强化学习的开源实现
开放推理者零号是基于基础模型规模化强化学习的开源方案,专注于可扩展性、简洁性和易用性的大规模推理导向强化学习实现。
unsloth
DeepSeek-R1 是由 DeepSeek 团队推出的第一代推理模型,通过大规模强化学习训练,无需监督微调(SFT)作为初步步骤,展现出卓越的推理能力。
deepseek-ai
DeepSeek-R1是深度求索推出的第一代推理模型,通过大规模强化学习训练,在数学、代码和推理任务上表现优异。