英伟达研究团队推出开源AI框架Polar,旨在让现有智能体框架(如Codex、Claude Code、Qwen Code)无缝接入广义相对策略优化(GRPO)训练方法。GRPO是一种强化学习优化技术,通过奖励信号调整模型策略,提升多步决策任务表现。Polar不改变原有工具调用、上下文组织和补丁提交方式,显著增强代码智能体的性能。
谷歌DeepMind最新研究揭示AI视觉模型存在“全局强、局部弱”的短板,并提出TIPSv2方案。该方案通过改进训练方法,使模型能更精准定位图像局部细节,如识别熊猫左后腿位置,解决了视觉-语言模型在精细分割任务上的长期难题。
YuanLab.ai发布开源多模态大模型Yuan3.0Flash,参数规模达40B,采用稀疏混合专家架构,推理时仅激活约3.7B参数,显著提升效率。模型提供16bit与4bit权重、技术报告及训练方法,支持二次开发和行业定制,推动AI技术普及。
摩尔线程团队在AAAI2026会议上发布URPO框架,重塑大语言模型训练方法。该技术通过统一奖励与策略优化,简化训练流程并突破性能瓶颈,为AI发展提供新路径。
Light-R1 是一个专注于长链推理(Long COT)的开源项目,通过课程式 SFT、DPO 和 RL 提供从零开始的训练方法。
一个关于大型语言模型(LLM)后训练方法的教程、调查和指南资源库。
thenexthub
OpenModel-1T-A50B-Instruct是NeXTHub开发的万亿参数混合专家模型,结合进化思维链训练方法,在推理能力和能源效率上取得平衡,具备深度推理能力和128K长上下文处理能力。
Nanbeige
Nanbeige4-3B-Thinking是第四代Nanbeige大语言模型家族中的30亿参数推理模型,通过提升数据质量和训练方法实现了先进的推理能力。该模型在数学、科学、创意写作、工具使用等多个领域表现出色,支持多阶段课程学习和强化学习训练。
unsloth
Apertus是一款由瑞士AI开发的全开放多语言大语言模型,提供70亿和80亿两种参数规模。该模型支持超过1000种语言,使用完全合规且开放的训练数据,性能可与闭源模型相媲美。Apertus在15T标记上进行预训练,采用分阶段课程训练方法,支持长达65,536个标记的上下文长度。
mlx-community
Apriel-1.5-15B-Thinker是一个专为图像理解与推理设计的150亿参数多模态模型,采用中期训练方法而非RLHF训练。本版本为适用于苹果芯片的MLX量化版本,具有内存占用小、启动速度快的特点。
openmed-community
基于Arcee的AFM-4.5B的轻量级医疗微调模型,采用三阶段训练方法(SFT→DPO→GRPO-CoT)进行优化,专门用于医疗教育和研究场景。
hyper1girl
Noemie LoRA是专为Qwen模型设计的最逼真角色LoRA,采用独特的多层训练方法,生成的图像人脸一致且极具真实感。
deepcogito
Cogito v2是经过指令微调的生成式混合推理模型,采用迭代蒸馏与放大训练方法,在编码、STEM、指令遵循等方面表现出色,支持超30种语言和128k上下文长度。
prithivMLmods
Polaris是一种开源的后训练方法,利用强化学习优化和增强模型,提升推理能力。
InternVL3-78B-Instruct是一个先进的多模态大语言模型,在多模态感知、推理和语言处理等方面表现出色。该模型通过原生多模态预训练方法,将视觉和语言学习整合到统一训练阶段,在工具使用、GUI代理、工业图像分析、3D视觉感知等多个领域展现出卓越能力。
InternVL3-2B-Instruct是先进的多模态大语言模型,相比前代有更出色的多模态感知和推理能力,扩展了工具使用、GUI代理、工业图像分析、3D视觉感知等方面。采用原生多模态预训练方法,将语言和视觉学习整合到单个预训练阶段。
AXCXEPT
基于google/gemma-3-12b-it模型,通过EZO训练方法提升日语性能的文本生成模型
p1atdev
基于Vision Transformer架构的视觉模型,采用SigLIP(Sigmoid Loss for Language-Image Pretraining)训练方法,适用于图像理解任务。
jhu-clsp
埃廷是首个使用相同数据、架构和训练方法训练的仅编码器和仅解码器模型集合,支持跨规模公平比较
KnutJaegersberg
Eagle2是一个高性能的视觉语言模型系列,专注于通过数据策略和训练方法的优化来提升模型性能。Eagle2-9B是该系列中的大型模型,在性能和推理速度之间取得了良好平衡。
NeurixYUFI
极速LoRA模型,采用不同数据集训练方法并修复潜在偏移点问题,适合快速生成照片风格图像。
timm
AIM-v2是一个基于timm库的图像编码器,采用蒸馏训练方法,适用于图像特征提取任务。
ericflo
基于Meta-Llama-3.1-8B架构的全参数微调大语言模型,专注于英语文本和Python代码任务,采用多样化数据混合训练方法
IMSyPP
这是一个基于XLM-R架构的多语言仇恨言论分类模型,支持英语、意大利语和斯洛文尼亚语,采用标注者间分歧感知训练方法,可有效识别社交媒体中的仇恨言论内容。
nvidia
Minitron-8B-Base是通过剪裁Nemotron-4 15B获得的大型语言模型,采用蒸馏持续训练方法,相比从头训练节省了40倍的训练token和1.8倍的计算成本。
LLM360
CrystalChat-7B-Web2Code是基于CrystalChat-7B大语言模型的多模态大语言模型,专门用于网页图像到HTML代码的生成。该模型借鉴了LLaVa-v1.5的训练方法,具有完全开源、高度透明的特点,支持从手绘图像或现有网页生成对应的HTML代码。