摩尔线程团队在AAAI2026会议上发布URPO框架,重塑大语言模型训练方法。该技术通过统一奖励与策略优化,简化训练流程并突破性能瓶颈,为AI发展提供新路径。
Alibaba
$1
输入tokens/百万
-
输出tokens/百万
32
上下文长度