AIBase
首页
AI 资讯
AI 产品库
GEO 平台
MCP 服务
模型算力广场
VIP会员
ZH

AI资讯

查看更多

CMU 团队推出元强化微调:提升大语言模型推理能力的新范式

在人工智能领域,大语言模型(LLM)正在不断进化,最近,卡内基梅隆大学(CMU)与 HuggingFace 的研究者们共同提出了一种名为 “元强化微调”(Meta Reinforcement Fine-Tuning,简称 MRT)的新方法。这一方法旨在优化大语言模型在测试时的计算效率,尤其是在解决复杂推理问题时,表现尤为突出。研究表明,现有的大语言模型在推理过程中常常消耗过多的计算资源,而 MRT 的目标是让模型在给定的计算预算内,实现更高效的答案发现。该方法将大语言模型的输出分割成多个片段,以便在探索与利用之间

15.7k 前天
CMU 团队推出元强化微调:提升大语言模型推理能力的新范式

模型

查看更多

DeepSeek-V3.1

Deepseek

DeepSeek-V3.1

$4

输入tokens/百万

$12

输出tokens/百万

128

上下文长度

腾讯混元生视频-视频特效

Tencent

腾讯混元生视频-视频特效

-

输入tokens/百万

-

输出tokens/百万

-

上下文长度

腾讯混元生视频

Tencent

腾讯混元生视频

-

输入tokens/百万

-

输出tokens/百万

-

上下文长度

DeepSeek-R1

Deepseek

DeepSeek-R1

$4

输入tokens/百万

$16

输出tokens/百万

32

上下文长度

qwen-mt-turbo

Alibaba

qwen-mt-turbo

$0.7

输入tokens/百万

$1.95

输出tokens/百万

16

上下文长度

Qwen_v2.5_3b_Instruct

Alibaba

Qwen_v2.5_3b_Instruct

$1

输入tokens/百万

-

输出tokens/百万

32

上下文长度

腾讯混元生图(多轮对话)

Tencent

腾讯混元生图(多轮对话)

-

输入tokens/百万

-

输出tokens/百万

-

上下文长度

腾讯元器

Tencent

腾讯元器

$100

输入tokens/百万

$100

输出tokens/百万

-

上下文长度

AIBase
智启未来,您的人工智能解决方案智库
English简体中文繁體中文にほんご
友情链接:
AI Newsletters AI ToolsMCP ServersAI NewsAI MarketingLLM LeaderboardAI Ranking
© 2026AIBase
商务合作网站地图