AIBase
Home
AI NEWS
AI Tools
GEO & AEO
MCP
AI Models
EN

AI News

View More

CMU 团队推出元强化微调:提升大语言模型推理能力的新范式

在人工智能领域,大语言模型(LLM)正在不断进化,最近,卡内基梅隆大学(CMU)与 HuggingFace 的研究者们共同提出了一种名为 “元强化微调”(Meta Reinforcement Fine-Tuning,简称 MRT)的新方法。这一方法旨在优化大语言模型在测试时的计算效率,尤其是在解决复杂推理问题时,表现尤为突出。研究表明,现有的大语言模型在推理过程中常常消耗过多的计算资源,而 MRT 的目标是让模型在给定的计算预算内,实现更高效的答案发现。该方法将大语言模型的输出分割成多个片段,以便在探索与利用之间

16.7k 5 days ago
CMU 团队推出元强化微调:提升大语言模型推理能力的新范式

Models

View More

DeepSeek-V3.1

Deepseek

DeepSeek-V3.1

$4

Input tokens/M

$12

Output tokens/M

128

Context Length

腾讯混元生视频-视频特效

Tencent

腾讯混元生视频-视频特效

-

Input tokens/M

-

Output tokens/M

-

Context Length

腾讯混元生视频

Tencent

腾讯混元生视频

-

Input tokens/M

-

Output tokens/M

-

Context Length

DeepSeek-R1

Deepseek

DeepSeek-R1

$4

Input tokens/M

$16

Output tokens/M

32

Context Length

qwen-mt-turbo

Alibaba

qwen-mt-turbo

$0.7

Input tokens/M

$1.95

Output tokens/M

16

Context Length

Qwen_v2.5_3b_Instruct

Alibaba

Qwen_v2.5_3b_Instruct

$1

Input tokens/M

-

Output tokens/M

32

Context Length

腾讯混元生图(多轮对话)

Tencent

腾讯混元生图(多轮对话)

-

Input tokens/M

-

Output tokens/M

-

Context Length

腾讯元器

Tencent

腾讯元器

$100

Input tokens/M

$100

Output tokens/M

-

Context Length

AIBase
Empowering the future, your artificial intelligence solution think tank
English简体中文繁體中文にほんご
FirendLinks:
AI Newsletters AI ToolsMCP ServersAI NewsAI MarketingLLM LeaderboardAI Ranking
© 2026AIBase
Business CooperationSite Map