近日,来自中国人民大学、上海人工智能实验室、伦敦大学学院和大连理工大学的研究团队揭示了大模型推理过程中的一个重要发现:当模型在思考时,所使用的 “思考词” 实际上反映了其内部信息量的显著提升。这一研究成果通过信息论的方法,为我们更好地理解人工智能的推理机制提供了新的视角。你或许见过大模型在解答问题时,会输出一些看似人类化的语言,比如 “嗯……”、“让我想想……” 或 “因此……”。这些 “思考词” 是简单的表面装饰,还是代表着模型真正的思考
["人大最新研究警示数据增强对比学习需谨慎。","强对齐正样本或损害对比学习泛化能力。","更强数据增强可提升下游任务性能,但对齐性能下降。","研究揭示数据增强影响对比学习的机制。","提出寻求更优数据增强策略的信息论和谱角度。"]
Baidu
-
Input tokens/M
Output tokens/M
32
Context Length
Alibaba
Google
$8.75
$70
1k
$0.5
Openai
$14
$56
200
$0.7
$2.8
Tencent
Xai
128
$1.05
$4.2
01-ai
4
8
microsoft
InfoXLM是一种基于信息论的跨语言预训练框架,旨在通过最大化跨语言任务中的互信息来提升模型性能。