腾讯大模型布局调整:原混元资深研究员徐灿转岗微信事业群,加入WeLM团队,专注后训练与Agent研发。徐灿曾创建WizardLM并提出Evol-Instruct,在合成数据、强化学习等领域积淀深厚。此举正值微信AI加速落地期。
腾讯混元联合UCLA、港中文等机构,针对多模态大语言模型(MLLMs)从“被动理解”向“主动推理”进化的需求,开源了多模态搜索智能体。此前,高质量数据、自动化轨迹合成路径及训练配方的缺失,导致顶尖智能体难以复现。此次开源旨在打破僵局,推动社区发展。
微软Bing团队开源词嵌入模型Harrier,支持超100种语言,在MTEB v2基准测试中表现优异。模型基于20亿示例及GPT-5合成数据训练,采用32,000词元上下文窗口,具备27亿参数,显著提升多语言任务准确性与灵活性。
腾讯二季度研发投入202.5亿元,同比增长17%;资本开支191.1亿元,增长119%。AI战略推动营收达1845亿元,同比增长15%;经营利润692.5亿元,增长18%。通过数据增强与合成技术,提升数据质量与多样性,预训练与后训练扩展增强混元能力。
Steiner 是一个基于合成数据训练的推理模型,旨在探索多种推理路径并自主验证。
用于训练大型语言模型的开源合成数据生成管道。
新模型,多种型号,AI驱动合成数据训练
生成合成数据,训练和对齐模型的工具
Openai
-
Input tokens/M
Output tokens/M
Context Length
Anthropic
$21
$105
200
Google
$0.7
$2.8
1k
Alibaba
$6
$24
256
$8
$240
52
Moonshot
$4
$16
Baidu
32
$8.75
$70
400
$1.75
$14
$0.35
$525
$2.4
$12
8
$1.6
$10
Huawei
128
Tencent
28
$7.7
$30.8
pnnbao-ump
VieNeu-TTS-1000h是一款先进的越南语端侧文本转语音模型,基于约1000小时高质量越南语语音数据训练,具备即时语音克隆功能,支持越南语与英语的无缝切换,能在CPU或GPU上实时合成24kHz波形。
unsloth
Granite-4.0-H-Micro是IBM开发的30亿参数长上下文指令模型,基于Granite-4.0-H-Micro-Base微调而来。该模型结合了开源指令数据集和内部合成数据集进行训练,具备增强的指令遵循和工具调用能力,特别适合企业级应用。
WeightedAI
波斯语OCR是一个专门针对波斯语文本设计的光学字符识别深度学习模型,采用CNN+变压器架构,在包含60万张合成波斯语文本图像的数据集上训练,序列准确率达到96%。
ibm-granite
Granite-4.0-H-Tiny是IBM开发的70亿参数长上下文指令模型,基于Granite-4.0-H-Tiny-Base微调而来。该模型结合开源指令数据集和内部合成数据集训练,具备专业、准确、安全的回复能力,支持多语言和工具调用,适用于企业级应用。
Granite-4.0-H-Micro是IBM开发的30亿参数长上下文指令模型,基于Granite-4.0-H-Micro-Base微调而来。该模型结合了开源指令数据集和内部合成数据集训练,具备多语言支持和增强的工具调用能力,在企业应用中表现出色。
openchs
这是一个基于Helsinki-NLP的opus-mt-mul-en模型进行微调的斯瓦希里语-英语翻译模型。该模型专门针对儿童热线服务场景进行了优化训练,采用合成的热线对话数据进行训练,具备防止生成幻觉的机制,并通过早停策略监控BLEU分数来保证翻译质量。
notmax123
Zonos-v0.1 是一款领先的开源文本转语音(TTS)模型,基于超过20万小时的多语言语音数据训练,在表现力和质量上可与顶级TTS供应商相媲美。支持零样本语音克隆、多语言合成和精细的音频控制。
lastmass
MedGemma-GRPO是MEDGemma模型的微调版本,专为临床病例推理任务设计。该模型结合监督微调(SFT)和组相对策略优化(GRPO),旨在引导模型遵循逻辑诊断路径,在合成医疗案例数据集上训练,特别适用于复杂心血管、血栓和自身免疫性疾病的诊断推理。
Salesforce
Moirai 2.0 是一个仅含解码器的通用时间序列预测Transformer模型,在多个高质量数据集上进行了预训练,包括GIFT-Eval、Chronos数据集子集、合成时间序列和Salesforce内部运营数据。相比第一版本,在损失函数、预测方式、数据处理等方面进行了重大改进。
stanfordmimi
MedVAL-4B是一个经过微调的语言模型,能够以接近医生级别的可靠性评估人工智能生成的医学文本输出。它是一个自监督框架,利用合成数据训练评估器大语言模型,无需医生标签或参考输出即可评估大语言模型生成的医学输出与输入之间的事实一致性。
cocktailpeanut
OpenAudio S1是一款领先的文本转语音(TTS)模型,基于超过200万小时的多语言音频数据训练,支持13种常见语言,提供高质量的语音合成服务,并支持丰富的情感、语调和特殊效果标记。
alakxender
这是一个针对迪维希语语音合成进行微调的VITS模型,能够将塔那字母书写的迪维希语文本转换为高质量的女性语音音频。基于Meta的MMS-TTS架构,使用精心策划的合成迪维希语语音数据集进行训练。
brittlewis12
StableLM Zephyr 3B是一个30亿参数的指令调优模型,基于公开数据集、合成数据集和直接偏好优化(DPO)训练,性能表现优异。
syvai
基于1000+小时丹麦语数据训练的文本转语音模型,支持自然对话场景的语音合成
Andres77872
专注于描述动漫风格图像的视觉语言模型,基于SmolVLM-500M-Base微调,训练数据包含18万组由大语言模型生成的合成图像/字幕对。
facebook
Meta开发的大规模视觉编码器模型,通过对比预训练和合成视频数据微调,在各类视觉任务中达到最先进性能
zai-org
GLM-4-32B-0414是GLM家族的新成员,拥有320亿参数的高性能大语言模型。该模型在15T高质量数据上进行预训练,包含大量推理型合成数据,在代码生成、函数调用、搜索问答等多个任务场景中表现出色,性能可与GPT-4o和DeepSeek-V3等更大规模模型相媲美。
xLAM-2是基于先进数据合成和训练管道构建的大型动作模型,擅长多轮对话和工具使用,能将用户意图转化为可执行动作。
xLAM-2系列是基于先进数据合成和训练流程构建的大型动作模型(LAMs),专注于多轮对话和工具使用,在函数调用和代理任务中表现卓越。
Mungert
Granite-3.2-2B-Instruct是一个20亿参数的长上下文AI模型,专为思维推理能力微调。基于Granite-3.1-2B-Instruct构建,通过混合使用宽松许可的开源数据集和内部生成的合成数据训练,旨在提升推理任务表现。