2026年5月,自变量机器人开源VLA模型Wall-OSS-0.5,实现零样本部署突破,打破传统“考前微调”范式,推动具身智能从定制脚本向通用大脑转变。
2026年4月28日,伦敦帝国理工学院、互联网档案馆及斯坦福大学联合报告显示,截至2025年中期,全球约35%的新网站内容由AI生成,而2022年底ChatGPT发布前几乎为零。研究分析2022至2025年33个月网页样本,证实AI已深度渗透网络生态,改变互联网话语体系。
小米Kaldi团队开源OmniVoice模型,支持超600种语言,在中文和多语言TTS基准测试中多项指标达到SOTA。中文WER低至0.84%,多语言性能超越主流商用模型,实现语音合成新突破。
美团LongCat团队发布并开源了LongCat-AudioDiT模型,采用端到端架构,直接在波形潜空间建模,摒弃了传统TTS系统中的梅尔频谱中间表征,有效减少了信息损耗与误差累积,显著提升了零样本语音克隆的性能。
Zonos TTS 是一款支持多语言、情感控制和零样本文本到语音克隆的高质量 AI 文本转语音技术。
Spark-TTS 是一种基于大语言模型的高效单流解耦语音合成模型。
工业级可控高效的零样本文本到语音系统
VideoGrain 是一种零样本方法,用于实现类别级、实例级和部件级的视频编辑。
Tencent
$1
Input tokens/M
$3
Output tokens/M
4
Context Length
Huawei
-
32
01-ai
$0.99
Baidu
16
200
Openai
$210
$420
$100
openbmb
VoxCPM是一款创新的免分词器端到端文本转语音(TTS)系统,通过在连续空间中对语音进行建模,克服了离散分词的局限性。它具备上下文感知语音生成和逼真零样本语音克隆两大核心能力,能够根据文本内容自动调整韵律和风格,并仅需一个简短的参考音频即可克隆说话者的音色、口音和情感。
mradermacher
UME-R1-7B的静态量化版本,支持句子相似度、嵌入、零样本图像分类、视频文本到文本等多任务。提供多种量化类型以满足不同需求,从轻量级Q2_K到高质量Q8_0版本。
amazon
Chronos-2是一个拥有1.2亿参数的时间序列基础模型,支持零样本预测。它在单一架构内支持单变量、多变量和协变量感知任务,在多个基准测试中实现了零样本预测的最先进精度,且推理效率极高。
mldi-lab
Kairos-10M是一款专为跨领域零样本预测设计的时间序列基础模型,拥有约1000万参数。它能处理不同信息密度的异构时间序列数据,无需微调即可在不同领域实现强大的泛化能力。
Kairos-50M是一个拥有5000万参数的时间序列基础模型,专门用于跨不同领域的零样本预测。它采用自适应分词和位置编码技术,能够处理具有不同信息密度的异构时间序列数据,无需微调即可在不同领域实现强大的泛化能力。
notmax123
Zonos-v0.1 是一款领先的开源文本转语音(TTS)模型,基于超过20万小时的多语言语音数据训练,在表现力和质量上可与顶级TTS供应商相媲美。支持零样本语音克隆、多语言合成和精细的音频控制。
wcy1122
MGM-Omni-TTS-2B是MGM-Omni全功能聊天机器人的语音生成组件,专门用于文本到语音转换。它支持中英文的零样本语音克隆,能够生成长达10分钟以上的流畅自然语音,并实现高效的流式音频生成。
MGM-Omni-7B是一款全模态聊天机器人,能够处理文本、图像、视频和语音输入,并生成文本和语音响应。它具备长语音理解和生成能力,还支持中英文的零样本语音克隆。
facebook
MetaCLIP 2 (worldwide) 是一个基于Transformer架构的多语言零样本图像分类模型,支持全球范围内的视觉语言理解任务,能够实现无需训练即可对图像进行分类的能力。
knowledgator
GLiClass是一款高效的零样本分类器,性能与交叉编码器相当但计算效率更高,适用于多任务场景。
GLiClass 是一个高效的零样本分类器,性能与交叉编码器相当但计算效率更高,支持多语言文本分类任务。
GLiClass 是一款高效的零样本分类器,受 GLiNER 启发,能在单次前向传播中完成分类任务,兼具交叉编码器性能和更高计算效率。
redlessone
DermLIP是基于Derm1M数据集训练的皮肤病学视觉语言模型,采用CLIP风格的对比学习方法,专门针对皮肤病学图像和文本进行优化,支持零样本分类、少样本学习等多种应用场景。
DermLIP是一款专门针对皮肤病学领域的视觉语言模型,基于最大的皮肤病学图像文本语料库Derm1M训练而成。该模型采用CLIP风格的架构,能够执行皮肤病相关的多种任务,包括零样本分类、少样本学习、跨模态检索和概念注释等。
xieji-x
基于视觉-语言预训练技术的零样本皮肤病评估模型,整合多方面知识增强,为皮肤病研究和诊断提供有效工具。
shiviklabs
这是一个用于零样本分类任务的transformers模型,可在无需大量标注数据的情况下对文本进行分类。
shiviktech
基于Transformers架构的零样本分类模型,无需微调即可对文本进行分类
unsloth
Spark-TTS是一款基于大型语言模型(LLM)的高效文本转语音系统,支持中英文双语合成和零样本语音克隆。
Whisper是OpenAI开发的最先进的自动语音识别(ASR)和语音翻译模型,在超过500万小时的标记数据上训练,具有强大的零样本泛化能力。Turbo版本是原版的修剪微调版本,解码层从32层减少到4层,速度大幅提升但质量略有下降。
thuml
日晷是一系列生成式时间序列基础模型,能够对确定性预测和概率预测进行零样本推理。
Flyworks MCP是一个免费快速的零样本唇形同步工具,通过API接口实现数字人视频与音频的自动对口型,支持多种风格的数字形象。
Flyworks MCP是一个免费快速的零样本唇形同步工具,通过API接口实现数字人视频与音频的唇形同步,支持真实和卡通风格。