MiniMax推出全模态生成模型H3,承诺近期全面开源。该模型支持文本、图像、视频、声音任意组合输入,可生成带原生双声道音频的高清视频,用户只需提供参考素材即可驱动创作。
德国初创黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构,集成图像、视频、音频与动作编解码器,统一理解并生成物理与数字环境。作为首款原生支持音频生成的模型,Flux3可一次性输出20秒音视频同步片段,并支持文本、图像、视频转视频及关键帧驱动等多样化生成任务,显著推动生成式视频技术发展。
Hinge创始人Justin McLeod为其新公司Overtone筹得1800万美元,投资方包括FirstMark Capital、Pace Capital及Match Group。McLeod已于去年卸任Hinge CEO,他强调Overtone并非约会应用,而是一项以人工智能驱动的语音音频服务。
腾讯混元联合上海交大、新加坡南洋理工、天津大学、北大、复旦等机构,推出首个通用指令驱动音频编辑基准测试集MMAE。该基准针对AI编辑现有音频的能力,弥补了当前音频生成领域“编辑”能力的不足,为多任务音频编辑研究提供了重要评估标准。
AI驱动,免费在线将MP3音频转文本,支持90+语言,多格式导出
VeoOmni由谷歌AI驱动,可从文本或图像生成1080p电影级视频并同步音频。
由Google Gemini Omni驱动,可从文本或图像生成带同步音频的1080p视频。
一款由字节跳动推出的 AI 视频生成器,支持多镜头叙事。
Google
$0.49
Input tokens/M
$2.1
Output tokens/M
1k
Context Length
$17.5
Alibaba
-
$15.8
$12.7
64
Baidu
Bytedance
$3.5
$12
128
$2.4
8
$140
$280
32
$6
$6.4
Openai
$14
$56
200
$1
$70
2.1k
$210
$420
Alissonerdx
HuMo是一个统一的、以人为中心的视频生成框架,能够根据文本、图像和音频等多模态输入,生成高质量、细粒度且可控的人类视频。它支持强大的文本提示跟随、一致的主体保留以及同步的音频驱动运动。
VeryAladeen
HuMo是一个以人为中心的视频生成框架,能够利用文本、图像和音频等多模态输入生成高质量、细粒度且可控的人类视频,支持文本提示跟随、主体保留和音频驱动运动同步。
Wan-AI
Wan2.2-S2V-14B是一个专为音频驱动的电影级视频生成而设计的混合专家(MoE)模型。它能够根据输入的音频、参考图像和文本提示生成高质量的视频内容,支持480P和720P分辨率,并具备复杂运动生成和电影级美学效果。
jdh-algo
JoyVASA是一种基于扩散模型的音频驱动面部动画生成方法,能够生成面部动态和头部运动,支持多语言输入。
JoyHallo是一个专注于普通话的音频驱动人脸动画生成模型,能够根据普通话语音生成逼真的面部动画。
一个生产就绪的MCP服务器,通过Strudel.cc实现AI驱动的音乐生成,提供完整的浏览器自动化控制、实时音频分析和模式生成功能
Transcribe MCP是一个AI驱动的自动化转录工具,支持快速高质量的多语言音频转文字,提供本地和云端服务,并可与多种AI助手集成。