字节跳动发布音频创作模型Seed Audio1.0,已在火山方舟开放测试。它打破传统影视音频需多模型分别生成人声、音效与环境声再人工拼接的冗长流程,实现声音场景一体化创作,确保叙事一致性,标志着AI音频生成进入完整声音场景新阶段。
火山引擎发布豆包音频生成模型1.0,支持文本或音频输入,端到端生成完整音频作品。核心突破是单条Prompt即可同步生成对白、音效和背景音乐,无需传统多轨剪辑。该技术大幅简化音频制作流程,让用户像“音频导演”一样高效产出成片级音频,彻底告别手动对齐混音的复杂后期工作。
火山引擎发布豆包音频生成模型1.0,以“多模态参考生成”和“长时音色一致性”两大核心技术,简化传统音频后期流程,可一站式生成对白、音效与配乐,提升创作效率。
Stability AI 发布新一代音频大模型Stable Audio3,并开源部分权重。该模型基于潜扩散技术,支持高品质立体声输出,生成速度显著提升。提供多种规格版本,满足音乐创作和音效制作等需求,并支持可变长度音频生成。
最新视频生成模型,更真实、可控,支持同步对话与音效。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
walterheart
Bark是由Suno创建的基于Transformer的文本转音频模型,可生成高度逼真的多语言语音、音乐、背景噪音和音效。
facebook
MAGNeT是一款基于非自回归Transformer的文本生成音乐与音效模型,能够根据文本描述生成高质量音频样本。
ylacombe
Bark是由Suno创建的基于Transformer的文本转音频模型,能生成高度逼真的多语言语音、音乐、背景噪音和简单音效。
declare-lab
TANGO是基于潜在扩散模型的文本转音频生成工具,能够根据文本提示生成包括人声、动物声音、自然与人工音效在内的逼真音频。
suno
TANGO是基于指令引导扩散的文本转音频模型,能够根据文本提示生成包括人声、动物声音、自然与人工音效在内的逼真音频。
该项目通过Model Context Protocol(MCP)让大型语言模型直接理解和生成Max音频处理软件中的音效模块,支持解释、修改和创建音效模块,并提供与LLM的交互界面。