Adobe推出Firefly音频生成工具,涵盖音乐、语音和音效,用户可在桌面及移动端创作商业安全音频,融入视频流程。调查显示,全部受访创作者视频均使用音乐,32.7%已用AI生成音乐;43.2%视法律版权风险、38.9%视授权费用为主要障碍。
字节跳动发布音频创作模型Seed Audio1.0,已在火山方舟开放测试。它打破传统影视音频需多模型分别生成人声、音效与环境声再人工拼接的冗长流程,实现声音场景一体化创作,确保叙事一致性,标志着AI音频生成进入完整声音场景新阶段。
火山引擎发布豆包音频生成模型1.0,支持文本或音频输入,端到端生成完整音频作品。核心突破是单条Prompt即可同步生成对白、音效和背景音乐,无需传统多轨剪辑。该技术大幅简化音频制作流程,让用户像“音频导演”一样高效产出成片级音频,彻底告别手动对齐混音的复杂后期工作。
火山引擎发布豆包音频生成模型1.0,以“多模态参考生成”和“长时音色一致性”两大核心技术,简化传统音频后期流程,可一站式生成对白、音效与配乐,提升创作效率。
用Slooply从文本快速生成自定义、免版税的AI音效,用于多领域创作。
Seedance 2.5 是一款支持多模态输入、可生成带原生同步音效的 4K 超清 AI 视频生成器。
在insMind使用Sora 2生成无水印视频,含音效、特效与逼真动作
最新视频生成模型,更真实、可控,支持同步对话与音效。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
Baidu
128
$6
$24
256
Bytedance
$1.2
$3.6
4
$2
walterheart
Bark是由Suno创建的基于Transformer的文本转音频模型,可生成高度逼真的多语言语音、音乐、背景噪音和音效。
facebook
MAGNeT是一款基于非自回归Transformer的文本生成音乐与音效模型,能够根据文本描述生成高质量音频样本。
ylacombe
Bark是由Suno创建的基于Transformer的文本转音频模型,能生成高度逼真的多语言语音、音乐、背景噪音和简单音效。
declare-lab
TANGO是基于潜在扩散模型的文本转音频生成工具,能够根据文本提示生成包括人声、动物声音、自然与人工音效在内的逼真音频。
suno
TANGO是基于指令引导扩散的文本转音频模型,能够根据文本提示生成包括人声、动物声音、自然与人工音效在内的逼真音频。
该项目通过Model Context Protocol(MCP)让大型语言模型直接理解和生成Max音频处理软件中的音效模块,支持解释、修改和创建音效模块,并提供与LLM的交互界面。
Cursor AI代码生成后播放音效的MCP实现
Cursor Sound MCP是一个通过MCP协议实现的音效反馈工具,在Cursor AI完成代码生成时播放音效,提升交互体验。
一个为Cursor/Windsurf代码生成工具提供系统通知音效的MCP服务,在代码生成完成或需要用户批准时通过macOS系统音效进行提醒。
AI-StoryLab是一个基于Next.js的智能故事创作平台,提供故事生成、语音合成、音效添加和绘图提示词生成功能,支持中英文内容创作。