Adobe推出Firefly音頻生成工具,涵蓋音樂、語音和音效,用戶可在桌面及移動端創作商業安全音頻,融入視頻流程。調查顯示,全部受訪創作者視頻均使用音樂,32.7%已用AI生成音樂;43.2%視法律版權風險、38.9%視授權費用爲主要障礙。
字節跳動發佈音頻創作模型Seed Audio1.0,已在火山方舟開放測試。它打破傳統影視音頻需多模型分別生成人聲、音效與環境聲再人工拼接的冗長流程,實現聲音場景一體化創作,確保敘事一致性,標誌着AI音頻生成進入完整聲音場景新階段。
火山引擎發佈豆包音頻生成模型1.0,支持文本或音頻輸入,端到端生成完整音頻作品。核心突破是單條Prompt即可同步生成對白、音效和背景音樂,無需傳統多軌剪輯。該技術大幅簡化音頻製作流程,讓用戶像“音頻導演”一樣高效產出成片級音頻,徹底告別手動對齊混音的複雜後期工作。
火山引擎發佈豆包音頻生成模型1.0,以“多模態參考生成”和“長時音色一致性”兩大核心技術,簡化傳統音頻後期流程,可一站式生成對白、音效與配樂,提升創作效率。
用Slooply從文本快速生成自定義、免版稅的AI音效,用於多領域創作。
Seedance 2.5 是一款支持多模態輸入、可生成帶原生同步音效的 4K 超清 AI 視頻生成器。
在insMind使用Sora 2生成無水印視頻,含音效、特效與逼真動作
最新視頻生成模型,更真實、可控,支持同步對話與音效。
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$6
$24
256
$4
$16
Baidu
128
Bytedance
$1.2
$3.6
4
$2
walterheart
Bark是由Suno創建的基於Transformer的文本轉音頻模型,可生成高度逼真的多語言語音、音樂、背景噪音和音效。
facebook
MAGNeT是一款基於非自迴歸Transformer的文本生成音樂與音效模型,能夠根據文本描述生成高質量音頻樣本。
ylacombe
Bark是由Suno創建的基於Transformer的文本轉音頻模型,能生成高度逼真的多語言語音、音樂、背景噪音和簡單音效。
declare-lab
TANGO是基於潛在擴散模型的文本轉音頻生成工具,能夠根據文本提示生成包括人聲、動物聲音、自然與人工音效在內的逼真音頻。
suno
TANGO是基於指令引導擴散的文本轉音頻模型,能夠根據文本提示生成包括人聲、動物聲音、自然與人工音效在內的逼真音頻。
Cursor AI代碼生成後播放音效的MCP實現
該項目通過Model Context Protocol(MCP)讓大型語言模型直接理解和生成Max音頻處理軟件中的音效模塊,支持解釋、修改和創建音效模塊,並提供與LLM的交互界面。
一個為Cursor/Windsurf代碼生成工具提供系統通知音效的MCP服務,在代碼生成完成或需要用戶批准時通過macOS系統音效進行提醒。
Cursor Sound MCP是一個通過MCP協議實現的音效反饋工具,在Cursor AI完成代碼生成時播放音效,提升交互體驗。
AI-StoryLab是一個基於Next.js的智能故事創作平臺,提供故事生成、語音合成、音效添加和繪圖提示詞生成功能,支持中英文內容創作。