OpenAI升級ChatGPT桌面應用並整合Codex,推出基於GPT-Live的全新語音模式。覆蓋聊天、辦公和編程場景,用戶可用語音發起、檢查、調整任務,實現多線程協同。核心亮點是全雙工語音,支持同時聆聽與對話,邊聊邊幹活。該技術源於2024年首次語音識別,逐漸進化至今。
OpenAI發佈基於GPT-Live架構的全新語音交互,將AI助手從對講機式溝通轉向全雙工真人對話。相比2024年的高級語音模式,新模型實現聆聽、發言與思考的並行處理,徹底脫離傳統語音技術束縛。
OpenAI被曝將推出下一代雙向音頻模型GPT-Bidi-1,升級ChatGPT語音模式。該模型採用雙向架構,突破傳統單工對講,可同時聆聽與表達,實時捕捉用戶插話打斷並動態調整語義,避免卡頓,大幅提升交互體驗。
Spotify與環球音樂達成里程碑式授權協議,首次允許付費用戶利用AI翻唱和重混授權藝人的歌曲。該功能作爲增值服務專爲Premium會員打造,粉絲可親自改編泰勒·斯威夫特等藝人的作品,標誌着音樂消費從被動聆聽向主動創作轉型。
百聆是一個類似GPT-4o的語音對話機器人,通過ASR+LLM+TTS實現,低配置也可運行,支持打斷。
StemGen: 一款聆聽音樂生成模型
讓應用能夠通過語音轉文本和文本轉語音等功能聆聽、理解甚至與客戶交談
Ai音頻檢測,聆聽更真實的互聯網
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
$17.5
Alibaba
$8
$240
52
-
$15.8
$12.7
64
$3.9
$15.2
Bytedance
$0.8
$2
128
Baidu
$2.4
$12
8
Tencent
32
$3
$9
$140
$280