阿里巴巴在千問AI平臺全面上線Qwen-Audio-3.0系列語音模型,涵蓋語音識別、語音合成和實時語音交互三款。官方稱,該系列在權威評測平臺Artificial Analysis今年7月語音排行榜中表現卓越,包攬語音識別、實時交互和語音合成三項第一。
阿里發佈語音識別大模型Qwen-Audio-3.0-ASR-Flash,專注精準識別專業詞彙。模型優化上下文一致性、行業詞與熱詞定製,支持語音潤色並直接輸出結構化文本。團隊構建了覆蓋醫療、IT、股票等領域的多行業高質量詞庫,評測顯示行業詞識別效果顯著提升。
7月31日,阿里通義千問發佈語音識別大模型,主打長音頻不丟詞、行業詞不用教。其升級點:長音頻上下文記憶,確保會議轉寫一致;內置醫療、IT等行業詞庫,專業詞召回率分別爲95.36%和91.87%,無需人工配置。已在阿里雲百鍊平臺開放調用。
阿里AI編程助手Qoder發佈語音智能體Qoder Voice,由全雙工模型Qwen-Audio-3.0-Realtime驅動,支持自然語音實時創建任務、討論方案及執行代碼。在Qoder Quest模式,點擊語音入口可懸浮窗任意界面喚起,指令自動創建任務並調用工具後臺執行,無需等待。