阿里巴巴在千问AI平台全面上线Qwen-Audio-3.0系列语音模型,涵盖语音识别、语音合成和实时语音交互三款。官方称,该系列在权威评测平台Artificial Analysis今年7月语音排行榜中表现卓越,包揽语音识别、实时交互和语音合成三项第一。
阿里发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,专注精准识别专业词汇。模型优化上下文一致性、行业词与热词定制,支持语音润色并直接输出结构化文本。团队构建了覆盖医疗、IT、股票等领域的多行业高质量词库,评测显示行业词识别效果显著提升。
7月31日,阿里通义千问发布语音识别大模型,主打长音频不丢词、行业词不用教。其升级点:长音频上下文记忆,确保会议转写一致;内置医疗、IT等行业词库,专业词召回率分别为95.36%和91.87%,无需人工配置。已在阿里云百炼平台开放调用。
阿里AI编程助手Qoder发布语音智能体Qoder Voice,由全双工模型Qwen-Audio-3.0-Realtime驱动,支持自然语音实时创建任务、讨论方案及执行代码。在Qoder Quest模式,点击语音入口可悬浮窗任意界面唤起,指令自动创建任务并调用工具后台执行,无需等待。