人工智能企业 xAI 近日宣布推出新一代语音识别与生成模型
在权威的 Artificial Analysis 语音识别基准测试中,
在语音转录精度方面,官方测试表明,新模型在多语言环境下的转录准确率较上一代提升了约 1.4 倍,并在多国语言的大规模音频测试中展现出强大实力。特别是在背景噪音干扰和电话压缩等复杂现实场景中,其抗干扰能力与竞品的差距被进一步拉大。
技术架构上,
目前,该技术已在实际业务场景中展开验证,并在
人工智能企业 xAI 近日宣布推出新一代语音识别与生成模型
在权威的 Artificial Analysis 语音识别基准测试中,
在语音转录精度方面,官方测试表明,新模型在多语言环境下的转录准确率较上一代提升了约 1.4 倍,并在多国语言的大规模音频测试中展现出强大实力。特别是在背景噪音干扰和电话压缩等复杂现实场景中,其抗干扰能力与竞品的差距被进一步拉大。
技术架构上,
目前,该技术已在实际业务场景中展开验证,并在
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。
微信公众号平台推出AI“一键排版”功能,支持手机App与网页端。编辑时系统自动识别文章结构并弹出图标,一键即可优化段落间距、生成小标题样式并智能配图,让版面疏密有致,解决分段、标题、配图三大高频痛点,显著提升排版效率。
国产大模型全球下载量破100亿次,万亿级开源模型频出,人工智能产业链整体突破。国家发改委表示,上半年我国AI自主创新加速,深度求索、月之暗面等发布万亿参数开源大模型,下一步将统筹高质量发展与高水平安全。

LG AI研究院7月31日在Hugging Face发布K-EXAONE 2.0模型,为韩国主权AI项目第二代。采用混合注意力MoE架构,总参数7500亿、激活参数370亿,规模是初代3倍以上,系韩国最大AI基础模型。模型以Apache 2.0完全开源,在韩国AI发展史中颇为罕见。

阿里发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,专注精准识别专业词汇。模型优化上下文一致性、行业词与热词定制,支持语音润色并直接输出结构化文本。团队构建了覆盖医疗、IT、股票等领域的多行业高质量词库,评测显示行业词识别效果显著提升。
7月31日,阿里通义千问发布语音识别大模型,主打长音频不丢词、行业词不用教。其升级点:长音频上下文记忆,确保会议转写一致;内置医疗、IT等行业词库,专业词召回率分别为95.36%和91.87%,无需人工配置。已在阿里云百炼平台开放调用。

苹果CEO库克最后一次财报会,AI成焦点。管理层回应Siri AI能否推动iPhone换机潮及成本压力,首次暗示未来可能收费。库克称财务影响尚不确定,高频用户或需订阅iCloud+服务。
华为开源盘古大模型openPangu-2.0-Pro,基于昇腾NPU训练,采用混合专家架构,总参数5050亿,激活参数180亿,支持512K上下文。同步开放权重、推理代码与技术报告,推动昇腾AI生态,提供原生训练推理实践。
医疗人工智能加速迈向专科化与安全化。中文医疗大模型评测基准MedBench近日升级至5.0版本,由上海人工智能实验室联合广州实验室钟南山院士团队、复旦大学附属中山医院葛均波院士团队等顶尖力量共同构建,致力打造更专业可靠的中文医疗AI评测体系。

OpenAI在发布GPT-5.6等新功能后,对ChatGPT桌面应用进行“超级应用”式改造,却因聊天记录难找、标签页繁杂遭到用户批评。总裁Greg Brockman公开承认体验略显混乱,正持续迭代优化,并称当前多标签页设计仅为过渡方案,长期目标旨在实现更统一高效的整合。

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。新鲜AI产品点击了解:https://app.aibase.com/zh1、火山引擎正式上线豆包搜索开放服务赋能智能体长程任务火山引擎正式上线豆包搜索服务,为企业和开发者提供智能体长程任务所需的深度信息支撑,同时确保信息的真实性和可靠性。8、字节跳动整合豆包、飞书、火山引擎,加速AI企业服务布局字节跳动启动面向AI业务的新一轮组织调整,强化豆包、飞书和火山引擎在企业生产力场景中的协同能力,加速推进AIToB战略布局。