OpenAI推出两款新转录API:GPT-Live-Transcribe和GPT-Transcribe。它们突破传统语音转写,能理解口音、术语、数字及背景噪声等上下文。GPT-Live-Transcribe专为低延迟实时场景打造,如速记员般同步转录,另一款则侧重不同特性,两者共同提升复杂环境下的识别精准度。
OpenRouter上线音频转写端点,统一API密钥。开发者只需发送Base64音频,即可直接获取转录文本,无需再额外集成Whisper或第三方SDK,彻底消除聊天与转写间的割裂感。
本地语音转录开发者长期受困于多引擎维护:需同时适配whisper.cpp、ONNX和MLX,重复移植模型。7月19日,知名应用Handy作者sebjones发布新库transcribe.cpp v0.1.0,基于ggml打造,统一跨平台转录方案,并支持所有最新模型,直击碎片化痛点。
MacWhisper 14.0更新:本地AI转录工具,支持Whisper和Parakeet模型,直接处理音频、视频及系统音频。新增编辑器视图,提升转录性能与编辑流畅度,适用于播客制作等场景。
RunInfra优化开源模型用于生产,提供可导出的部署堆栈和API。
Windows本地AI听写,可在任意应用说话输入,一次付费29美元无订阅
免费的Whisper AI,先进的音频转文本工具,支持100+语言,永久免费。
专为Mac用户打造的转录应用,支持多种文件,准确快速,可本地或云端处理。
ycngin2024
这是一个经过微调的Whisper语音识别模型,基于unsloth/whisper-large-v3-turbo架构,使用Unsloth和Huggingface TRL库实现了2倍训练加速,显著提升了训练效率。
adoamesh
本模型是基于OpenAI Whisper-small模型针对斯瓦希里语进行微调的自动语音识别模型。在FLEURS-SLU数据集的斯瓦希里语部分进行训练,显著提升了斯瓦希里语的转录准确率,单词错误率相比基础模型降低了68%。
TheStageAI
TheWhisper-Large-V3-Turbo 是 OpenAI Whisper Large V3 模型的高性能微调版本,由 TheStage AI 针对多平台实时、低延迟和低功耗语音转文本推理进行优化。支持流式转录、单词时间戳和可扩展性能,适用于实时字幕、会议和设备端语音界面等场景。
TheWhisper-Large-V3是OpenAI Whisper Large V3模型的高性能微调版本,由TheStage AI针对多平台(NVIDIA GPU和Apple Silicon)的实时、低延迟和低功耗语音转文本推理进行了优化。
MERaLiON
MERaLiON-SER-v1 是一个参数高效的多语言语音情感识别模型,能够同时预测7种离散情感类别和连续的情感维度值。该模型基于Whisper-Medium编码器构建,采用LoRA自适应技术,在多语言语音情感识别任务中表现出色。
teckedd
本模型是基于OpenAI Whisper-small在Common Voice 17.0数据集上微调的自动语音识别模型,专门针对Twi语言进行优化,能够实现语音内容的准确识别。
kalilouisangare
这是一个基于 OpenAI Whisper Small 模型微调的班巴拉语语音识别模型,在 24738 个班巴拉语音频样本上训练,能够将班巴拉语语音准确转录为文本,字符错误率低至 21.69%。
Ken-Z
本模型是基于OpenAI Whisper-small在拉丁语上微调的自动语音识别模型,使用67小时拉丁语音频数据训练,字符错误率(CER)为20,支持拉丁语语音转文本任务。
ReportAId
MedWhisper Large ITA是基于OpenAI Whisper Large v3 Turbo的领域适配变体,专门针对意大利语医疗语音识别进行了优化。该模型在精心挑选的意大利语门诊专科就诊录音集上使用LoRA技术进行微调,显著提升了医学术语和临床表达的识别准确率。
feelmadrain
这是一个基于OpenAI Whisper Small架构的俄语自动语音识别模型,在Common Voice 17.0数据集上进行了专门训练,能够准确地将俄语语音转换为文本。
openchs
基于OpenAI Whisper Large v2在Common Voice 17.0斯瓦希里语数据集上微调的语音识别模型,专为坦桑尼亚儿童求助热线的斯瓦希里语语音识别任务设计,相比基础模型在斯瓦希里语识别准确率上有显著提升。
BUT-FIT
SE-DiCoW是由BUT Speech@FIT联合JHU CLSP/HLTCOE和CMU LTI开发的目标说话人多说话人自动语音识别模型。该模型基于Whisper large-v3-turbo,通过自注册机制和改进的数据增强技术,在高度重叠的多说话人场景下显著提升了识别准确率。
jacktol
基于OpenAI Whisper Large v3模型微调的航空交通管制语音识别模型,专门针对ATC通信场景优化,在测试集上实现了6.5%的字错误率,显著提升了航空通信转录的准确性。
tiantiaf
基于openai/whisper-small优化的印度多语言分类模型,支持23种印度地区语言的精准识别,为语言识别领域提供高效解决方案。
基于Whisper-small架构的语音方言分类模型,专门用于识别8种中国方言变体,包括江淮方言、胶辽官话、冀鲁官话、兰银官话、普通话、西南官话、中原官话和粤语。该模型在Common Voice 11.0数据集上训练,具有重要的语音识别价值。
基于Whisper-small的英语方言分类模型,能够准确识别16种不同的英语方言,为语音处理和语言研究提供支持。
NexaAI
基于OpenAI Whisper架构微调的自动语音识别和语音翻译模型,通过减少解码层数量实现显著速度提升,同时保持接近原版的识别质量。
AbdelrahmanHassan
本模型是基于OpenAI的Whisper Large V3模型,使用LoRA方法在埃及阿拉伯语方言数据集(Egyptian-ASR-MGB-3)上进行微调的自动语音识别模型。它专门优化了对埃及阿拉伯语方言的识别能力,显著提升了在该方言上的词错误率(WER)性能。
kimthegarden
基于Whisper-small架构微调的韩语自动语音识别模型,在韩语语音识别任务上表现出色。
syvai
Hviske v3 是丹麦领先的最先进转录模型,专门针对自然对话场景进行微调,在会议、访谈、播客等场景中具有极高的准确性,超越了包括OpenAI Whisper在内的其他模型。
一个基于Whisper模型的语音录制和转录MCP服务器,可作为Goose AI扩展或独立服务运行。
一个基于MCP协议的视频音频文本提取服务器,支持从多平台下载视频并利用Whisper模型进行语音转文字处理
一个基于OpenAI API的音频转文字MCP服务器,提供音频转录功能并支持多种配置选项。
一个基于Whisper模型的语音录制和转录MCP服务器,可作为Goose AI扩展或独立运行,支持多种录音场景和模型配置。
基于Faster Whisper的高性能语音识别MCP服务器,提供高效的音频转写能力,支持批量处理、多模型尺寸和多种输出格式。
Speech MCP 是一个为Goose设计的语音交互扩展,提供实时语音识别、文本转语音和音频可视化功能。
该项目扩展了视频语音识别功能,从仅支持本地Whisper模型,新增支持简影和B站剪辑的在线语音识别服务,提供了灵活的多服务选择架构。
一个基于MLX Whisper的音频转录MCP服务,支持本地文件、Base64音频和YouTube视频转录,专为苹果M系列芯片优化。
经典的编程入门示例
MCP Server Whisper是一个基于OpenAI Whisper和GPT-4o模型的音频处理服务器,提供高级音频转录、格式转换、批量处理和文本转语音等功能,通过Model Context Protocol标准实现与AI助手的无缝交互。
一个基于whisper.cpp的本地音频转录MCP服务器,支持多种模型和音频格式,可与苹果语音备忘录MCP配合实现完整语音工作流。
Office Whisperer v4.0 是一个基于AI的微软Office套件自动化工具集,通过自然语言接口提供143个专业工具,实现Excel、Word、PowerPoint和Outlook的全面自动化操作。
ASR MCP服务器是一个基于whisper引擎的自动语音识别服务,通过MCP工具提供语音合成功能,便于应用集成。