OpenAI推出两款新转录API:GPT-Live-Transcribe和GPT-Transcribe。它们突破传统语音转写,能理解口音、术语、数字及背景噪声等上下文。GPT-Live-Transcribe专为低延迟实时场景打造,如速记员般同步转录,另一款则侧重不同特性,两者共同提升复杂环境下的识别精准度。
本地语音转录开发者长期受困于多引擎维护:需同时适配whisper.cpp、ONNX和MLX,重复移植模型。7月19日,知名应用Handy作者sebjones发布新库transcribe.cpp v0.1.0,基于ggml打造,统一跨平台转录方案,并支持所有最新模型,直击碎片化痛点。
MacWhisper 14.0更新:本地AI转录工具,支持Whisper和Parakeet模型,直接处理音频、视频及系统音频。新增编辑器视图,提升转录性能与编辑流畅度,适用于播客制作等场景。
OpenAI推出三款实时语音模型:GPT‑Realtime‑2具备GPT‑5级推理能力,支持复杂请求和自然对话;GPT‑Realtime‑Translate专注实时翻译;GPT‑Realtime‑Whisper侧重语音识别。这些模型为开发者提供不同场景的语音应用解决方案。
视频分析工具,结合Llama视觉模型和OpenAI Whisper进行本地视频描述生成。
利用OpenAI的Whisper模型转录YouTube视频
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$6
$24
$2
$20
Baidu
128
ycngin2024
这是一个经过微调的Whisper语音识别模型,基于unsloth/whisper-large-v3-turbo架构,使用Unsloth和Huggingface TRL库实现了2倍训练加速,显著提升了训练效率。
adoamesh
本模型是基于OpenAI Whisper-small模型针对斯瓦希里语进行微调的自动语音识别模型。在FLEURS-SLU数据集的斯瓦希里语部分进行训练,显著提升了斯瓦希里语的转录准确率,单词错误率相比基础模型降低了68%。
TheStageAI
TheWhisper-Large-V3-Turbo 是 OpenAI Whisper Large V3 模型的高性能微调版本,由 TheStage AI 针对多平台实时、低延迟和低功耗语音转文本推理进行优化。支持流式转录、单词时间戳和可扩展性能,适用于实时字幕、会议和设备端语音界面等场景。
TheWhisper-Large-V3是OpenAI Whisper Large V3模型的高性能微调版本,由TheStage AI针对多平台(NVIDIA GPU和Apple Silicon)的实时、低延迟和低功耗语音转文本推理进行了优化。
MERaLiON
MERaLiON-SER-v1 是一个参数高效的多语言语音情感识别模型,能够同时预测7种离散情感类别和连续的情感维度值。该模型基于Whisper-Medium编码器构建,采用LoRA自适应技术,在多语言语音情感识别任务中表现出色。
teckedd
本模型是基于OpenAI Whisper-small在Common Voice 17.0数据集上微调的自动语音识别模型,专门针对Twi语言进行优化,能够实现语音内容的准确识别。
kalilouisangare
这是一个基于 OpenAI Whisper Small 模型微调的班巴拉语语音识别模型,在 24738 个班巴拉语音频样本上训练,能够将班巴拉语语音准确转录为文本,字符错误率低至 21.69%。
Ken-Z
本模型是基于OpenAI Whisper-small在拉丁语上微调的自动语音识别模型,使用67小时拉丁语音频数据训练,字符错误率(CER)为20,支持拉丁语语音转文本任务。
ReportAId
MedWhisper Large ITA是基于OpenAI Whisper Large v3 Turbo的领域适配变体,专门针对意大利语医疗语音识别进行了优化。该模型在精心挑选的意大利语门诊专科就诊录音集上使用LoRA技术进行微调,显著提升了医学术语和临床表达的识别准确率。
feelmadrain
这是一个基于OpenAI Whisper Small架构的俄语自动语音识别模型,在Common Voice 17.0数据集上进行了专门训练,能够准确地将俄语语音转换为文本。
openchs
基于OpenAI Whisper Large v2在Common Voice 17.0斯瓦希里语数据集上微调的语音识别模型,专为坦桑尼亚儿童求助热线的斯瓦希里语语音识别任务设计,相比基础模型在斯瓦希里语识别准确率上有显著提升。
BUT-FIT
SE-DiCoW是由BUT Speech@FIT联合JHU CLSP/HLTCOE和CMU LTI开发的目标说话人多说话人自动语音识别模型。该模型基于Whisper large-v3-turbo,通过自注册机制和改进的数据增强技术,在高度重叠的多说话人场景下显著提升了识别准确率。
jacktol
基于OpenAI Whisper Large v3模型微调的航空交通管制语音识别模型,专门针对ATC通信场景优化,在测试集上实现了6.5%的字错误率,显著提升了航空通信转录的准确性。
tiantiaf
基于openai/whisper-small优化的印度多语言分类模型,支持23种印度地区语言的精准识别,为语言识别领域提供高效解决方案。
基于Whisper-small架构的语音方言分类模型,专门用于识别8种中国方言变体,包括江淮方言、胶辽官话、冀鲁官话、兰银官话、普通话、西南官话、中原官话和粤语。该模型在Common Voice 11.0数据集上训练,具有重要的语音识别价值。
基于Whisper-small的英语方言分类模型,能够准确识别16种不同的英语方言,为语音处理和语言研究提供支持。
NexaAI
基于OpenAI Whisper架构微调的自动语音识别和语音翻译模型,通过减少解码层数量实现显著速度提升,同时保持接近原版的识别质量。
AbdelrahmanHassan
本模型是基于OpenAI的Whisper Large V3模型,使用LoRA方法在埃及阿拉伯语方言数据集(Egyptian-ASR-MGB-3)上进行微调的自动语音识别模型。它专门优化了对埃及阿拉伯语方言的识别能力,显著提升了在该方言上的词错误率(WER)性能。
kimthegarden
基于Whisper-small架构微调的韩语自动语音识别模型,在韩语语音识别任务上表现出色。
syvai
Hviske v3 是丹麦领先的最先进转录模型,专门针对自然对话场景进行微调,在会议、访谈、播客等场景中具有极高的准确性,超越了包括OpenAI Whisper在内的其他模型。
一个基于Whisper模型的语音录制和转录MCP服务器,可作为Goose AI扩展或独立服务运行。
基于Faster Whisper的高性能语音识别MCP服务器,提供高效的音频转写能力,支持批量处理、多模型尺寸和多种输出格式。
一个基于MCP协议的视频音频文本提取服务器,支持从多平台下载视频并利用Whisper模型进行语音转文字处理
一个基于Whisper模型的语音录制和转录MCP服务器,可作为Goose AI扩展或独立运行,支持多种录音场景和模型配置。
该项目扩展了视频语音识别功能,从仅支持本地Whisper模型,新增支持简影和B站剪辑的在线语音识别服务,提供了灵活的多服务选择架构。
MCP Server Whisper是一个基于OpenAI Whisper和GPT-4o模型的音频处理服务器,提供高级音频转录、格式转换、批量处理和文本转语音等功能,通过Model Context Protocol标准实现与AI助手的无缝交互。
一个基于whisper.cpp的本地音频转录MCP服务器,支持多种模型和音频格式,可与苹果语音备忘录MCP配合实现完整语音工作流。