xAI发布Grok Voice Think Fast 2.0语音识别模型,面向开发者,实现智能水平、转录准确率、对话能力与工具调用效率升级,定价每分钟0.08美元。该模型无需调整现有提示词即可提升性能,在Artificial Analysis基准测试中综合得分82.9%,优于前代75.7%。
英伟达推出合成视频检测服务SVD,应对AI深度伪造挑战。该服务集成于推理微服务平台,逐帧切割视频为裁剪帧,利用视觉模型分析空间特征并打分,精准识别AI生成内容。
Epoch AI研究显示,主流AI文本检测器能近乎完美识别普通AI生成内容,但当大语言模型刻意模仿特定作者写作风格时,准确率明显下降,科学写作最难辨别。实验测试了Pangram、GPTZero和Originality.ai三款工具,采用495篇涵盖博客、小说、科学的人类原创文本(均创作于ChatGPT问世前),发现风格模仿可有效逃逸检测。
百度发布文心大模型衍生模型PaddleOCR-VL-1.6,在OmniDocBench v1.6评测中以96.33%准确率超越Gemini-3-Pro、GPT-5.2等主流模型,刷新SOTA,综合性能全球第一。该模型标志着多模态大模型在复杂文档理解与真实场景解析上的重大突破,支持超100种语言识别,用户覆盖广泛。
Anthropic
$21
Input tokens/M
$105
Output tokens/M
200
Context Length
Alibaba
$1
$10
256
$8
$240
52
Bytedance
$1.2
$3.6
4
$15.8
$12.7
64
-
$0.8
$2
128
Baidu
32
Iflytek
$1.8
$5.4
16
Xai
$0.3
Google
Tencent
$3
$9
Shawon16
这是一个基于VideoMAE架构的视频理解模型,在Kinetics数据集上预训练,并在一个未知的、可能与手语识别相关的数据集上进行了微调。模型在评估集上取得了78.11%的准确率,适用于视频分类任务。
这是一个基于VideoMAE-base架构在未知数据集上微调的视频理解模型,专门用于手语识别任务。模型在20个训练周期后达到了18.64%的准确率。
这是一个基于VideoMAE架构的视频理解模型,在Kinetics数据集预训练的基础上进行了微调,专门用于手语识别任务。模型在评估集上表现有待提升,准确率为0.0010。
这是一个基于VideoMAE-base架构在WLASL数据集上微调的视频动作识别模型,专门针对手语识别任务进行优化,在评估集上达到48.22%的准确率。
这是一个基于VideoMAE-Base架构在WLASL数据集上微调的视频动作识别模型。经过200轮训练,在评估集上达到52.96%的前1准确率和79.88%的前5准确率,专门用于手语动作识别任务。
rtr46
这是一个专门针对日本电子游戏文本优化的字符检测模型,采用帕累托最优设计,在准确率和延迟之间取得了最佳平衡。模型将文本识别重新定义为字符检测任务,在日本电子游戏数据上训练,实现了先进的识别性能。
adoamesh
本模型是基于OpenAI Whisper-small模型针对斯瓦希里语进行微调的自动语音识别模型。在FLEURS-SLU数据集的斯瓦希里语部分进行训练,显著提升了斯瓦希里语的转录准确率,单词错误率相比基础模型降低了68%。
abhi099k
基于DeBERTa-v3-large微调的AI文本检测模型,能够准确识别文本是由人类撰写还是AI生成,在自定义数据集上训练达到约97%的准确率。
ReportAId
MedWhisper Large ITA是基于OpenAI Whisper Large v3 Turbo的领域适配变体,专门针对意大利语医疗语音识别进行了优化。该模型在精心挑选的意大利语门诊专科就诊录音集上使用LoRA技术进行微调,显著提升了医学术语和临床表达的识别准确率。
stanford-oval
CHURRO是一个30亿参数的开放权重视觉语言模型,专门用于历史文档转录。它能够识别跨越22个世纪和46个语言集群的手写和印刷文本,包括历史语言和已消亡语言,在显著降低成本的条件下实现了比大型商业模型更高的准确率。
openchs
基于OpenAI Whisper Large v2在Common Voice 17.0斯瓦希里语数据集上微调的语音识别模型,专为坦桑尼亚儿童求助热线的斯瓦希里语语音识别任务设计,相比基础模型在斯瓦希里语识别准确率上有显著提升。
Priyanshuchaudhary2425
ScamGuard是基于bert-base-cased微调的诈骗信息检测模型,在评估集上准确率达到98.13%,能够有效识别诈骗信息,提升检测准确性和效率。
BUT-FIT
SE-DiCoW是由BUT Speech@FIT联合JHU CLSP/HLTCOE和CMU LTI开发的目标说话人多说话人自动语音识别模型。该模型基于Whisper large-v3-turbo,通过自注册机制和改进的数据增强技术,在高度重叠的多说话人场景下显著提升了识别准确率。
PaddlePaddle
PaddleOCR团队开发的PP-OCRv3_rec系列中的天城文专用文本行识别模型,支持天城文识别,平均准确率96.44%。
超轻量级韩语文本行识别模型,支持韩语和数字字符识别,平均准确率60.21%。
preszzz
这是一个基于AST架构的音频检测模型,专门针对无人机音频识别任务进行微调。在评估集上取得了99.6%的准确率和99.74%的F1值,表现出色。
mlx-community
Parakeet CTC 0.6B是一个基于FastConformer架构的自动语音识别模型,专门为MLX框架优化转换而来。该模型支持英语语音识别任务,具有高效的推理性能和良好的识别准确率。
Adun
olmOCR是一款基于Qwen2-VL-7B-Instruct微调的光学字符识别模型,专注于将PDF等图像内容转换为文本,并通过微调提升特定场景下的识别准确率。
jsbeaudry
基于OpenAI Whisper-medium微调的海地克里奥尔语语音识别模型,专注高准确率转录
dihuzz
该模型基于Wav2Vec2架构微调训练,专门用于识别英语语音中的六种情绪状态(悲伤、愤怒、厌恶、恐惧、快乐、中性),准确率达92.42%。