阿里发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,专注精准识别专业词汇。模型优化上下文一致性、行业词与热词定制,支持语音润色并直接输出结构化文本。团队构建了覆盖医疗、IT、股票等领域的多行业高质量词库,评测显示行业词识别效果显著提升。
Substack推出AI内容检测功能,由Pangram技术支持,覆盖文章、笔记、回复等全场景,帮助读者辨别人类与AI生成内容。该功能已登陆网页端和iOS,安卓版近期上线。
Epoch AI研究显示,主流AI文本检测器能近乎完美识别普通AI生成内容,但当大语言模型刻意模仿特定作者写作风格时,准确率明显下降,科学写作最难辨别。实验测试了Pangram、GPTZero和Originality.ai三款工具,采用495篇涵盖博客、小说、科学的人类原创文本(均创作于ChatGPT问世前),发现风格模仿可有效逃逸检测。
AI编程的高API调用成本是开发者痛点,新工具pxpipe作为本地代理,能将庞大上下文信息转为图像,绕过昂贵的文本Token计费,显著降低Claude Code使用开销。其原理是在请求发送前精确识别并转化冗长文本,实现“以图省字”的降本增效。
基于先进AI技术的在线OCR工具,可将图片与PDF快速识别并转换为可编辑文本。
免费且准确的AI内容检测工具,支持识别ChatGPT、Claude及Gemini等生成的文本。
开源的前沿语音 AI 模型,支持语音识别和文本转语音。
免费AI检测器,可识别AI生成、改写及人类撰写文本,有句级解释。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$6
$24
Baidu
128
$8
$240
52
Bytedance
$1.2
$3.6
4
$2
Dogacel
这是一个基于原始DeepSeek-OCR模型的优化版本,专门支持在苹果金属性能着色器(MPS)和CPU上进行推理的OCR模型。它能够从图像中提取文本并转换为结构化格式,支持多语言文档识别。
abr-ai
这是一个由Applied Brain Research(ABR)开发的基于状态空间模型(SSM)的英文自动语音识别模型,拥有约1900万参数,能够高效准确地将英文语音转录为文本。该模型在多个基准数据集上表现出色,平均单词错误率仅为10.61%,支持实时语音识别并可在低成本硬件上运行。
rtr46
这是一个专门针对日本电子游戏文本优化的字符检测模型,采用帕累托最优设计,在准确率和延迟之间取得了最佳平衡。模型将文本识别重新定义为字符检测任务,在日本电子游戏数据上训练,实现了先进的识别性能。
strangervisionhf
这是一个基于DeepSeek-OCR的图像文本识别模型,专门解决了在最新版本transformers库中的兼容性问题,使模型能够在transformers v4.57.1等最新版本中顺利运行。
noctrex
LightOnOCR-1B-1025是基于图像到文本的OCR模型,采用1B参数规模,经过imatrix量化优化,专门用于从图像中提取和识别文本内容。
mlx-community
DeepSeek-OCR-8bit是基于DeepSeek-OCR模型转换的MLX格式版本,专门针对苹果芯片优化的视觉语言模型,支持多语言OCR识别和图像文本理解任务。
DeepSeek-OCR-6bit是基于DeepSeek-OCR模型转换的MLX格式版本,专门针对苹果芯片优化。这是一个视觉语言模型,具备强大的光学字符识别能力,能够从图像中提取和识别文本信息。
quocnguyen
该模型是基于DeepSeek-OCR转换的MLX格式视觉语言模型,专门用于光学字符识别(OCR)任务,支持多语言文本识别和图像理解
这是一个基于DeepSeek-OCR模型转换的MLX格式模型,支持多语言图像文本识别和文本生成功能,专门针对OCR任务优化。
impresso-project
Impresso NER模型是一个专门用于历史文档处理的多语言命名实体识别模型。基于堆叠式Transformer架构,能够识别数字化历史文本中的细粒度和粗粒度实体类型,包括人名、头衔、地点等。该模型针对历史文档中的OCR噪声、拼写变化和非标准语言用法进行了优化。
Mungert
Nanonets-OCR2-3B GGUF模型是专为文档处理设计的强大工具,能够将各类文档智能转换为结构化的Markdown格式,具备OCR、图像转文本、PDF转Markdown以及视觉问答等多种先进识别和处理能力。
datalab-to
Chandra是一款先进的OCR模型,能够从图像和PDF中高精度提取文本并保留布局信息。它支持Markdown、HTML和JSON格式输出,在手写体识别、表单重构、表格处理等方面表现出色,支持40多种语言。
pcuenq
PaddleOCR-VL-0.9B 是一个基于 PaddlePaddle 框架开发的视觉语言模型,专门用于图像文本到文本的转换任务。该模型复刻自 PaddlePaddle 官方版本,支持从图像中提取和识别文本内容。
kalilouisangare
这是一个基于 OpenAI Whisper Small 模型微调的班巴拉语语音识别模型,在 24738 个班巴拉语音频样本上训练,能够将班巴拉语语音准确转录为文本,字符错误率低至 21.69%。
AhmedZaky1
DIMI阿拉伯语OCR v2是一款专门针对阿拉伯语文本识别优化的光学字符识别模型,基于Qwen2.5-VL-7B-Instruct微调开发,在变音符密集文本处理方面相比v1版本有显著改进
rajinikarcg
这是一个基于BERT微调的软件需求二分类模型,专门用于识别和分类软件需求文档中的需求与非需求文本,准确区分功能性需求描述与其他内容。
abhi099k
基于DeBERTa-v3-large微调的AI文本检测模型,能够准确识别文本是由人类撰写还是AI生成,在自定义数据集上训练达到约97%的准确率。
OmniDimen
OmniDimen-V1.1-4B-Emotion是基于Qwen3-4B-Instruct-2507微调的情感识别和情感感知文本生成模型,专门用于精准识别文本情感倾向并生成相匹配的情感化内容,为用户提供更具情感共鸣的交互体验。
eustlb
这是一个基于Hugging Face Transformers库的自动语音识别模型,能够将音频内容转换为文本。该模型支持多种语言,适用于实时语音转文字、音频转录等场景。
stanford-oval
CHURRO是一个30亿参数的开放权重视觉语言模型,专门用于历史文档转录。它能够识别跨越22个世纪和46个语言集群的手写和印刷文本,包括历史语言和已消亡语言,在显著降低成本的条件下实现了比大型商业模型更高的准确率。
基于MaaFramework的MCP服务器,为AI助手提供Android设备和Windows桌面自动化能力,支持OCR识别、点击、滑动、文本输入等操作,并能将操作流程转换为可复用的Pipeline。
一个提供屏幕截图和OCR文本识别功能的MCP服务器
Speech MCP是为Goose设计的语音交互扩展,提供实时语音识别、高质量文本转语音、多语言支持和现代化音频可视化界面,支持多角色对话生成和音频转录功能。
Speech MCP 是一个为Goose设计的语音交互扩展,提供实时语音识别、文本转语音和音频可视化功能。
基于large-text-viewer的trace分析工具,支持Trae Skill和MCP服务器两种模式,提供文本搜索、魔数识别、搜索结果优化等功能,用于逆向工程和算法分析。
TextIn MCP Server是一个文档文本提取和OCR工具,支持从图片、PDF和Word中识别文本、提取关键信息并转换为Markdown格式。
Oxenstierna项目旨在通过集成瑞典国家档案馆的多种API(如OAIPMH、IIIF和搜索API),提供对档案内容的搜索、获取和分析功能,包括HTR(手写文本识别)流程和图像处理。
InfraNodus MCP服务器是一个集成知识图谱和文本网络分析能力的协议服务器,可将文本转换为结构化知识图谱,识别主题集群、内容空白和概念关系,为AI工作流提供增强分析能力。
该项目旨在通过多个API接口(如OAI-PMH、IIIF和搜索API)提供对瑞典国家档案馆(Riksarkivet)内容的访问,包括搜索记录、获取集合信息、下载图像等功能,并探索实时手写文本识别(HTR)流程。
基于ddddocr的CAPTCHA识别MCP服务器,提供文本OCR、目标检测和滑块匹配功能
为Claude Code提供语音交互模式的MCP服务,支持通过浏览器进行免提的连续双向语音对话,包含语音识别和文本转语音功能。
pdffigures2-MCP-Server是一个基于pdffigures2的MCP服务,用于从学术PDF中提取图表、表格、标题和章节标题。
一个用于识别两组数据是否来自同一主体的工具,支持文本归一化、值比较和语义分析,并集成语言模型进行最终判断。
抖音和小红书内容提取MCP服务器,支持从抖音和小红书分享链接提取视频、图片和文本内容,提供无水印视频获取、AI语音识别、文案提取等功能。
数据对比工具,用于识别两组数据是否来自同一主体,支持文本标准化、值比较和语义分析。