法国Mistral AI推出OCR4文档识别模型,支持跨越10个语族的170种语言。该模型在OmniDocBench测试中获93.07分,输出准确自然,用户体验优于GPT5.5Pro和Gemini3.1Pro。
法国Mistral AI发布文档识别模型OCR 4,支持10个语族170种语言,在权威测试获93.07分,输出质量经人类评审优于GPT-5.5 Pro等竞品。该模型小巧全面,覆盖多场景任务,专精文档识别。
DeepSeek正在灰度测试“识图模式”,该模式具备多模态识别能力,能进行深度图像分析与描述,而不仅是OCR文字识别。用户上传图片后可获得快速响应,有网友形容速度如闪电般迅速。
Mistral AI发布新一代文档识别技术Mistral OCR3,在表格、扫描文档、复杂表格及手写识别方面表现突出,整体性能较上一代提升74%。该技术旨在高效准确提取各类文档中的文本和嵌入式图像,支持多格式处理,显著提升文档处理效率与精度。
免费在线AI工具,秒将任何PDF转为干净、结构化的Markdown
基于先进AI技术的在线OCR工具,可将图片与PDF快速识别并转换为可编辑文本。
Mistral OCR 是一款先进的光学字符识别 API,能够精准理解和解析复杂文档。
一个基于Google Gemini 2.0的高精度OCR文字识别应用。
Anthropic
$21
Input tokens/M
$105
Output tokens/M
200
Context Length
Alibaba
$1
$10
256
$2
$20
-
$8
$240
52
$15.8
$12.7
64
Bytedance
$0.8
128
Baidu
32
$0.3
Tencent
$3
$9
16
$1.5
$4.5
Huawei
Dogacel
这是一个基于原始DeepSeek-OCR模型的优化版本,专门支持在苹果金属性能着色器(MPS)和CPU上进行推理的OCR模型。它能够从图像中提取文本并转换为结构化格式,支持多语言文档识别。
noctrex
LightOnOCR-1B-1025是基于图像到文本的OCR模型,采用1B参数规模,经过imatrix量化优化,专门用于从图像中提取和识别文本内容。
LightOnOCR-1B-1025的量化版本,专门用于图像转文本任务,在文档理解、视觉语言处理等领域有广泛应用。该模型支持多种欧洲语言,适用于OCR、PDF处理和表格识别等场景。
mlx-community
DeepSeek-OCR-8bit是基于DeepSeek-OCR模型转换的MLX格式版本,专门针对苹果芯片优化的视觉语言模型,支持多语言OCR识别和图像文本理解任务。
quocnguyen
该模型是基于DeepSeek-OCR转换的MLX格式视觉语言模型,专门用于光学字符识别(OCR)任务,支持多语言文本识别和图像理解
这是一个基于DeepSeek-OCR模型转换的MLX格式模型,支持多语言图像文本识别和文本生成功能,专门针对OCR任务优化。
Mungert
Nanonets-OCR2-1.5B-exp GGUF 是一款强大的图像到markdown的OCR模型,能够将文档转换为结构化的markdown格式,并进行智能内容识别和语义标记,支持多语言文档处理。
richardyoung
olmOCR-2-7B-1025是由AllenAI开发的高质量OCR视觉语言模型,专门用于处理文档、图像中的文字识别任务。本仓库提供其GGUF量化版本,采用Q8_0量化方式,在减小模型大小的同时保持了出色的准确性。
impresso-project
Impresso NER模型是一个专门用于历史文档处理的多语言命名实体识别模型。基于堆叠式Transformer架构,能够识别数字化历史文本中的细粒度和粗粒度实体类型,包括人名、头衔、地点等。该模型针对历史文档中的OCR噪声、拼写变化和非标准语言用法进行了优化。
Nanonets-OCR2-3B GGUF模型是专为文档处理设计的强大工具,能够将各类文档智能转换为结构化的Markdown格式,具备OCR、图像转文本、PDF转Markdown以及视觉问答等多种先进识别和处理能力。
datalab-to
Chandra是一款先进的OCR模型,能够从图像和PDF中高精度提取文本并保留布局信息。它支持Markdown、HTML和JSON格式输出,在手写体识别、表单重构、表格处理等方面表现出色,支持40多种语言。
AhmedZaky1
DIMI阿拉伯语OCR v2是一款专门针对阿拉伯语文本识别优化的光学字符识别模型,基于Qwen2.5-VL-7B-Instruct微调开发,在变音符密集文本处理方面相比v1版本有显著改进
PaddlePaddle
PaddleOCR团队开发的最新一代英文文本行识别模型,专为高效、准确的英文OCR识别而设计,在移动端设备上具有优异的性能表现。
allenai
这是基于Qwen2.5-VL-7B-Instruct微调的FP8量化版本OCR模型,专门用于文档图像文本识别,支持高效的大规模文档处理。
unsloth
Nanonets-OCR-s是一款先进的图像转Markdown光学字符识别(OCR)模型,能够将文档转换为结构化的Markdown格式,具备智能内容识别和语义标记功能。
Nanonets-OCR-s是一款强大的图像转Markdown的OCR模型,能够将文档转换为结构化的Markdown并进行智能内容识别和语义标记。
prithivMLmods
基于Qwen/Qwen2-VL-2B-Instruct微调的多模态模型,专为OCR、图像转文本、LaTeX数学求解及手写识别优化
NAMAA-Space
专为阿拉伯文光学字符识别(OCR)设计的视觉语言模型,能直接识别图像中的阿拉伯文字。
基于Qwen2-VL-2B-Instruct微调的阿拉伯语OCR模型,专为整页阿拉伯文本识别优化,支持变音符号识别
DevQuasar
olmOCR-7B-0225-preview 是由 AllenAI 开发的一个基于 OCR 技术的图像文本转文本模型,旨在从图像中提取和识别文本内容。
基于MaaFramework的MCP服务器,为AI助手提供Android设备和Windows桌面自动化能力,支持OCR识别、点击、滑动、文本输入等操作,并能将操作流程转换为可复用的Pipeline。
手写OCR的MCP服务端
一个提供屏幕截图和OCR文本识别功能的MCP服务器
一个基于xAI Grok API的MCP服务器,提供AI图像分析功能,支持URL和本地文件的图像描述、元数据提取和OCR文字识别
基于RapidOCR的MCP服务器,提供便捷的OCR接口服务
这是一个reMarkable平板电脑的MCP服务器,让AI助手能够读取、搜索和遍历你的整个reMarkable库,包括通过OCR识别手写笔记,将平板变成AI可访问的“第二大脑”。
TextIn MCP Server是一个文档文本提取和OCR工具,支持从图片、PDF和Word中识别文本、提取关键信息并转换为Markdown格式。
一个提供计算机控制功能的MCP服务器,包括鼠标键盘控制、OCR识别、窗口管理等,基于PyAutoGUI和RapidOCR实现,无外部依赖。
一个提供计算机控制功能的MCP服务器,包括鼠标键盘控制、屏幕截图、OCR文字识别等,支持跨平台运行,无需外部依赖。
native-devtools-mcp 是一个跨平台的 MCP 服务器,为 AI 代理提供对 macOS、Windows 和 Android 系统的自动化控制能力,包括屏幕截图、OCR 文字识别、模拟点击输入、窗口管理以及 Android 设备控制。
基于Mistral AI的OCR服务,支持本地文件和URL的图文识别
基于ddddocr的CAPTCHA识别MCP服务器,提供文本OCR、目标检测和滑块匹配功能
基于OpenAI视觉模型的OCR服务,集成Cursor IDE实现图片文字自动提取与保存
Auto-Snap MCP是一个自动化截图和文档处理工具,可将截图自动转换为PDF,支持通过自然语言命令操作,适用于多种系统环境。
手写OCR的MCP服务端,实现与Handwriting OCR API的集成,支持上传图片/PDF文档、检查状态和获取OCR识别结果。
MinerU文档解析MCP服务器,支持PDF、DOC、图像等格式的文本、表格和公式提取,提供高精度VLM模型和快速管道模型,支持批量处理和本地文件上传。