法国Mistral AI推出OCR4文档识别模型,支持跨越10个语族的170种语言。该模型在OmniDocBench测试中获93.07分,输出准确自然,用户体验优于GPT5.5Pro和Gemini3.1Pro。
法国Mistral AI发布文档识别模型OCR 4,支持10个语族170种语言,在权威测试获93.07分,输出质量经人类评审优于GPT-5.5 Pro等竞品。该模型小巧全面,覆盖多场景任务,专精文档识别。
百度发布文心大模型衍生模型PaddleOCR-VL-1.6,在OmniDocBench v1.6评测中以96.33%准确率超越Gemini-3-Pro、GPT-5.2等主流模型,刷新SOTA,综合性能全球第一。该模型标志着多模态大模型在复杂文档理解与真实场景解析上的重大突破,支持超100种语言识别,用户覆盖广泛。
IBM发布Granite 4.0 3B Vision视觉语言模型,拥有30亿参数,专为企业级复杂文档数据提取优化。该模型针对金融、法律、医疗等行业非结构化数据处理难题,在复杂表格、扫描件及多模态布局文档中表现突出,通过结合视觉理解与语言生成,精准识别并提取关键信息。
一个强大的开源文档解析模型,支持多种复杂排版的内容识别。
olmOCR-7B-0225-preview 是一个基于 Qwen2-VL-7B-Instruct 微调的文档图像识别模型,用于高效转换文档为纯文本。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
$8
$240
52
Bytedance
$1.2
$3.6
4
Dogacel
这是一个基于原始DeepSeek-OCR模型的优化版本,专门支持在苹果金属性能着色器(MPS)和CPU上进行推理的OCR模型。它能够从图像中提取文本并转换为结构化格式,支持多语言文档识别。
noctrex
LightOnOCR-1B-1025的量化版本,专门用于图像转文本任务,在文档理解、视觉语言处理等领域有广泛应用。该模型支持多种欧洲语言,适用于OCR、PDF处理和表格识别等场景。
Mungert
Nanonets-OCR2-1.5B-exp GGUF 是一款强大的图像到markdown的OCR模型,能够将文档转换为结构化的markdown格式,并进行智能内容识别和语义标记,支持多语言文档处理。
richardyoung
olmOCR-2-7B-1025是由AllenAI开发的高质量OCR视觉语言模型,专门用于处理文档、图像中的文字识别任务。本仓库提供其GGUF量化版本,采用Q8_0量化方式,在减小模型大小的同时保持了出色的准确性。
impresso-project
Impresso NER模型是一个专门用于历史文档处理的多语言命名实体识别模型。基于堆叠式Transformer架构,能够识别数字化历史文本中的细粒度和粗粒度实体类型,包括人名、头衔、地点等。该模型针对历史文档中的OCR噪声、拼写变化和非标准语言用法进行了优化。
Nanonets-OCR2-3B GGUF模型是专为文档处理设计的强大工具,能够将各类文档智能转换为结构化的Markdown格式,具备OCR、图像转文本、PDF转Markdown以及视觉问答等多种先进识别和处理能力。
rajinikarcg
这是一个基于BERT微调的软件需求二分类模型,专门用于识别和分类软件需求文档中的需求与非需求文本,准确区分功能性需求描述与其他内容。
pierre-tassel
Rapido NER 是一个强大的多语言命名实体识别器和实体嵌入模型,以猫 Rapido 命名。该模型提供强大的多语言 NER 性能,支持实体聚类和检索,处理文档内聚类以及长上下文等任务。
stanford-oval
CHURRO是一个30亿参数的开放权重视觉语言模型,专门用于历史文档转录。它能够识别跨越22个世纪和46个语言集群的手写和印刷文本,包括历史语言和已消亡语言,在显著降低成本的条件下实现了比大型商业模型更高的准确率。
allenai
这是基于Qwen2.5-VL-7B-Instruct微调的FP8量化版本OCR模型,专门用于文档图像文本识别,支持高效的大规模文档处理。
tcpipuk
dots.ocr是一款强大的多语言文档解析器,将布局检测和内容识别统一在单一视觉语言模型中,基于17亿参数实现SOTA性能,支持多语言文档解析和良好的阅读顺序保持。
PurplelinkPL
FineWeb是一个专门针对金融领域文本分类任务的预训练模型,基于高质量金融文本数据训练,能够准确识别和分类金融相关文档内容。
echo840
MonkeyOCR是一款基于结构-识别-关系(SRR)三元范式的文档解析模型,能够高效处理PDF和图像文档,提取文本、公式、表格等结构化内容,支持中英文文档解析。
unsloth
Nanonets-OCR-s是一款先进的图像转Markdown光学字符识别(OCR)模型,能够将文档转换为结构化的Markdown格式,具备智能内容识别和语义标记功能。
Nanonets-OCR-s是一款强大的图像转Markdown的OCR模型,能够将文档转换为结构化的Markdown并进行智能内容识别和语义标记。
PaddlePaddle
PP-DocBlockLayout 是一个基于 RT-DETR-L 训练的文档布局块定位模型,能够有效识别多种文档类型中的布局区域。
基于PP-OCRv4_server_rec增强的文档文本识别模型,支持超过15000个字符,包括繁体字、日文字符和特殊符号。
Impresso NER模型是一个用于历史文档处理的多语言命名实体识别模型,基于堆叠式Transformer架构,能够识别数字化历史文本中的细粒度和粗粒度实体类型。
Tetsuo3003
这是一个专门针对中文医疗会话文档的命名实体识别(NER)模型,基于xlm-roberta架构微调,适用于医疗领域的信息提取和匿名化处理。
FriendliAI
基于Qwen2-VL-7B-Instruct微调的文档OCR模型,支持多语言文档识别与元数据提取