OpenAI升级GPT-5.5 Instant模型,显著增强意图识别与引申义捕捉能力,复杂任务处理更稳定。该模型5月5日发布,高风险领域幻觉率下降52.5%,数学、科学及视觉推理进步明显。5月30日的更新进一步优化回复自然度。
OpenAI于6月25日推出轻量模型GPT-5.5 Instant新版,核心升级聚焦提升“洞察力”与任务执行稳定性,使AI更精准把握用户意图。自5月首发以来,该模型在医学、金融及法律等高风险领域幻觉率已大幅降低52.5%,数理推理能力突出。本次迭代则在此基础上再进一步,强化专业场景下的可靠表现。
彩虹无线联合中科大脑发布“一修大模型”及“IF-Link mini智能栈”,聚焦汽车售后维修领域。针对新能源车渗透率提升和车辆架构复杂化带来的维修难题,该模型通过超千万台车辆数据训练,解决通用大模型在专业领域数据不足、易产生“幻觉”的问题,以AI软硬一体化方案提升诊断效率。
大模型“幻觉”问题(输出事实性错误)在医疗、法律等高危领域尤为严重。业界对抗幻觉的两大主流方法——扩大训练数据与设置防御机制——均有局限:数据无法覆盖所有事实,防御机制则常导致AI过度谨慎。
消除幻觉,多模态RAG不忘信息,智能编排前沿模型,任务表现卓越
一个用于比较大型语言模型在总结短文档时产生幻觉的排行榜。
一个用于检测幻觉的开源评估模型,基于Llama-3架构,拥有700亿参数。
开源幻觉评估模型
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$2
$20
$6
$24
cpatonn
Qwen3-Omni-30B-A3B-Captioner是基于Qwen3-Omni-30B-A3B-Instruct微调得到的细粒度音频分析模型,专门为任意音频输入生成详细且低幻觉的描述,在复杂多样的音频场景中表现出色。
openchs
这是一个基于Helsinki-NLP的opus-mt-mul-en模型进行微调的斯瓦希里语-英语翻译模型。该模型专门针对儿童热线服务场景进行了优化训练,采用合成的热线对话数据进行训练,具备防止生成幻觉的机制,并通过早停策略监控BLEU分数来保证翻译质量。
nightmedia
Qwen3-Next-80B-A3B-Instruct-q2-mlx是基于Qwen3-Next-80B-A3B-Instruct模型转换的MLX格式极端量化版本,主要用于文本生成任务。该版本采用q2量化,模型大小约为23GB,作为概念验证版本,可能存在重复和幻觉问题。
HugoHE
M-Hood 是一系列专门设计用于缓解目标检测中幻觉现象的模型,通过新颖的微调策略和修正的基准数据集,显著减少分布外数据上的误报,提升目标检测系统的安全性和可靠性。
stelterlab
DeepSeek-R1-0528是深度求索公司推出的升级版大语言模型,在推理能力、减少幻觉率等方面有显著提升,整体性能接近领先模型。
QuantTrio
基于DeepSeek-R1-0528-Qwen3-8B开发的量化版本模型,在推理能力、减少幻觉率等方面有显著提升,适用于多种自然语言处理任务。
Inpris
Humains-Junior是由Humains.com基于微软Phi-3.5-mini-instruct模型训练的AI助手,专门针对客户服务场景优化。该模型使用3亿个标记进行微调,具备严格的指令遵循能力、减少幻觉现象和强大的功能调用能力,并实现了身份感知。
grounded-ai
该模型用于检测语言模型输出中的幻觉现象,即响应连贯但事实错误或脱离上下文的情况。
TEEN-D
基于Llama-3.2-3B-Instruct微调的声明验证模型,专门用于检测AI生成文本中的幻觉或未支持的陈述。
5CD-AI
Vintern-3B-R-beta是一个多模态大语言模型,专注于基于图像的复杂推理任务,能分解推理步骤并有效控制幻觉现象。
DISLab
Gen-8B-R2是一个专注于减少RAG系统中幻觉问题的生成模型,特别适用于处理检索噪声和信息过载的情况。
MichielPronk
该模型专门为SemEval 2025 Task3: Mu-SHROOM竞赛任务微调,用于识别大语言模型输出中的幻觉文本片段。
yaxili96
FactCG是一个基于DeBERTa-v3-large架构的文本分类模型,专门用于检测大型语言模型生成内容中的无依据幻觉。
KRLabsOrg
LettuceDetect 是一个基于 ModernBERT 的幻觉检测模型,专为 RAG 应用设计,支持长上下文处理。
LettuceDetect 是一个基于 ModernBERT 的幻觉检测模型,专为 RAG 应用设计,能够识别答案中未被上下文支持的词元。
SeaLLMs
SeaLLMs-v3是面向东南亚语言的大语言模型系列的最新成果,在同规模模型中表现卓越,能有效处理多种东南亚语言任务,提供安全可靠的响应。该模型经过特别优化,减少了幻觉现象,并对当地语境具有敏感性。
SeaLLMs-v3是面向东南亚语言的大语言模型系列的最新版本,在同类规模模型中取得最先进的性能,在世界知识、数学推理、翻译和指令遵循等任务中表现出色,特别优化了可靠性和安全性,减少幻觉现象。
gokaygokay
基于PaliGemma-3b模型在DocCI数据集上微调的图像描述生成模型,能生成200-350字符的详细描述文本,减少幻觉现象
TroyDoesAI
基于microsoft/Phi-3-mini-128k-instruct优化的模型,专注于提升上下文遵循能力和减少幻觉现象,适用于RAG应用场景。
blueapple8259
该模型使用韩国教材数据集tiny-textbooks进行训练,性能表现欠佳且存在严重幻觉现象
MCP-NixOS是一个防止AI助手对NixOS系统产生幻觉的模型上下文协议服务器,提供NixOS软件包、系统选项、Home Manager设置和nix-darwin配置的实时访问。