Mistral AI发布开源内容审核模型Shieldstral,3B参数,Apache2.0许可,支持12种语言,可在单张16GB GPU运行。号称性能媲美7倍大模型,并在多模态审核达SOTA,但指出多数防护模型将伤害类别体系固化。
谷歌因全球算力短缺限制Meta访问顶级AI模型Gemini,此前该模型是Meta自动化安全审核的核心,高效处理诈骗和有害内容检测。此举凸显云计算能力瓶颈正影响科技巨头关键业务。
因全球云计算能力持续短缺,谷歌正式限制Meta对Gemini模型的访问。该模型原为Meta审核核心,用于诈骗和有害内容过滤,效果优于自家Llama。尽管谷歌云单季营收达200亿美元,基础设施扩张仍不敌AI推理需求的爆发式增长。
Meta在扎克伯格力推AI的背景下,加速用大语言模型取代人工审核,已将AI深度融入内容与广告合规审查。目前平台约50%的内容审核已由AI完成,旨在优化成本与效率。
新一代多模态内容审核模型
安全内容审核模型
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
Bytedance
$1.2
$3.6
4
prithivMLmods
GA Guard系列是开源权重的审核模型,旨在帮助开发者和组织维护语言模型的安全性、合规性以及与现实世界的一致性。该模型可检测七种违规类别,包括非法活动、仇恨与辱骂、个人身份信息与知识产权、提示安全、色情内容、虚假信息以及暴力与自残。
GeneralAnalysis
GA Guard Thinking是General Analysis开发的40亿参数开源审核模型,专门用于检测和防止语言模型生成不安全、不合规的内容。该模型在七个安全类别上进行训练,能够有效识别非法活动、仇恨言论、个人信息泄露等风险内容。
GA Guard Lite是General Analysis开发的轻量级开源审核模型,专门用于检测语言模型输出中的违规内容。该模型能够识别七类安全风险,包括非法活动、仇恨言论、个人信息泄露等,为AI应用提供高效的内容安全防护。
GA Guard Core是General Analysis开发的开源审核模型,专门用于检测和分类七类违规内容,包括非法活动、仇恨言论、个人信息泄露等,确保AI应用的安全性和合规性。
nvidia
Llama-3.1-Nemotron-Safety-Guard-8B-v3 是 NVIDIA 开发的多语言内容安全审核模型,基于 Meta 的 Llama-3.1-8B-Instruct 模型优化,专门用于检测和分类人类与 LLM 交互中的不安全内容。
Roblox
Roblox Guard 1.0是一款基于Llama-3.1-8B-Instruct微调的最先进指令微调大语言模型,专门设计用于保护文本生成API的安全。它能够在提示词和回复层面进行双级安全分类,有效审核用户查询和模型输出,确保内容符合安全政策。
tomg-group-umd
DynaGuard-8B是由马里兰大学和第一资本开发的80亿参数守护者模型,能够根据用户定义的自然语言策略评估文本合规性,提供灵活的内容审核解决方案,在安全和合规基准测试中达到先进水平。
Ateeqq
本模型专为NSFW图像分类微调,可将内容划分为三个安全关键类别,适用于内容审核、安全过滤及合规内容处理系统。
distill
该模型是将基础模型DeepSeek-R1-蒸馏-Qwen-32B与approval_bureau_model_lora适配器合并后的产物,适用于文档审核、文本生成及内容审批相关场景。
oxyapi
基于DistilBERT的快速轻量级文本审核模型,可高效分类11种违规内容类型
unsloth
这是一个用于网络内容审核的AI模型,旨在识别和处理不符合法律法规和社会主义核心价值观的内容,维护健康有序的网络环境。
ToxicityPrompts
PolyGuard是一个用于保护LLM生成内容的多语言安全模型,支持17种语言的安全审核,当前达到最先进水平。
quentintaranpino
基于FocalNet微调的NSFW图像分类模型,用于内容审核任务,将图像分为安全、需审核、不安全三类。
DuoGuard
DuoGuard-0.5B 是一个多语言、仅解码器的基于大语言模型的分类器,专门设计用于跨12个不同子类别的安全内容审核。
mradermacher
VISION-1是一个基于transformers的内容审核与安全分类模型,专注于文本分类任务。
PolyGuard是一款支持17种语言的多语言安全审核模型,专门为大语言模型生成内容的安全审核而设计。它能够分析人类与LLM之间的交互,判断请求和回复的有害性,识别违反的安全策略类别,填补了多语言安全审核的空白。
andriadze
基于ModernBERT-base微调的聊天内容审核模型,专门用于阻止非法/未成年/排泄物相关内容
erax-ai
高效NSFW内容检测模型,适用于图像/视频审核或限制未成年人接触有害内容
meta-llama
Llama Guard 3是基于Llama-3.1-8B预训练模型微调的内容安全分类器,用于LLM输入和响应的内容审核。
基于Llama-3.1-8B微调的内容安全分类模型,支持8种语言的输入/响应内容审核