AIBase
Home
AI NEWS
AI Tools
GEO & AEO
MCP
AI Models
Join Now
EN

AI News

View More

Anthropic 推出“体质分类器”:成功阻止95% 的模型越狱尝试

人工智能公司 Anthropic 近日宣布开发了一种名为“体质分类器”的新安全方法,旨在保护语言模型免受恶意操纵。该技术专门针对“通用越狱”——一种试图系统性绕过所有安全措施的输入方式,以防止 AI 模型生成有害内容。为了验证这一技术的有效性,Anthropic 进行了一项大规模测试。公司招募了183名参与者,在两个月内尝试突破其防御系统。参与者被要求通过输入特定问题,试图让人工智能模型 Claude3.5回答十个禁止的问题。尽管提供了高达15,000美元的奖金和约3,000小时的测试时间,

14.9k 2 days ago
Anthropic 推出“体质分类器”:成功阻止95% 的模型越狱尝试

Models

View More

GPT-4.1 mini

Openai

GPT-4.1 mini

$2.8

Input tokens/M

$11.2

Output tokens/M

1k

Context Length

GPT-5 nano

Openai

GPT-5 nano

$0.35

Input tokens/M

$2.8

Output tokens/M

400

Context Length

Qianfan-PublicOpinion-Classification

Baidu

Qianfan-PublicOpinion-Classification

-

Input tokens/M

-

Output tokens/M

32

Context Length

GPT-4.1 nano

Openai

GPT-4.1 nano

$0.7

Input tokens/M

$2.8

Output tokens/M

1k

Context Length

PP-UIE-7B

Baidu

PP-UIE-7B

-

Input tokens/M

-

Output tokens/M

-

Context Length

PP-UIE-14B

Baidu

PP-UIE-14B

-

Input tokens/M

-

Output tokens/M

-

Context Length

腾讯元器

Tencent

腾讯元器

$100

Input tokens/M

$100

Output tokens/M

-

Context Length

AIBase
Empowering the future, your artificial intelligence solution think tank
English简体中文繁體中文にほんご
FirendLinks:
AI Newsletters AI ToolsMCP ServersAI NewsAI MarketingLLM LeaderboardAI Ranking
© 2026AIBase
Business CooperationSite Map