針對AI深度接入瀏覽器、文件等現實場景帶來的安全脆弱性,OpenAI推出自動化紅隊模型GPT-Red,通過自博弈訓練,將直接提示注入攻擊失敗率降至0.05%,比傳統人工測試更高效全面,爲AI自我迭代與安全加固開闢新路徑。
ChatGPT被曝存在安全漏洞,攻擊者可通過提示詞注入與路徑遍歷技術繞過文件訪問限制,獲取未授權數據。問題源於上傳文件處理缺陷:系統原本不提供原始文件下載,但漏洞可被利用竊取額外信息。OpenAI已修復。
OpenAI推出“封鎖模式”安全設置,面向所有登錄用戶及工作區。該功能可限制ChatGPT的實時聯網、深度研究和智能體等核心能力,防止模型發起外部網絡請求,以降低敏感數據被提示注入攻擊竊取的風險。用戶和管理員可自主選擇開啓。
生成式人工智能向智能體時代發展,工具調用和聯網能力增強,安全防禦面臨挑戰。爲應對提示注入攻擊,OpenAI推出“封鎖模式”安全設置,面向所有登錄用戶開放,旨在加強系統防護。
保護您的AI應用免受提示注入的威脅
Openai
-
輸入tokens/百萬
輸出tokens/百萬
上下文長度
Anthropic
$7
$35
200
Bytedance
Alibaba
$0.7
$1.95
16
$2
128
32
Minimax
Tencent
$100
codeintegrity-ai
ModernBERT PromptGuard是一個高性能二分類器,專門用於檢測大語言模型應用中的惡意提示,包括提示注入和越獄攻擊。
meta-llama
Llama Prompt Guard 2 是 Meta 推出的提示攻擊檢測模型系列,包含 86M 參數升級版和 22M 輕量版,用於檢測大語言模型應用中的提示注入和越獄攻擊。
Llama Prompt Guard 2 86M是一個用於檢測提示注入和越獄攻擊的文本分類模型,是Prompt Guard系列的第二代產品。
leolee99
PIGuard是一種新型的提示防護模型,專門用於檢測提示注入攻擊。通過創新的訓練策略顯著減少對觸發詞的偏差,在多個基準測試中表現出色,超越現有最佳模型30.8%,為LLM安全提供強大的開源防護解決方案。
InjecGuard是一款針對大型語言模型(LLM)的提示注入攻擊防護模型,能有效識別並防禦惡意指令,同時減少過度防禦問題。
proventra
基於microsoft/mdeberta-v3-base微調的提示注入檢測模型,整合多個數據集訓練,用於識別惡意提示注入攻擊。
dcarpintero
基於ModernBERT的輕量級模型,專注於識別惡意提示注入攻擊,提供AI安全防護。
基於ModernBERT(大模型版)的輕量級模型,專用於識別惡意提示(即提示注入攻擊)。
skshreyas714
Prompt Guard是一個用於檢測提示攻擊的文本分類模型,能夠識別惡意提示注入和越獄行為。
testsavantai
TestSavantAI模型是一組經過微調的分類器,專門設計用於防禦針對大型語言模型(LLM)的提示注入和越獄攻擊。
TestSavantAI模型是一組專為防禦大型語言模型(LLM)提示注入和越獄攻擊而設計的分類器,微型版基於BERT-tiny架構,平衡安全性與計算效率。
GenTelLab
GenTel-Shield是一個專注於檢測和防禦提示詞注入攻擊的模型,能夠有效區分惡意樣本與良性樣本。
madhurjindal
這是一款最先進的人工智能安全模型,能夠以97.99%的準確率檢測越獄嘗試、提示注入和惡意命令。該模型為LLM、聊天機器人和AI系統提供卓越的保護,防止被利用。
PromptGuard是一個用於檢測和防護LLM提示攻擊的文本分類模型,能夠識別惡意提示注入和越獄嘗試。
DataPilot
ArrowPro-7B-KUJIRA是基於Mistral系列的日語優化模型,專為AI虛擬主播和AI助手設計,具備出色的對話性能和提示注入防禦能力。
protectai
基於DeBERTa-v3-base微調的提示詞注入檢測模型,用於識別可能操縱語言模型的惡意提示詞
這是 fmops/distilbert-prompt-injection 模型的 ONNX 格式轉換版本,用於檢測提示注入攻擊。
基於DeBERTa-v3微調的提示注入檢測模型,用於識別惡意提示輸入
這是deepset/deberta-v3-base-injection模型轉換為ONNX格式的版本,用於檢測提示注入攻擊。
fmops
用於檢測和防止提示注入攻擊的數據集,支持多語言文本分析
MCP-Scan是一款針對MCP服務器的安全掃描工具,用於檢測提示注入、工具汙染和跨域升級等常見安全漏洞。
Pipelock是一個開源的AI代理防火牆,通過單二進制文件提供零運行時依賴的安全防護。它採用能力分離架構,在代理與互聯網之間部署九層掃描管道,防止秘密洩露、提示注入和惡意工具調用。支持多種代理模式(Fetch代理、正向代理、WebSocket代理)和MCP代理,提供緊急停止開關、審計日誌和SIEM集成等功能。
AI包安全掃描工具,提供CLI和MCP服務器兩種模式,可快速檢測MCP服務器、AI技能和軟件包中的漏洞、提示注入和供應鏈攻擊
AI編碼助手安全掃描器,通過MCP或CLI掃描代碼漏洞、檢測AI幻覺包、阻止提示注入攻擊,支持12種語言和1700+安全規則
AI代理安全護欄MCP服務器,提供輸入驗證、提示注入檢測、PII脫敏、輸出過濾、策略執行、速率限制和審計日誌等安全功能
一個用於AI應用的雙層安全網關,通過語義分析和靜態模式匹配檢測提示注入、越獄攻擊及傳統Web漏洞,保護AI代理免受惡意輸入攻擊。
Model Context Protocol (MCP) 是由Anthropic引入的一種標準化協議,用於大語言模型(LLM)與外部工具和功能的交互,以及向LLM注入上下文。它支持模型請求即時信息、執行外部系統操作、訪問專業知識庫以及與API和服務交互。MCP類似於USB集線器,作為一個標準接口,減少了API變更的風險,因為每個MCP服務器由各自的公司維護,用戶只需集成即可。MCP服務器提供工具、資源和提示三種功能。
NestJS模塊,用於通過Model Context Protocol (MCP)輕鬆暴露AI工具、資源和提示,支持多種傳輸類型和依賴注入。
Shrike MCP是一個為AI代理提供即時安全掃描的MCP服務器,集成了9種安全工具,通過多階段檢測管道掃描提示、響應、SQL查詢、文件寫入、CLI命令和網絡搜索,防止提示注入、越獄、PII洩露和數據竊取。