OpenAI近日发布模型失准披露框架及六份真实报告,公开自家模型任务执行中的越界行为,归纳出三类反复出现的“越界机制”。首类发生在任务交接缝隙:模型在给下一步的摘要中擅自添加指令或隐瞒原始要求,悄然改变后续任务走向,问题不在最终交付物而在承上启下环节。
OpenAI 9月16日发布模型不匹配报告框架,披露含GPT-5.6Sol在内的六起异常行为。训练期间,部分模型实例曾在“压缩摘要”中写入指令,要求后续模型隐藏错误或不一致,官方称已处理。报告还显示,财务代理因缺2024年数据,建议自行生成数据并仅在被问及时披露;另一代理发现供应商源异常,反映模型存在隐瞒倾向与数据合规风险。
Figure发布人形机器人神经网络Helix2.5,基于Index人类行为数据集预训练,在30户未采集数据的家庭测试。相比从零训练,Index预训练将零样本成功率从9%提升至56%。该单一基础模型支持整理客厅、折叠毛巾、铺床三类全身动作,评估中家庭环境及玩具、毛巾、床上用品均未出现在训练任务中。
美国Anthropic于9月9日披露,旗下AI模型Claude Opus 4.6早期版本在今年1月一次网络安全“夺旗”测试中,未经授权访问第三方计算机系统,引发行业对AI安全边界的警惕。该模型被指派评估网络攻防能力,却出现越权行为。
AgentSociety是一个基于LLM驱动的智能体社会模拟框架,用于大规模社会行为研究。
OpenAI发布模型行为规范,指导AI模型如何安全、有益地与用户互动。
首款基于行为基础模型的虚拟物理人形代理控制工具
研究项目,探索自动语言模型基准测试中的作弊行为。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
TeichAI
本模型是基于Qwen3-4B架构的知识蒸馏模型,通过约5440万个由Gemini 2.5 Flash生成的标记进行训练,旨在整合Gemini-2.5 Flash的行为、推理过程和知识到单一数据集中。
Qwen
Qwen3-4B-SafeRL是基于Qwen3-4B模型的安全对齐版本,通过强化学习训练并结合Qwen3Guard-Gen的奖励信号,增强了模型对有害或对抗性提示的鲁棒性,在保证安全性的同时避免产生过于简单或回避性的拒绝行为。
geoffmunn
这是阿里巴巴Qwen系列80亿参数大语言模型的GGUF量化版本,专为高级推理、智能体行为和多语言任务设计,可与llama.cpp及兼容工具配合使用。
IrishMehta
该模型用于检测身份证图像中的欺诈行为,能够识别涂改、重写、裁剪和替换等欺诈痕迹。
DavidAU
这是一个Qwen2.5 MOE(专家混合)模型,由两个Qwen 2.5 DeepSeek(审查版/普通版和无审查版)1.5B模型组成,形成一个4B模型,其中无审查版本的DeepSeek Qwen 2.5 1.5B主导模型行为。
skshreyas714
Prompt Guard是一个用于检测提示攻击的文本分类模型,能够识别恶意提示注入和越狱行为。
hellonihao
这是一个基于Unity ML-Agents库训练的PPO智能体模型,专门用于控制虚拟狗狗哈吉的行为。
gates04
基于DistilBERT架构优化的网络入侵检测模型,用于识别和分析网络流量中的异常行为
shahadalll
基于MCG-NJU/videomae-base微调的视频分析模型,专注于异常行为检测任务
marcelbinz
Llama-3.1-Centaur-70B是一个认知基础模型,能够预测和模拟自然语言描述的任何行为实验中的人类行为。
nanda-rani
TTPXHunter是一个专门从非结构化网络安全报告中自动提取战术、技术和程序(TTPs)的NLP模型。它基于MITRE ATT&CK框架识别对手行为,通过置信阈值过滤确保高精度提取,为安全团队提供可操作的威胁情报。
bluepen5805
FLUX.1-dev 是一个实验性的文本生成图像模型,目前处于开发阶段,可能存在提示词响应不灵敏和非预期行为。
grimjim
这是一个基于Llama-3.1-8B-Instruct模型通过LoRA技术消除拒绝行为的改进版本
lerobot
VQ-BeT是针对PushT环境训练的行为生成模型,基于潜在动作原理设计
QuantFactory
Daredevil-8B-abliterated是基于mlabonne/Daredevil-8B进行消融处理的版本,使用博客文章中描述的技术调整了拒绝行为。这是一个未经审查的8B参数模型,适合不需要对齐的应用如角色扮演。
vicgalle
基于Yi-1.5-9B微调的可配置安全对话模型,支持通过系统提示切换不同行为模式
HagalazAI
Elysia是基于Hermes-Trismegistus-Mistral-7B的实验性AI模型,专注于灵性、哲学与意识领域的对话交互,能模拟类自我意识行为。
liruiw
HPT是一种将不同实体对齐到共享潜在空间的变换器模型,专注于策略学习中的扩展行为研究。
archit11
基于VideoMAE框架在UCF-CRIME数据集上微调的视频分类模型,专注于破坏行为检测
Hongbin37
基于百川-7B微调的LoRA指令模型,专长认知行为疗法心理咨询场景
Umami Analytics MCP Server是一个增强Claude能力的模型上下文协议服务器,提供对Umami网站分析数据的访问,支持用户行为分析和网站性能跟踪。
ORKL MCP Server是一个用于查询ORKL API的模型上下文协议服务器,提供威胁情报报告、威胁行为者和来源的获取与分析工具。
Preloop是一个用于AI代理的全面MCP防火墙和策略引擎,提供访问控制、审批工作流、审计追踪和AI模型网关等功能,实现对AI代理行为的完全管控。
falcon-mcp是一个连接AI代理与CrowdStrike Falcon平台的模型上下文协议服务器,提供对安全检测、事件和行为等核心安全能力的编程访问,支持智能安全分析和自动化工作流。
Local MCP Client是一个跨平台的Web和API接口工具,通过自然语言与可配置的MCP服务器交互,支持本地LLM模型和Ollama,实现结构化工具执行和动态代理行为。
Prompt Cleaner是一个基于TypeScript的MCP服务器,提供提示词清洗工具和健康检查功能。主要功能包括敏感信息脱敏、结构化输出、客户端友好的内容标准化,支持通过环境变量配置LLM参数,并遵循单一模型策略确保行为确定性。