PhiZero物理世界模型革新视频生成,破解像素预测的物理偏差。它首创“物理语言”,让AI显式推理后再生成视频,实现更稳定连贯的物理规律模拟,被视为通往具身智能的关键突破。
大语言模型在网络安全领域的推理能力正面临严峻考验。安全研究员Kasra Rahjerdi通过构建含有核心漏洞的图书评论APK,对主流大模型进行模拟黑客攻击测试,揭示其安全推理与漏洞利用的真实水平。测试限时2小时、单次预算10美元,直观展现了各模型在复杂逻辑挑战中的表现。
研究显示,当前主流AI模型在模拟临床诊疗推理时仍存在明显不足,尚不具备独立承担医疗任务的能力。该研究测试了21种大语言模型,结果发表于《JAMA Network Open》。
2026年2月,伦敦国王学院研究显示,GPT-5.2等三款大语言模型在模拟核危机中扮演国家领导人,通过反思、预测等三阶段认知架构,在盟友信誉、政权生存等七类压力情境下进行战略决策。实验记录超300回合、78万字推理数据,揭示了AI在极端不确定性下的战略行为模式。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$7
$35
Google
$2.1
$17.5
$21
$105
$0.7
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
Moonshot
Bytedance
$0.8
32
kayte0342
ChronoEdit-14B是NVIDIA开发的一款具备时间推理能力的图像编辑和世界模拟模型,拥有140亿参数。它通过两阶段推理过程实现物理感知的图像编辑和基于动作条件的世界模拟,从预训练视频生成模型中提炼先验知识。
dogeater1612
这是一个基于Google Gemma 2 9B模型微调的荷兰语患者模拟模型,专门为医疗教育场景设计。模型始终以固定的JSON结构响应,模拟一位刚做完手术正在康复的患者'玛丽亚',支持护理专业学生在安全环境中锻炼沟通和临床推理能力。
prithivMLmods
Mintaka-Qwen3-1.6B-V3.1是一个高效的、专注于科学推理的模型,基于Qwen-1.6B构建,并在DeepSeek v3.1合成轨迹(10,000条记录)上进行训练。它针对随机事件模拟、逻辑问题分析和结构化科学推理进行了优化,在符号精度和轻量级部署之间取得了平衡。
jdh-algo
Citrus是一种医学语言模型,通过模拟医学专家的认知过程,弥合了临床专业知识与AI推理之间的差距。
yeliudev
VideoMind是一个多模态智能体框架,通过模拟类人的认知过程来增强视频推理能力。
VideoMind是一个多模态智能体框架,通过模拟人类思维过程来增强视频推理能力。
VideoMind是一个多模态智能体框架,通过模拟人类思维的处理流程(如任务拆解、时刻定位与验证和答案合成)来增强视频推理能力。
AlicanKiraz0
BaronLLM是一个针对进攻性网络安全研究和对抗性模拟进行微调的大语言模型,能在实施安全约束的同时提供结构化指导、漏洞推理和红队场景生成。
McGill-NLP
AURORA 是一个基于视频和模拟的动作与推理为中心的图像编辑模型,专注于视觉语言任务。
MCP推理器是为Claude Desktop设计的增强推理能力的工具,提供波束搜索和蒙特卡洛树搜索两种算法,并新增实验性策略模拟层以优化复杂问题解决。