DeepSeek于8月13日发布首款Agent产品Harness v0.1开发者预览版,以MIT协议开源。其定位为模型之外的基础设施,公式“模型+Harness=Agent”:模型负责思考推理,Harness负责实际执行,旨在让AI真正落地执行任务。
通义千问大模型升级,新增“思考研究”“定时任务”“办公助理”三大能力,全面支持旗舰模型Qwen3.8-MAX。此次升级推动大模型从辅助对话向自主执行转型,聚焦复杂决策与重复性工作痛点。其中“思考研究”模式经深度优化,助力职场效率提升。
OpenAI宣布ChatGPT全面更新,免费和Go用户默认模型升级为GPT-5.6 Luna。下周起免费用户将获无限次文本聊天权限,新增“思考”按钮可随时调用高阶推理功能,并设有防滥用安全机制,但文件上传、图像生成等工具具体情况未详述。
OpenAI取消ChatGPT全部文本限制,周活用户超10亿。升级至GPT-5.6系列,免费版默认模型为GPT-5.6Luna,取代GPT-5.5,并新增“思考”按钮,供用户主动开启高推理模式处理复杂问题。
YeeroAI对话沉淀知识,分支思考,多模型对比,智能记忆
Qwen3是Qwen系列大型语言模型的最新成员,支持多种思考模式和多语言。
Gemini 2.0 Flash Thinking Experimental 是一款增强推理模型,能够展示其思考过程以提升性能和可解释性。
展示小型语言模型通过自我演化深度思考掌握数学推理能力的研究成果。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
allenai
Olmo 3是由Allen Institute for AI开发的新一代语言模型系列,包含7B和32B两种规模,有指令和思考两种变体。该模型基于Dolma 3数据集进行预训练,在Dolci数据集上进行后训练,具备长链式思维能力,在数学和编码等推理任务上表现优异。
Olmo 3是由Allen Institute for AI开发的一系列语言模型,包含7B和32B两种规模,具有指令式和思考式两种变体。该模型在长链式思维方面表现出色,能有效提升数学和编码等推理任务的性能。采用多阶段训练方式,包括有监督微调、直接偏好优化和可验证奖励的强化学习。
Olmo-3-7B-Think-DPO是Allen Institute for AI开发的7B参数语言模型,具有长链式思考能力,在数学和编码等推理任务中表现出色。该模型经过监督微调、直接偏好优化和基于可验证奖励的强化学习等多阶段训练,专为研究和教育用途设计。
Olmo 3是由Allen Institute for AI开发的开源语言模型系列,包含7B和32B两种规格,分为指令(Instruct)和思考(Think)两种变体。该模型具有出色的长链思维能力,能够显著提升数学和编码等推理任务的表现。
ojus1
Qwen2.5是阿里巴巴推出的新一代大语言模型,在聊天模板方面进行了重要优化,永久禁用了思考状态,解决了多轮聊天模板相关问题,为实验和研究提供了更便捷的体验。
unsloth
Qwen3-VL是Qwen系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、强大的空间和视频动态理解能力,以及出色的智能体交互能力。该版本为2B参数的思考增强版,专门优化了推理能力。
Qwen3-VL-2B-Thinking是Qwen系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、增强的空间和视频动态理解能力,以及更强的智能体交互能力。该模型采用2B参数规模,支持指令版和增强推理的思考版。
nightmedia
Qwen3-Next-80B-A3B-Thinking-1M-qx86n-hi-mlx是基于Qwen3-Next-80B-A3B-Thinking模型转换的MLX格式版本,专门擅长长链推理和逐步思考,在推理任务中表现出色。
jackcloudman
Qwen3-Next-80B-A3B-Thinking 是通义千问团队推出的新一代思考型大语言模型,采用创新的混合注意力机制和高稀疏MoE架构,在保持高效推理的同时具备强大的复杂推理能力,原生支持262K上下文长度。
Qwen
Qwen3-VL是通义系列最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、增强的空间和视频理解能力,以及强大的智能体交互能力。该模型为2B参数的思考版,专门增强推理能力。
Olmo-3-7B-Think-SFT是Allen Institute for AI开发的7B参数语言模型,具有长链式思考能力,在数学和编码等推理任务中表现优异。该模型基于Dolma 3数据集预训练,并在Dolci数据集上进行了后续训练。
D1rtyB1rd
Looking_Glass-llama是一个用于测试的中间模型,基于llama 3架构,专门训练用于思考任务。该模型计划进行合并和持续训练,目前存在一定的重复性问题,建议使用较高的温度值和重复惩罚系数。
Mungert
Apriel-1.5-15b-Thinker 是一款由 ServiceNow SLAM 实验室开发的多模态推理模型,参数规模为150亿。它具备强大的文本和图像理解与推理能力,采用‘思考-回答’的链式推理模式,旨在以较小的模型规模实现与大型模型相媲美的性能。
DavidAU
这是一个基于Qwen3-Coder-30B-A3B-Instruct的混合专家模型,拥有540亿参数和100万上下文长度。模型通过三步合并和Brainstorm 40X优化,具备强大的编程能力和通用场景处理能力,特别集成了思考模块,能够在回答前进行深度推理。
Qwen3-VL是通义系列最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、强大的空间和视频理解能力,以及出色的智能体交互能力。此版本为235B参数的思考增强版,支持更复杂的推理任务。
prithivMLmods
palmyra-mini系列模型在复杂推理和数学问题解决领域展现出卓越能力,尤其在需要深入理解和多步骤思考的基准测试中表现出色。该模型擅长解决小学水平的数学问题,在gsm8k基准测试中取得0.818的高分,在MATH500基准测试中同样获得0.818分数,在AMC23基准测试中获得0.6的稳健分数。
NVIDIA Nemotron Nano 9B v2 是 NVIDIA 开发的一款高性能大语言模型,采用 Mamba2-Transformer 混合架构,支持多语言推理和聊天任务,在多个基准测试中表现优异,特别支持运行时'思考'预算控制功能。
DeepSeek-V3.1是DeepSeek-AI开发的大语言模型,是DeepSeek-V3的升级版本。该模型支持混合思考模式和非思考模式,在工具调用、代码生成、数学推理等方面表现出色,支持128K上下文长度。
QuantTrio
Seed-OSS-36B-Instruct-AWQ 是字节跳动 Seed 团队开发的 36B 参数大语言模型的量化版本,具备强大的长上下文处理能力、推理能力和智能体功能,支持高达 512K 的上下文长度和灵活的思考预算控制。
deepseek-ai
DeepSeek-V3.1是DeepSeek团队开发的大规模语言模型,支持思考模式和非思考模式,在多个基准测试中表现出色,具备强大的文本理解、生成和推理能力。
一个利用Groq API调用Qwen模型的链式思考MCP服务器,通过外部思考工具提升AI处理复杂任务的能力。
MCP Think是一个实现'think'工具的MCP服务器,旨在通过提供结构化思考空间来增强Claude等大型语言模型在复杂任务中的推理能力。
MAXential Thinking MCP 是一个为AI模型提供结构化推理工具的服务,支持思维链的分支、修订、合并和导航,实现透明、可追溯的思考过程。