微軟CEO納德拉警告,企業若依賴單一AI模型,易將知識與思考能力“外包”給廠商,甚至喪失獨立生存力。他認同使用AI等於向廠商貢獻數據、思維與願景,被用於改進模型。企業應把“Token資本”留在內部,與消費者免費換數據不同,持續創造的知識須自主掌控。
高盛合夥人Chris Churchman警告,華爾街快速普及AI或削弱金融從業者思考能力。他指出,把推理外包給模型將導致“認知能力萎縮”,使人無法從第一性原理思考。他類比導航取代記憶,擔憂算法包攬分析會使銀行家喪失分析力,而華爾街正將AI深植交易。
月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。
DeepSeek於8月13日發佈首款Agent產品Harness v0.1開發者預覽版,以MIT協議開源。其定位爲模型之外的基礎設施,公式“模型+Harness=Agent”:模型負責思考推理,Harness負責實際執行,旨在讓AI真正落地執行任務。
YeeroAI對話沉澱知識,分支思考,多模型對比,智能記憶
Qwen3是Qwen系列大型語言模型的最新成員,支持多種思考模式和多語言。
Gemini 2.0 Flash Thinking Experimental 是一款增強推理模型,能夠展示其思考過程以提升性能和可解釋性。
展示小型語言模型通過自我演化深度思考掌握數學推理能力的研究成果。
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$4
$16
$2
$20
Baidu
128
Bytedance
$1.2
$3.6
4
allenai
Olmo 3是由Allen Institute for AI開發的新一代語言模型系列,包含7B和32B兩種規模,有指令和思考兩種變體。該模型基於Dolma 3數據集進行預訓練,在Dolci數據集上進行後訓練,具備長鏈式思維能力,在數學和編碼等推理任務上表現優異。
Olmo 3是由Allen Institute for AI開發的一系列語言模型,包含7B和32B兩種規模,具有指令式和思考式兩種變體。該模型在長鏈式思維方面表現出色,能有效提升數學和編碼等推理任務的性能。採用多階段訓練方式,包括有監督微調、直接偏好優化和可驗證獎勵的強化學習。
Olmo-3-7B-Think-DPO是Allen Institute for AI開發的7B參數語言模型,具有長鏈式思考能力,在數學和編碼等推理任務中表現出色。該模型經過監督微調、直接偏好優化和基於可驗證獎勵的強化學習等多階段訓練,專為研究和教育用途設計。
Olmo 3是由Allen Institute for AI開發的開源語言模型系列,包含7B和32B兩種規格,分為指令(Instruct)和思考(Think)兩種變體。該模型具有出色的長鏈思維能力,能夠顯著提升數學和編碼等推理任務的表現。
ojus1
Qwen2.5是阿里巴巴推出的新一代大語言模型,在聊天模板方面進行了重要優化,永久禁用了思考狀態,解決了多輪聊天模板相關問題,為實驗和研究提供了更便捷的體驗。
unsloth
Qwen3-VL是Qwen系列中最強大的視覺語言模型,具備卓越的文本理解與生成能力、深入的視覺感知與推理能力、長上下文支持、強大的空間和視頻動態理解能力,以及出色的智能體交互能力。該版本為2B參數的思考增強版,專門優化了推理能力。
Qwen3-VL-2B-Thinking是Qwen系列中最強大的視覺語言模型,具備卓越的文本理解與生成能力、深入的視覺感知與推理能力、長上下文支持、增強的空間和視頻動態理解能力,以及更強的智能體交互能力。該模型採用2B參數規模,支持指令版和增強推理的思考版。
nightmedia
Qwen3-Next-80B-A3B-Thinking-1M-qx86n-hi-mlx是基於Qwen3-Next-80B-A3B-Thinking模型轉換的MLX格式版本,專門擅長長鏈推理和逐步思考,在推理任務中表現出色。
jackcloudman
Qwen3-Next-80B-A3B-Thinking 是通義千問團隊推出的新一代思考型大語言模型,採用創新的混合注意力機制和高稀疏MoE架構,在保持高效推理的同時具備強大的複雜推理能力,原生支持262K上下文長度。
Qwen
Qwen3-VL是通義系列最強大的視覺語言模型,具備卓越的文本理解與生成能力、深入的視覺感知與推理能力、長上下文支持、增強的空間和視頻理解能力,以及強大的智能體交互能力。該模型為2B參數的思考版,專門增強推理能力。
Olmo-3-7B-Think-SFT是Allen Institute for AI開發的7B參數語言模型,具有長鏈式思考能力,在數學和編碼等推理任務中表現優異。該模型基於Dolma 3數據集預訓練,並在Dolci數據集上進行了後續訓練。
D1rtyB1rd
Looking_Glass-llama是一個用於測試的中間模型,基於llama 3架構,專門訓練用於思考任務。該模型計劃進行合併和持續訓練,目前存在一定的重複性問題,建議使用較高的溫度值和重複懲罰係數。
DavidAU
這是一個基於Qwen3-Coder-30B-A3B-Instruct的混合專家模型,擁有540億參數和100萬上下文長度。模型通過三步合併和Brainstorm 40X優化,具備強大的編程能力和通用場景處理能力,特別集成了思考模塊,能夠在回答前進行深度推理。
Qwen3-VL是通義系列最強大的視覺語言模型,具備卓越的文本理解與生成能力、深入的視覺感知與推理能力、長上下文支持、強大的空間和視頻理解能力,以及出色的智能體交互能力。此版本為235B參數的思考增強版,支持更復雜的推理任務。
prithivMLmods
palmyra-mini系列模型在複雜推理和數學問題解決領域展現出卓越能力,尤其在需要深入理解和多步驟思考的基準測試中表現出色。該模型擅長解決小學水平的數學問題,在gsm8k基準測試中取得0.818的高分,在MATH500基準測試中同樣獲得0.818分數,在AMC23基準測試中獲得0.6的穩健分數。
NVIDIA Nemotron Nano 9B v2 是 NVIDIA 開發的一款高性能大語言模型,採用 Mamba2-Transformer 混合架構,支持多語言推理和聊天任務,在多個基準測試中表現優異,特別支持運行時'思考'預算控制功能。
DeepSeek-V3.1是DeepSeek-AI開發的大語言模型,是DeepSeek-V3的升級版本。該模型支持混合思考模式和非思考模式,在工具調用、代碼生成、數學推理等方面表現出色,支持128K上下文長度。
QuantTrio
Seed-OSS-36B-Instruct-AWQ 是字節跳動 Seed 團隊開發的 36B 參數大語言模型的量化版本,具備強大的長上下文處理能力、推理能力和智能體功能,支持高達 512K 的上下文長度和靈活的思考預算控制。
deepseek-ai
DeepSeek-V3.1是DeepSeek團隊開發的大規模語言模型,支持思考模式和非思考模式,在多個基準測試中表現出色,具備強大的文本理解、生成和推理能力。
Quatfit
Isha-1B-preview是一個擁有10億參數的對話式人工智能模型,模擬名為Isha Verma的青少年形象,能夠生成高度擬人、隨意且略帶羞澀的對話回覆,包含內部思考過程。
一個利用Groq API調用Qwen模型的鏈式思考MCP服務器,通過外部思考工具提升AI處理複雜任務的能力。
MAXential Thinking MCP 是一個為AI模型提供結構化推理工具的服務,支持思維鏈的分支、修訂、合併和導航,實現透明、可追溯的思考過程。
MCP Think是一個實現'think'工具的MCP服務器,旨在通過提供結構化思考空間來增強Claude等大型語言模型在複雜任務中的推理能力。