月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。
DeepSeek迴應“深度思考模式偷偷取外號”稱,該現象實爲推理時生成的臨時標籤,用於輔助理解上下文與優化回答,並非私下記錄用戶信息。事件源於網友發現並曬圖,引發熱議登上熱搜。
深度求索科技發佈DeepSeek-V3.1 AI模型,引入混合推理架構,支持思考與非思考模式,提升靈活性與效率,推動AI向Agent時代邁進。
小米開源全新多模態大模型Xiaomi MiMo-VL-7B-2508,包含SFT和RL兩個版本。新版本優化了輸出模式,提升RL訓練穩定性,在MMMU、ChartQA等多項評測中取得突破性進步。模型創新性地支持"思考模式"和"非思考模式"切換,前者展示完整推理過程,後者響應更快。在小米內部VLM Arena評分達1131.2分,全面超越前代版本,在同類開源模型中保持領先優勢。
Alibaba
$1
輸入tokens/百萬
$10
輸出tokens/百萬
256
上下文長度
$2
$20
-
Moonshot
$4
$16
Bytedance
$0.8
$0.15
$1.5
$8
Deepseek
$12
128
Tencent
32
Openai
$0.4
$0.75
Chatglm
$3.5
$0.3
unsloth
DeepSeek-V3.1是DeepSeek-AI開發的大語言模型,是DeepSeek-V3的升級版本。該模型支持混合思考模式和非思考模式,在工具調用、代碼生成、數學推理等方面表現出色,支持128K上下文長度。
deepseek-ai
DeepSeek-V3.1是DeepSeek團隊開發的大規模語言模型,支持思考模式和非思考模式,在多個基準測試中表現出色,具備強大的文本理解、生成和推理能力。
Qwen3-4B-Instruct-2507是Qwen3-4B非思考模式的更新版本,在通用能力、長尾知識覆蓋、用戶偏好對齊和長上下文理解等方面有顯著提升。採用Unsloth Dynamic 2.0量化技術,在準確性上表現卓越。
cpatonn
Qwen3-4B-Instruct-2507-AWQ是Qwen3-4B非思考模式的更新版本,在通用能力、長尾知識覆蓋、用戶偏好對齊和長上下文理解等方面有顯著提升。它可用於文本生成等多種場景,為用戶提供高質量的語言交互體驗。
Qwen3-30B-A3B-Instruct-2507是阿里雲推出的305億參數混合專家模型,採用非思考模式,在指令遵循、邏輯推理、文本理解、數學科學、編碼和工具使用等方面表現優異,支持262K長上下文和多語言處理。
Qwen
Qwen3-30B-A3B-Instruct-2507-FP8是Qwen3-30B-A3B-FP8非思考模式的更新版本,在通用能力、長尾知識覆蓋、用戶偏好對齊和長上下文理解等方面有顯著提升,支持262,144的原生上下文長度。
Qwen3-30B-A3B-Instruct-2507是Qwen3-30B-A3B非思考模式的更新版本,在通用能力、長尾知識覆蓋、用戶偏好對齊和長上下文理解等方面均有顯著提升。這是一個305億參數的大型語言模型,採用MoE架構,激活參數為33億。
NVFP4
Qwen3-32B是Qwen系列的最新大語言模型,具有328億參數,在推理、指令遵循、智能體能力和多語言支持等方面取得了突破性進展,支持思考模式和非思考模式的無縫切換。
QuixiAI
Qwen3-30B-A3B-AWQ是基於Qwen3-30B-A3B模型的AWQ量化版本,是通義系列最新一代大語言模型。該模型採用專家混合(MoE)架構,支持思考模式和非思考模式的雙模式切換,在推理、指令遵循、智能體能力和多語言支持方面表現優異。
Mungert
Qwen3-0.6B是通義千問系列的最新一代小型大語言模型,具有0.6B參數,支持思考和非思考兩種模式切換,適用於文本生成、推理和智能體任務。
Qwen3-1.7B是Qwen系列最新一代1.7B參數規模的大語言模型,支持在思考與非思考模式間切換,具備增強的推理能力和多語言支持。
Qwen3是阿里雲開發的最新大語言模型,具有強大的推理、指令遵循和多語言支持能力,支持思考與非思考模式切換。
Qwen3是阿里雲開發的大規模語言模型系列的最新版本,具有卓越的推理、指令跟隨和多語言支持能力。32B版本是其密集模型之一,支持在思考與非思考模式間切換。