無問芯穹與稀宇科技(MiniMax)簽署戰略合作,鋪設四方向:共優模型推理效能體系、共建大模型Token服務與AI基礎設施、聯合創新應用範式、共拓行業智能化場景。雙方優勢互補,無問芯穹長於算力調度與推理基礎設施,MiniMax手握自研大模型與海量應用流量,前者以底層算力支撐後者提升推理效率,打通從技術到落地的閉環。
OpenRouter最新數據顯示,全球AI大模型調用量前五名全由中國企業包攬。小米MiMo-V2.5以10.5萬億Token周調用量登頂,環比增長12%。DeepSeek兩款模型分列第二、第五,形成高低搭配優勢。這標誌着國產大模型在全球市場確立領先地位。
OpenAI於7月31日公佈GPT-5.6系列新定價,中端及輕量模型大幅降價,旗艦款不變。輕量級Luna模型成焦點,輸入與輸出費用同步削減80%,每百萬輸入Token降至0.2美元,輸出亦相應大幅調低,掀起AI價格戰新浪潮。
OpenAI 發佈 GPT-5.6 模型家族,包括旗艦 Sol、均衡 Terra 與高性價比 Luna。新一代通過底層技術棧深度優化,大幅提升每 token 智能效率,在降低 API 成本的同時增強性能。其中,旗艦 Sol 開啓最大推理能力後,在編碼智能體基準測試中表現超越競品。
MiniMax-Text-01是一個強大的語言模型,具有4560億總參數,能夠處理長達400萬token的上下文。
強大的語言模型,擁有4560億總參數,可處理長達400萬token的上下文。
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$4
$16
$2
$20
Baidu
128
Bytedance
$1.2
$3.6
4
inclusionAI
Ming-flash-omni 預覽版是基於 Ling-Flash-2.0 稀疏專家混合(MoE)架構構建的多模態大模型,總參數達100B,每個token僅激活6B參數。該模型在Ming-Omni基礎上進行了全面升級,在多模態理解和生成方面有顯著提升,特別是在語音識別、圖像生成和分割編輯方面表現突出。
Downtown-Case
GLM 4.6是一款專為128GB內存+單GPU配置優化的量化模型,採用IQ_K量化方式,相比主流llama.cpp在相同大小下提供更好的質量和性能。該模型需要配合ik_llama.cpp使用,在128GB雙通道DDR5內存、單CCD Ryzen 7000處理器+單張3090顯卡配置下,文本生成速度可達每秒約6.8個token。
cpatonn
Qwen3-Next-80B-A3B-Instruct-AWQ-4bit是基於Qwen3-Next-80B-A3B-Instruct模型進行4位AWQ量化的高效版本。該模型採用混合注意力機制和高稀疏專家混合架構,支持長達262K tokens的上下文長度,在保持高性能的同時大幅降低計算資源需求。
gabriellarson
Seed-OSS是由字節跳動Seed團隊開發的開源大語言模型系列,具備強大的長上下文處理、推理和智能體交互能力。僅使用12T token訓練,在多個公開基準測試中表現出色,支持高達512K的原生長上下文處理。
ByteDance-Seed
Seed-OSS是由字節跳動Seed團隊開發的開源大語言模型系列,具備強大的長上下文處理、推理、智能體交互能力和通用性能。該模型僅使用12T token訓練,在多個公開基準測試中表現出色。
NVFP4
Qwen3-30B-A3B-Thinking-2507是一款在推理能力和通用能力上有顯著提升的大型語言模型,增強了長上下文理解能力,適用於高度複雜的推理任務。該模型具有305億參數,其中激活33億參數,支持262,144 tokens的長上下文處理。
Qwen3-30B-A3B-Thinking-2507是經過量化處理的大語言模型,具有增強的推理能力、通用能力和長上下文理解能力。該模型採用混合專家架構,在邏輯推理、數學、科學、編碼等複雜任務上表現出色,支持262,144 tokens的長上下文處理。
nvidia
Llama-3.3-Nemotron-Super-49B-v1.5是基於Meta Llama-3.3-70B-Instruct的大語言模型,經過多階段後訓練增強了推理和非推理能力。支持128K token上下文長度,在準確性和效率之間取得了良好平衡,適用於推理、聊天和代理任務。
internlm
Intern-S1是目前最先進的開源多模態推理模型,結合了強大的通用任務處理能力和在廣泛科學任務中的卓越性能,可與領先的閉源商業模型相媲美。該模型在5T token數據集上進行持續預訓練,其中超過50%是專業科學數據,具備動態分詞器能夠原生理解分子式、蛋白質序列和地震信號。
unsloth
Devstral 1.1是由Mistral AI和All Hands AI合作開發的智能大語言模型,專為軟件工程任務設計。該模型在SWE-bench基準測試中表現出色,位列開源模型榜首,擁有240億參數和128k tokens的長上下文窗口。
Llama-3.3-Nemotron-Super-49B-v1 是一個大型語言模型,基於 Meta Llama-3.3-70B-Instruct 改進,增強了推理能力、人類聊天偏好以及任務執行能力,支持 128K tokens 的上下文長度。
kakaocorp
Kanana 1.5是Kakao開發的雙語大語言模型,在編程、數學和函數調用能力方面有顯著提升,支持32K tokens上下文長度,通過YaRN擴展技術可處理128K tokens超長文本。
lmstudio-community
由英偉達發佈的4B參數規模大語言模型,支持128k tokens上下文長度,專為推理、對話及RAG等任務優化
AM Thinking v1是由A-M團隊開發的基於Qwen 2.5-32B-Base的大語言模型,增強推理能力,支持132k tokens的上下文長度。
Mungert
OpenCodeReasoning-Nemotron-14B 是基於 Qwen2.5-14B-Instruct 進行後訓練的大型語言模型,專為代碼生成推理優化,支持32K tokens上下文長度。
OpenCodeReasoning-Nemotron-7B是基於Qwen2.5-7B-Instruct專門為代碼生成推理而訓練的大語言模型,支持32K token上下文長度,適用於商業和非商業用途。該模型在OpenCodeReasoning數據集上進行後續訓練,專注於編程問題的推理和代碼生成。
Skywork OR1 7B量化模型是基於Skywork-OR1-7B進行GGUF量化的文本生成模型,支持長達128k token的上下文推理,在數學和代碼推理方面表現出色,為文本生成任務提供了強大的能力。
INTELLECT 2是由PrimeIntellect推出的大語言模型,支持40960 tokens的上下文長度,採用QwQ架構和GRPO強化學習框架訓練。
Kevin 32B是由Cognition AI開發的大語言模型,支持超長上下文(40960 tokens),專注於CUDA內核生成和強化學習任務。
OpenCodeReasoning-Nemotron-32B-IOI 是一個基於 Qwen2.5-32B-Instruct 的大型語言模型,專門針對代碼生成任務進行了推理後訓練,支持 32K token 的上下文長度。
HiveChat是一個專為中小團隊設計的AI聊天應用,支持多種大模型服務商,提供分組管理、Token限額、第三方登錄等功能。
TokenScope是一個面向大型語言模型的令牌感知目錄探索工具,提供智能目錄結構分析、文件內容令牌感知提取、令牌使用統計和綜合報告生成功能。
RLM MCP服務器是一個基於遞歸語言模型模式的大規模上下文處理工具,允許Claude代碼通過外部變量處理超過1000萬token的文本,避免直接將海量內容輸入提示詞。它通過加載、分塊、子查詢和聚合的流程,支持自動分析和程序化執行,可連接Claude API或本地Ollama進行免費推理。