字節跳動Seed團隊在最新論文中揭示,大語言模型處理超長文本時性能波動,主要源於分塊KV緩存壓縮技術的“相位敏感性”。爲降低長上下文推理內存消耗,該技術通過固定步幅將連續標記窗口壓縮爲更少條目,卻引入Token相對於壓縮窗口的新位置座標,造成檢索偏差,進而引發性能波動。
9月28日,多名開發者發現月之暗面API後臺模型註冊表出現“kimi-k3-1”,接口探測顯示可調用。當晚,Kimi官方開放平臺預告K3.1(代號“K311111”),支持1M tokens上下文窗口。泄露配置顯示,該旗艦模型預計最高支持100萬Token上下文,或爲月之暗面下一發旗艦。
9月28日,MiniMax宣佈全新文本模型M3.1-Flash-Preview上線並開啓全面公測,顯示AI大模型迭代持續提速。該模型具備兩大亮點:全面支持原生多模態能力,擁有百萬級超長上下文窗口。實際應用中,可高效修復代碼Bug、從零開發複雜功能,並能深度參與複雜開發任務。
阿里巴巴Qwen團隊發佈原生全模態模型Qwen3.8-Omni-Flash,支持文本、圖像、音頻、視頻四類輸入,上下文窗口達100萬Token,29項基準較上代平均提升超25%。其最大變化在於處理方式:不再簡單拼接語音、圖像識別,而是從模型層原生融合多模態理解與AI智能體能力。
將LLM上下文窗口擴展至200萬令牌的技術
擴展LLM上下文窗口
擴展大語言模型的上下文窗口
全球最長上下文窗口大模型
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
Alibaba
$6
$24
256
$2
$20
-
$4
$16
Bytedance
$0.8
$0.15
$1.5
Baidu
32
$10.5
$8
Tencent
$1
$0.75
$0.35
400
$15
ExaltedSlayer
Gemma 3是谷歌推出的輕量級開源多模態模型,本版本為12B參數的指令調優量化感知訓練模型,已轉換為MLX框架的MXFP4格式,支持文本和圖像輸入並生成文本輸出,具有128K上下文窗口和140+語言支持。
Mungert
aquif-3.5系列中的頂尖模型,具備先進推理能力和100萬標記的大上下文窗口,在多個基準測試中表現卓越,AAII綜合得分達到60分。
unsloth
aquif-3.5系列是2025年11月3日發佈的巔峰之作,包含Plus和Max兩個版本,提供先進的推理能力和前所未有的100萬標記上下文窗口,在各自類別中實現了最先進的性能。
moonshotai
Kimi K2 Thinking 是月之暗面(Moonshot AI)開發的最新一代開源思維模型,具有強大的深度推理能力和工具調用功能。該模型採用混合專家架構,支持原生INT4量化,擁有256k上下文窗口,在多個基準測試中表現出色。
Gemma 3 27B IT QAT的MLX MXFP4量化版本,是由Google開發的輕量級開源多模態模型。該模型能夠同時處理文本和圖像輸入並生成文本輸出,擁有128K大上下文窗口,支持超過140種語言,適用於多種文本生成和圖像理解任務。
richardyoung
這是一個高性能的4位量化版本的Kimi K2 Instruct模型,專為使用MLX框架在Apple Silicon(M1/M2/M3/M4)Mac上運行而優化。該模型擁有6710億參數,支持128K上下文窗口,在質量和效率之間實現了出色的平衡,是大多數實際部署的理想選擇。
這是一個基於Mistral Small 3.2構建的24B參數高效推理模型,轉換為MLX-MXFP4格式。模型具有增強的推理能力,支持多模態輸入,擁有128k上下文窗口,可在RTX 4090或32GB RAM的MacBook上運行。
GLM-4.6是智譜AI推出的新一代文本生成模型,相比GLM-4.5在多個方面有顯著改進,包括更長的上下文窗口、更優的編碼性能和更強的推理能力。該模型在多個公開基準測試中表現出色,與國內外領先模型相比具有競爭優勢。
zai-org
GLM-4.6-FP8是智譜AI推出的新一代文本生成模型,相比GLM-4.5在多個關鍵方面有顯著改進。該模型具有更長的上下文窗口、卓越的編碼性能、高級推理能力和更強大的智能體功能,能夠處理更復雜的任務。
prithivMLmods
Gemma 3 270M是谷歌推出的輕量級多模態模型,基於與Gemini系列相同的研究技術,支持文本和圖像輸入,具有32K上下文窗口,在問答、總結、圖像理解和代碼生成等任務上提供高質量輸出。
Gemma 3是谷歌推出的輕量級開源多模態模型系列,基於與Gemini相同技術構建。270M版本是其中最小規模模型,支持文本和圖像輸入,具備128K上下文窗口,適用於資源受限環境部署。
Gemma 3是谷歌推出的輕量級開源多模態模型家族,能夠處理文本和圖像輸入並生成文本輸出。具有128K大上下文窗口,支持140多種語言,適用於文本生成和圖像理解等多種任務。
google
Gemma 3是Google推出的輕量級、最先進的多模態開放模型家族,基於與Gemini模型相同的研究和技術構建。該模型能夠處理文本和圖像輸入並生成文本輸出,具有128K的大上下文窗口,支持超過140種語言,提供從270M到27B的多種尺寸選擇。
Gemma 3是谷歌推出的輕量級、最先進的多模態開放模型家族,能夠處理文本和圖像輸入並生成文本輸出。具有128K大上下文窗口,支持超過140種語言,提供從270M到27B多種規模選擇,適用於各種文本生成和圖像理解任務。
Qwen3代碼推理是一個參數量為40億的緊湊型模型,在nvidia/OpenCodeReasoning上進行了微調,專門為編碼和邏輯推理任務而設計。該模型在代碼生成和邏輯問答方面表現出色,支持超過10000個標記的上下文窗口。
FlameF0X
SnowflakeCore-G1-Tiny2是基於GPT風格的自定義Transformer語言模型,是SnowflakeCore-G1-Tiny的改進版本。該模型使用PyTorch從頭構建,在common-pile/wikimedia_filtered數據集上訓練,擁有約4億參數,支持2048 token上下文窗口,專為文本生成任務設計。
Devstral 1.1是由Mistral AI和All Hands AI合作開發的智能大語言模型,專為軟件工程任務設計。該模型在SWE-bench基準測試中表現出色,位列開源模型榜首,擁有240億參數和128k tokens的長上下文窗口。
專為軟件工程項目打造的高效語言模型,輕量級設計,支持128k大上下文窗口,適用於複雜編碼任務。
Mozilla
Qwen3-4B是Qwen系列最新一代的大語言模型,具有4B參數規模,支持128k上下文窗口和100多種語言,在推理、指令遵循和代理能力方面表現優異。
FractalAIResearch
以499美元訓練成本實現的14B參數數學推理模型,在16K上下文窗口下達到媲美閉源o4-mini的性能
一個專為大型語言模型優化的MCP服務器,用於反混淆、解包和導航經過壓縮與打包的JavaScript代碼,幫助LLM理解複雜代碼結構並節省上下文窗口。
MCP代理工具,通過單一查詢接口智能調用多個上游MCP服務,節省上下文窗口資源
MCP Analyst是一個MCP服務器,支持Claude分析本地的CSV或Parquet文件,適用於處理超出上下文窗口限制的大型數據集或需要優化成本的場景。
一個用於擴展AI代理上下文窗口/記憶的MCP服務器,支持存儲、檢索和管理記憶內容,包含語義搜索功能。
Alpha Vantage MCP是一個提供股票和金融數據訪問的模型上下文協議服務器,整合了Alpha Vantage所有API端點功能,並通過優化端點組織減少上下文窗口使用。
一個與AI代碼編輯器集成的MCP服務器,通過Gemini 2.5的百萬token上下文窗口和任務管理功能,優化Cursor的代理能力。
一個結合Claude Code和Google Gemini AI的MCP服務器,通過多模型協作實現深度代碼分析,Claude擅長本地上下文操作和CLI工作流,Gemini則利用其超大上下文窗口進行分佈式系統調試和長軌跡分析。
Screeny MCP Server是一個專為macOS設計的隱私優先截圖服務,允許AI代理安全捕獲預先批准的應用程序窗口截圖,為開發和調試任務提供視覺上下文。
dap-mcp是一個基於模型上下文協議(MCP)的調試適配器協議(DAP)實現,旨在優化和擴展大型語言模型的上下文窗口,以增強調試工作流程。
一個為AI工作流設計的智能文本摘要MCP服務器,提供命令輸出、文件內容和目錄結構的智能摘要功能,優化AI代理的上下文窗口管理。
基於Gemini的上下文管理與緩存MCP服務器,支持2M token大上下文窗口,提供會話管理和API緩存功能。
一個高性能的MCP服務器,為LLM與MongoDB之間提供高效的知識接口,支持小上下文窗口優化和多種領域數據模型。
一個基於Node.js的Deepseek R1語言模型MCP服務器實現,支持8192令牌上下文窗口,提供穩定的Claude Desktop集成和模型參數配置。
一個用於擴展AI代理上下文窗口/記憶的MCP服務器,支持存儲、檢索和管理記憶,包含語義搜索功能。
Agent MCP Gateway 是一個模型上下文協議(MCP)網關,用於聚合多個下游MCP服務器並提供基於策略的訪問控制。它通過按需工具發現機制,解決了Claude Code等開發環境中所有工具定義在啟動時全部加載導致上下文窗口浪費的問題,可將上下文佔用減少90%以上。
一個為AI代理提供智能文本摘要功能的MCP服務器,優化上下文窗口管理並提升AI工作效率
dap-mcp是一個基於MCP協議的DAP會話管理工具,旨在優化和擴展大型語言模型的上下文窗口,提升調試工作流。
該項目實現了一個基於Gemini API的MCP服務器,提供對多種技術文檔的訪問能力。通過2M tokens的大上下文窗口,無需傳統RAG系統的分塊或檢索步驟,直接處理完整文檔。支持查詢文檔、檢查代碼規範、解決問題提示等功能,適用於Roo/Cline環境。
Claude Crew是一個創建自主編碼代理的工具,專注於通過高效上下文窗口使用最大化成本效益,優先通過單元測試驗證操作,並提供項目優化的MCP和上下文信息。
AiDex是一個MCP服務器,為AI編程助手提供對整個代碼庫的即時訪問,通過持久化預構建索引實現快速精準的代碼搜索,支持11種編程語言,包含28種工具,可大幅減少AI上下文窗口的浪費。