7月27日,美团上线全场景AI Agent平台CatPaw,搭载刚开源的万亿参数大模型LongCat2.0。该模型总参数1.6T,原生支持1M超长上下文,首次在五万张国产算力卡上完成全流程训练与推理。CatPaw将这一底层能力转化为开箱即用的企业级智能工作台与Agent开发托管平台,标志着美团大模型从技术开源全面迈向产业落地。
Poolside发布完全开源的Laguna S2.1大模型,118B总参数的MoE架构,每token激活8B,支持高达1M tokens上下文,适配长周期软件工程。在OpenCode平台免费开放,并引入thinking与no-thinking推理模式,引起开发者热议。
大模型服务主战场正转向检索增强问答、多文档摘要和长程Agent。请求prompt由几十到上百个语义独立的片段(检索文档、技能说明、记忆、历史轮次)拼接,形成数万至数十万token的超长上下文,预填充阶段占据主导算力开销,成为服务商最突出的成本来源,且引发更棘手的难题。
谷歌计划7月17日发布高端模型Gemini3.5 Pro,定位复杂推理与智能体工作流,核心亮点是支持200万Tokens超长上下文窗口,远超轻量版Flash。
超长上下文模型,革新软件开发
70亿参数的超长上下文对话模型
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
Alibaba
$4
$16
$2
$20
-
$6
$24
256
Bytedance
$0.8
$0.15
$1.5
Baidu
32
$10.5
Tencent
$1
$8
$0.75
$0.35
400
DavidAU
Qwen3-4B-Hivemind-Instruct-NEO-MAX-Imatrix-GGUF 是一款基于 Qwen3 架构的 4B 参数指令微调大语言模型,采用 NEO Imatrix 与 MAX 量化技术,具备 256k 的超长上下文处理能力。该模型在多个基准测试中表现出色,是一款性能强劲的通用型模型。
基于Qwen 3微调的12B参数大语言模型,具备256k超长上下文处理能力,专门针对长文本生成任务进行优化。该模型结合了VLTO 8B模型基础、Brainstorm 20x调优和NEO Imatrix数据集量化技术,能够生成高质量的长文本内容。
cturan
Qwen3-Next-80B-A3B-Instruct是Qwen3-Next系列的前沿大语言模型,通过创新架构提升了参数效率和推理速度,在多领域展现出卓越性能,原生支持超长上下文处理。
nightmedia
这是一个基于Qwen3-Next-80B模型转换的MLX格式大语言模型,具有100万标记的超长上下文处理能力。该模型采用独特的qx65量化公式,注重情感共鸣而非单纯的技术优化,能够感知问题背后的情感并生成更具人性化的回复。
tencent
混元是腾讯开源的高效大语言模型系列,专为在各种计算环境中进行多用途部署而设计。从边缘设备到高并发生产系统,这些模型借助先进的量化支持和超长上下文能力,都能实现最佳性能。
kakaocorp
Kanana 1.5是Kakao开发的双语大语言模型,在编程、数学和函数调用能力方面有显著提升,支持32K tokens上下文长度,通过YaRN扩展技术可处理128K tokens超长文本。
lmstudio-community
Kevin 32B是由Cognition AI开发的大语言模型,支持超长上下文(40960 tokens),专注于CUDA内核生成和强化学习任务。
基于Qwen3-32B优化的恐怖主题文本生成模型,采用Imatrix量化技术增强推理能力,支持128k超长上下文
Qwen3-1.7B是由Qwen开发的1.7B参数规模的大语言模型,支持32k tokens超长上下文,擅长创意写作、角色扮演和多轮对话。
Qwen团队推出的8B参数规模大语言模型,支持超长上下文和多种语言处理
Qwen
通义千问系列最新一代大语言模型,提供148亿参数的预训练基础模型,支持32k超长上下文理解
基于多个高质量8B模型合并优化的Llama-3.1架构大语言模型,支持超长上下文处理
NeuraLakeAi
神经湖iSA-03迷你3B是由神经湖科技研发的先进AI模型,融合了传统大语言模型的直接响应能力与自动多步推理功能,支持256K token的超长上下文处理。
google
Gemma 3是Google推出的轻量级开源多模态模型,支持文本与图像输入并生成文本输出,具有128K超长上下文窗口和140+语言支持。
nvidia
Nemotron-UltraLong-8B是专为处理超长文本序列设计的语言模型,支持最高400万标记的上下文窗口,同时在标准基准测试中保持卓越性能。
Nemotron-UltraLong-8B系列超长上下文语言模型,支持200万token上下文窗口,基于Llama-3.1架构优化
Nemotron-UltraLong-8B系列是专为处理超长文本序列设计的语言模型,支持最高200万标记的上下文窗口,同时保持卓越性能。
Nemotron-UltraLong-8B系列是专为处理超长文本序列设计的语言模型,支持最高400万token的上下文窗口,同时保持卓越性能。
ai-sage
GigaChat-20B-A3B-instruct bf16是俄罗斯GigaChat系列大语言模型,基于Mixture of Experts架构构建,支持长达131,000个标记的超长上下文处理能力,专门针对俄语和英语进行优化。
tensorblock
这是基于Meta Llama-3-70B-Instruct模型的GGUF量化版本,由GradientAI开发,支持1048k的超长上下文长度。该模型经过指令微调优化,适用于各种自然语言处理任务,并提供多种量化级别以满足不同硬件需求。