DeepSeek于2月11日灰度更新网页端和APP端,14日正式官宣为新长文本模型结构测试。此次更新支持最高100万token超长上下文,知识库更新至2025年5月。但API服务仍为V3.2版本,仅支持128K上下文。业内视此次更新为下一代V4模型发布前的技术预热和压力测试,引发对V4的广泛期待。更新后,DeepSeek的交互风格也发生明显变化。
国产AI公司DeepSeek在GitHub代码库中更新FlashMLA代码,被发现大量指向未知模型“MODEL1”的标识符。该标识符与现有V3.2版本并列提及,暗示这可能是一个全新的模型序列,而非简单迭代。
腾讯自研大模型混元2.0(Tencent HY2.0)正式发布,与此同时,DeepSeek V3.2也逐步接入腾讯生态。目前,这两大模型已在元宝、ima等腾讯AI原生应用中率先上线,腾讯云也同步开放了相关模型的API及平台服务。 全新发布的Tencent HY2.0采用混合专家(MoE)架构,总参数量高达4
DeepSeek-V3.2正式版与极致推理版同步发布,支持网页端、App、API一键切换,性能再证“开源最强”。最大亮点是首次实现“思考过程”与“工具调用”深度融合,支持两种模式并行:思考模式可进行长链条推理,工具调用模式则能高效执行任务。
Fentible
Cthulhu是一个基于Mistral Small v3.2和v3.1的大型模型融合项目,通过融合多个尖端微调模型创建的超强24B参数语言模型。它具有章鱼般的多面性特征,提供无审查的创造性文本生成能力,擅长散文创作、指令遵循和深奥知识表达。
DavidAU
基于Stheno v3.2模型的NEO CLASS量化版本,采用先进的量化技术提升模型性能,在保持高质量输出的同时显著降低计算资源需求。