字节跳动Seed发布原生音视频全双工大模型SeedRealtime,采用统一架构融合音频、视频与文本,实现“边看边听边说”的实时交互,推进全模态自然交互。同时,国产大模型如DeepSeek等集中迭代升级,市场分析认为国产算力逻辑持续加强。
商汤科技面向社区开源轻量统一多模态模型SenseNova U1.5-Lite-Preview。该模型基于U1系统性迭代,在单一架构中融合视觉理解、推理、生成与编辑四大能力,仅以8B-MoE参数即支持4K分辨率、更真实质感与复杂视觉控制。商汤称U1验证了统一架构可行性,U1.5则实现了轻量高性能的突破。
谷歌CEO皮查伊在2026年Q2财报会上透露,下一代模型Gemini 4已投入训练,资源投入巨大,预计今年11至12月发布。公司坦承在编程与智能体领域落后,希望借此追平前沿。此前Gemini 3.5 Pro延期,已引发外界对其模型迭代节奏的疑问。
Alphabet在2026年Q2财报电话会上,CEO皮查伊透露:原定6月发布的Gemini 3.5 Pro延期并仍处伙伴测试阶段,谷歌已启动史上最大规模预训练计划,全力打造下一代旗舰Gemini 4,以争夺AGI技术制高点。近期产品布局上已相继推出Gemini 3.6F等。
无限画布串起顶尖AI模型,浏览器内完成分镜、迭代与发布
macOS原生应用,利用语言模型简化本地文件迭代
快速直观地进行LLM实验
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$6
$24
Baidu
128
$2
$20
ByteDance
Ouro-2.6B是一款拥有26亿参数的循环语言模型,通过迭代共享权重计算实现了卓越的参数效率,在仅用26亿参数的情况下达到了30-40亿标准Transformer模型的性能水平。
Ouro-1.4B是由字节跳动开发的具有14亿参数的循环语言模型,通过迭代共享权重计算实现了卓越的参数效率,仅用14亿参数就达到了30-40亿标准Transformer模型的性能水平。
Pacific-Prime
INL架构是一种基于积分神经元动力学的生产级神经架构,用迭代动力学取代传统前馈网络层,适用于大语言模型、视觉变换器、多模态模型等多种类型。
OpenGVLab
VideoChat-R1_5-7B是基于Qwen2.5-VL-7B-Instruct构建的视频文本交互模型,支持多模态任务,特别擅长视频问答功能。该模型通过强化微调增强时空感知能力,并采用迭代感知机制来强化多模态推理。
Qwen
通义图像编辑模型的月度迭代版本,支持多图像编辑,提升了单图像编辑的一致性,并原生支持ControlNet,为图像编辑带来更强大的功能和更好的效果。
QuantFactory
这是Tesslate/WEBGEN-4B-Preview的量化版本,专注于生成单文件网站,能将提示转化为简洁、响应式的HTML/CSS/Tailwind代码。模型小巧适合本地运行和快速迭代,具有开放权重、移动优先输出、默认无外部JS等特点。
deepcogito
Cogito v2是基于指令调优的生成式大语言模型,具备混合推理能力,支持128k上下文长度和多语言处理。该模型采用迭代蒸馏与放大(IDA)训练策略,在编码、STEM、指令遵循等任务上表现优异。
Cogito v2是基于Llama-3.1-70B的指令调优生成式模型,具备混合推理能力,支持多语言和长上下文,在编码、STEM等领域表现出色。采用迭代蒸馏与放大训练策略,可用于商业用途。
Goedel-LM
哥德尔证明器V2是一个开源语言模型系列,在自动形式证明生成方面树立了新的标杆。它基于专家迭代和强化学习构建,融入了三项关键创新,在多个基准测试中表现卓越,为定理证明领域带来了新的突破。
哥德尔证明器V2是一个开源语言模型系列,在自动形式证明生成方面树立了新的标杆。它基于专家迭代和强化学习流程构建,融入了脚手架数据合成、验证器引导的自我修正和模型平均三项关键创新,显著提升了证明定理的能力和效率。
Doctor-Shotgun
基于Llama-3.3-70B-Instruct构建的Magnum最终迭代版本,合并多个rsLoRA微调版本,模拟Claude 3 Sonnet/Opus系列模型的文风和质量。
Qwen3是通义千问系列大语言模型的最新迭代,提供稠密模型与混合专家(MoE)模型的完整套件。基于大规模训练,Qwen3在推理能力、指令遵循、智能体功能及多语言支持方面实现突破性进展。
THU-KEG
ReaRAG-9B是基于glm-4-9b训练的增强模型,具备生成知识引导推理链的能力,支持迭代式检索增强生成。
VARGPT-family
VARGPT-v1.1是一个视觉自回归统一大模型,通过迭代指令调优与强化学习提升,能够同时实现视觉理解和生成任务。
VARGPT-v1.1是一个通过迭代指令调优与强化学习提升的视觉自回归统一大模型,支持视觉理解和生成任务。
Gen-Verse
赫尔墨斯流是一个通用的多模态大语言模型对齐框架,能够自主生成同源偏好数据,并通过自我博弈迭代优化与配对DPO技术,无缝弥合多模态理解与生成的鸿沟。
ibm-granite
花岗岩守护者3.2是基于3.1版本精简的风险检测模型,通过迭代剪枝技术实现更高效推理,专注于识别提示与响应中的多维度风险。
NimVideo
为genmoai mochi-1模型蒸馏的变换器,由42个模块组成(原版48个模块),通过迭代删除MSE值最小的模块实现轻量化
osunlp
Qwen2-VL是Qwen-VL模型系列的最新迭代,具备全分辨率图像理解、超长视频解析和多语言图文识别能力。
MaziyarPanahi
calme-3.2-instruct-78b是基于Qwen2.5-72B的高级迭代版本,通过自我合并和微调增强能力的通用领域大语言模型。
MCP橡皮鸭是一个基于模型上下文协议(MCP)的服务器,作为桥梁查询多个兼容OpenAI的LLM。它像橡皮鸭调试法一样,允许用户向不同的AI“鸭子”解释问题并获得多元视角。支持多种AI提供商,提供对话管理、多模型比较、共识投票、辩论和迭代优化等高级工具,并可通过MCP桥接功能连接其他MCP服务器以扩展能力。
Loom是一个MCP服务器,支持用户与基础模型协作构建文本,通过短片段迭代生成和选择来优化长文本创作质量。
MCP Thought Server是一个为AI代理提供高级思维工具的服务,通过模型上下文协议(MCP)增强推理、规划和迭代优化能力。它包含结构化思维、迭代草稿和集成思维等工具,支持SQLite持久化和高级置信度评分系统,可配置环境变量以适应不同需求。
一个基于Node.js和Gemini API的AI研究助手工具,通过Firecrawl进行网页数据抓取,利用Gemini大模型进行深度语言理解和报告生成,支持迭代式深度研究,并可与MCP协议集成。
该项目是一个基于Ollama本地大模型的深度研究服务器,通过MCP协议提供自动化研究工具,能够迭代搜索、分析和总结复杂主题。
mirror-mcp是一个基于模型上下文协议(MCP)的服务器,它提供了一个“reflect”工具,使大型语言模型能够通过递归提问和MCP采样进行自我反思和内省,从而实现自我分析、推理验证和迭代问题解决。