科大讯飞子公司词元星火9月1日开源星火X2.5-4B和1.7B两款端侧通用大模型,为端侧首个原生支持100万Token上下文,并开放权重、代码仓库与部署文档。模型采用混合注意力架构,优化智能体、代码、数学、指令遵循等核心能力,实现小模型“读全书”,综合实测能力领先。
9月1日,科大讯飞子公司词元星火开源星火X2.5-4B和1.7B两款端侧通用大模型,原生支持最高100万Token超长上下文,突破端侧算力瓶颈,让小体积设备也能处理超长文本,推动端侧AI性能与容量双重升级。
阿里千问发布多模态MoE模型Qwen3.8-Flash,并开源下一代架构Qwen3.8-Flash-Next(Qwen4雏形)。模型总参数125B,搭载51B N-gram Embedding,每token仅激活6B;原生支持26万token,可扩展至100万。训练成本为前代1/9,API定价输入每百万Tokens 1元、输出3元。
OpenAI工程师Tibo宣布,Codex中GPT-5.6 Sol模型的100万Token上下文窗口,已从仅限API密钥扩展至ChatGPT账号。订阅用户可手动开启百万窗口,解决处理大项目时被迫截断历史记录的限制。
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
Alibaba
$4
$16
$6
$24
256
$2
$20
-
Bytedance
$0.8
$0.15
$1.5
Baidu
32
$10.5
Tencent
$1
$8
$0.75
$0.35
400
$0.63
$3.15
131
DavidAU
基于Llama 3.1的8B参数模型,支持100万token上下文长度,专为创意写作和角色扮演优化,具有高度稳定性和低困惑度特性。
YOYO-AI
Qwen2.5-YOYO第五代模型,整合了多个先进模型的特点,优化了模型合并公式,支持100万token上下文。
gradientai
由Gradient开发的Llama-3 8B长上下文扩展版本,支持超过100万token的上下文长度,通过优化RoPE theta参数实现高效长文本处理能力。