9月1日,Anthropic发布Claude Fable 5.1与Mythos 5.1,称其为最先进编程与知识工作模型。二者同基础模型但安全分级不同:Fable 5.1面向所有用户,Mythos 5.1仅向经审核的网络安全与生命科学机构开放。基准测试全面超越前代,价格更便宜。
CodeBuddy全系产品适配DeepSeek-V4-Flash正式版,新模型强化AI Agent能力,在基准测试中显著超越前代预览版。优化代码生成、任务执行与复杂开发流程,为开发者提供更高效的智能编程体验。
OpenAI公开质疑SWE-Bench Pro基准,指出其731个测试任务中约30%存在评测缺陷。该基准由Scale AI推出,是衡量大模型编程能力的行业权威。但OpenAI警示,前沿模型通过率8个月内从23.3%飙升至80.3%,进步速度异常,暗示评测可靠性存疑。
新浪开源VibeThinker-3B模型仅30亿参数,在数学、编程等基准测试中性能媲美百倍规模大模型,部分竞赛级任务超越顶尖产品。其成功源于基于阿里Qwen2的独特训练策略,挑战了参数量“越大越好”的观念。
强大的开源Kimi K2聊天平台,通过Kimi AI在编程和数学基准测试中超越GPT-4。企业级Kimi AI,成本降低95%。
一款在推理和编程基准测试中表现与o1-preview相当的推理模型。
Anthropic
$105
Input tokens/M
$525
Output tokens/M
200
Context Length
$7
$35
$21
Xai
$1.4
$10.5
256
Openai
$8.75
$70
400
Chatglm
$8
$16
128
-
Google
$7.7
$30.8
$14
$56
1k
$1.75
Moonshot
$1
262
Baidu
$100
$3.5
32
01-ai
4
Baichuan
facebook
MobileLLM-R1是Facebook推出的高效推理模型系列,专注于数学、编程和科学问题解决。该模型在仅使用约2T高质量标记进行预训练的情况下,在多项基准测试中取得了优异性能。
Sci-fi-vy
DeepSeek-R1-0528是DeepSeek R1系列的小版本升级模型,通过增加计算资源和算法优化显著提升了推理深度和能力,在数学、编程等多个基准测试中表现出色。
unsloth
基于强化学习训练的数学与编程推理模型,在多项基准测试中表现优异
ibm-granite
IBM Granite 8B代码指令模型是一个专注于代码生成和解释的AI模型,支持多种编程语言,在HumanEval等基准测试中表现优异。
professorf
Phi-1是一个专门用于Python编码的13亿参数Transformer模型,提供GGUF格式量化版本,支持CPU+GPU推理。该模型在简单Python编码基准测试HumanEval上的准确率超过50%,专注于基础Python编程任务。
microsoft
Phi-1是一个13亿参数的Transformer模型,专为Python基础编程设计,在HumanEval基准测试中准确率超过50%