腾讯混元大模型联合故宫博物院等机构推出“Chronicles-OCR”,这是业界首个覆盖汉字“七体之变”演化轨迹的古文字感知评测基准。数据集由专家多层交叉标注,包含2800张图像,旨在测试AI对甲骨文等古文字的识别能力,推动人工智能理解汉字从龟甲刻痕到现代代码的完整演变。
近日,“OpenClaw AI Agent 小龙虾能力排行榜”在AI圈引发关注。该榜单聚焦真实场景,通过统一任务集测试主流大模型在OpenClaw框架下的编码任务成功率,为开发者提供参考。评测采用自动化代码检查与LLM智能评审相结合的方式,确保结果客观、可复现且无人工干预。
AI基准平台Epoch AI短暂出现代号“Claude Kayak”的新模型条目,标注今日发布后迅速删除,引发全球关注。业内普遍认为这是Anthropic即将推出的旗舰模型Claude Opus4.5。作为Claude4系列最强版本,预计在复杂推理、多步任务及代码生成能力上实现大幅提升,有望在SWE-bench等评测中突破80%得分,直接对标OpenAI GPT-5.1与Google Gemini3。
上海人工智能实验室联合浙江大学推出IVR-Bench基准测试,首次专门评估大语言模型将视频转化为交互式网页代码的能力。该测试通过观看记录用户操作流程的视频,要求模型重建动态网页,填补了AI前端开发领域动态交互评测的空白,推动多模态大语言模型在真实场景中的应用。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
$8
$240
52
Bytedance
$1.2
$3.6
4
Skywork
天工 Skywork-13B 是在高质量清洗过滤的 3.2 万亿个多语言和代码数据上预训练的大语言模型,在多种评测和基准测试中展现出优异效果。它兼顾中文和英文表现,代码能力也有保障,为自然语言处理领域提供了强大支持。