字节跳动 Seed 团队与清华 AIR 联合发布 CUDA Agent,这是一套训练大模型编写高性能 GPU 内核的智能体强化学习系统。该系统针对大模型生成 CUDA 代码效率低、难超传统编译器的痛点,标志着 AI 在底层代码优化领域取得重要进展,并以 KernelBench 为评测基准。
医疗人工智能加速迈向专科化与安全化。中文医疗大模型评测基准MedBench近日升级至5.0版本,由上海人工智能实验室联合广州实验室钟南山院士团队、复旦大学附属中山医院葛均波院士团队等顶尖力量共同构建,致力打造更专业可靠的中文医疗AI评测体系。
OpenAI公开质疑SWE-Bench Pro基准,指出其731个测试任务中约30%存在评测缺陷。该基准由Scale AI推出,是衡量大模型编程能力的行业权威。但OpenAI警示,前沿模型通过率8个月内从23.3%飙升至80.3%,进步速度异常,暗示评测可靠性存疑。
腾讯混元大模型联合故宫博物院等机构推出“Chronicles-OCR”,这是业界首个覆盖汉字“七体之变”演化轨迹的古文字感知评测基准。数据集由专家多层交叉标注,包含2800张图像,旨在测试AI对甲骨文等古文字的识别能力,推动人工智能理解汉字从龟甲刻痕到现代代码的完整演变。
领先的AI评测基准,衡量和比较AI模型性能。
Anthropic
$105
Input tokens/M
$525
Output tokens/M
200
Context Length
Alibaba
-
Bytedance
Baidu
Tencent
$2
64
Chatglm
$8
$16
128