腾讯推出WorkBuddy Bench多领域评测套件,论文已发布于arXiv。它打破编码智能体评测各自为政、生产基准不透明的局面,将仓库级代码工程、前端制品、办公自动化等四类工作场景整合为一。最大亮点不在题量,而是从题目根源设计上杜绝“背答案”,确保评测能真实反映智能体在不同领域的通用与迁移能力。
Google
$0.7
Input tokens/M
$2.8
Output tokens/M
1k
Context Length
Alibaba
$1
$10
256
$2
$20
-
$3.9
$15.2
64
Bytedance
$0.8
$0.15
$1.5
128
Baidu
32
$8
$1.6
$4
Openai
$0.63
$3.15
131
Tencent
24
Xai
$3
$9