国内首份《高考志愿AI测评基准》报告发布,由友松实验室独立完成,以千问高考志愿填报Agent为对象。结果显示,千问在稳定性、精确性、结构化表达与效率上已达人类咨询师水平。该研究体现AI在教育决策场景的评估进展。
SuperCLUE-VLM发布最新中文多模态视觉语言模型测评结果,字节跳动Doubao-Seed-2.0-Pro-260215以90.66分获总榜第一,超越谷歌Gemini-3.1-Pro-Preview的89.35分。测评涵盖17款国内外模型,国产模型表现优异,阿里巴巴Qwen3.5系列、商汤等品牌位列前茅,彰显国内AI领域重大突破。
DeepSeek-V4发布仅10小时,北京大学DCAI团队便通过最新开源的One-Eval评测框架,快速生成全量自动化评测报告。传统大模型评测流程繁琐,需耗费大量精力在搭建测试管道上,而One-Eval显著提升了效率,标志着行业进入新阶段。
在第十六届北京国际电影节上,影视飓风创始人Tim分享了团队使用AI进行影像创作的经历。他们曾花费大量时间生成500多个AI镜头,但在视频中主动标注“AI生成”后,却收到大量负面评论。Tim指出,团队在无人机测评中特意使用AI技术以突显产品特点。
Xai
$1.4
Input tokens/M
$3.5
Output tokens/M
2k
Context Length
Anthropic
$105
$525
200
Google
$0.7
$2.8
1k
$7
$35
$2.1
$17.5
$21
Alibaba
-
$6
$24
256
Baidu
128
Bytedance
$1.2
$3.6
4
$2
$3.9
$15.2
64