SuperCLUE发布2025中文大模型测评报告,涵盖数学推理、代码生成等六大维度。结果显示,海外闭源模型表现强势,Anthropic的Claude-Opus-4.5-Reasoning以68.25分位居榜首。
SuperCLUE 2025年度中文大模型基准测评报告发布,23个国内外模型参与。评测涵盖数学推理、科学推理、代码生成等六大维度。结果显示,海外闭源模型仍处领先地位,Anthropic的Claude-Opus-4.5-Reasoning以68.25分位居榜首,谷歌Gemini-3-Pro-Preview和OpenAI模型紧随其后。