智谱BigModel
智谱AI推出的一站式大模型开发与应用平台,提供GLM系列旗舰模型API及智能体、知识库等全链路开发工具。
中文大模型圈子里,C-Eval 几乎是绕不开的名字,不少国产模型发布时会把 C-Eval 分数当作能力证明摆出来。严格说这不是软件产品,而是一套给中文大模型出考题的评估标准,官网将其定位为多层次多学科的中文大模型评估套件,属于学术开源项目。
套件内含 13948 道多项选择题,覆盖 52 个学科,按难度分为四个层级,从中学通识到大学专业科目都有涉及。题型统一为选择题,模型可以批量作答、机器自动判分,天然适合大规模横向比较。官网提供在线看题页面,不下载数据也能直接浏览各学科的题目样貌。
使用路径对技术背景的用户很友好:数据集挂在 Hugging Face 上,评测代码放在 GitHub 仓库,按官方说明跑一遍即可复现榜单分数,这正是 C-Eval 被大量论文和 OpenCompass 一类评测框架反复引用的原因。项目由上海交大团队主导、清华等机构参与,论文与完整作者信息在官网可查。
针对 C-Eval 的批评集中在数据污染上。公开分析指出相当比例的考题能在公开网页上找到原题,个别头部模型家族被检出明显刷分迹象,社区因此越来越倾向只看干净子集分数而不迷信总分。想严谨选型的人可以把 C-Eval 当摸底考,再搭配强调推理与生成的评测一起看。
C-Eval 为学术开源项目,全部考题、数据集与评测代码免费开放,官网在线看题无需注册,个人与学术研究可直接使用。价格可能随官方调整。
C-Eval 没有任何订阅、按量或买断档位,永久免费开放。如需基于该基准的企业级定制评测、商用数据授权或联合研究,需与维护团队单独沟通,官网未公开商务报价。
| 对比维度 | C-Eval(本工具) | CMMLU | MMLU | SuperCLUE |
|---|---|---|---|---|
| 定位 | 面向中文基础模型的学术评测基准,以多学科选择题和开放复现为核心 | 同类型的中文多学科大模型评测基准 | 以英文为主的多任务知识评测基准 | 中文大模型综合能力评测体系 |
| 核心优势 | 13948 道考题覆盖 52 个学科、四档难度;数据集与代码全部开源,结果可复现;被论文与主流评测框架广泛引用,历史分数积累丰富 | 题库结构清晰,同样开源可复现 | 国际通用、生态成熟,历史对比样本丰富 | 组织化运营,评测维度扩展至推理、对话与生成 |
| 主要短板 | 纯选择题只能测知识掌握,难以覆盖推理与生成能力;存在公开数据污染争议,看分数需留意干净子集口径 | 学科覆盖面与题量规模相对小,外部引用不如头部基准多 | 中文覆盖弱,对国产模型的区分度有限 | 榜单运营成分较重,公开结果复现性弱于纯开源基准 |
| 价格 | 完全免费开放,无任何收费档位 | 完全开源免费 | 完全开源免费 | 部分榜单免费,深度服务需联系 |
| 适合谁 | 模型厂商、AI 研究者与高校实验室做中文能力摸底与横向比较 | 需要多基准交叉验证的研究团队 | 做国际横向对比的团队 | 关注中文模型综合排名与动态的用户 |






