
CMMLU详细介绍
模型宣传的跑分数字水分不小,各家拿手的测试集不同,直接对比容易失真。CMMLU 做的是把中文环境里的知识和推理能力拉出来单独考,题目覆盖 67 个主题,从自然科学、人文社科到中国的驾驶规则这类本地化常识都有,很多题在中国以外根本不成立,正好补上通用英文基准测不到的部分。
使用成本很低。数据以 CSV 格式按主题组织,每个问题都是四选一,通过 Hugging Face 或仓库目录都能拿到;已经接入 lm-evaluation-harness 和 OpenCompass,想给自家模型跑分的话按框架文档配置即可,仓库里也提供直接回答与思路链两种提示的预处理代码,用来复现榜单结果。
值得留意的是榜单规则。对未开放公测的 API 模型,维护方会先验证指令跟随能力并排查数据污染,通过才更新分数,所以榜单更新节奏不快但相对可信;用的时候建议同时看零样本与少样本两列,不同提示方式下模型表现差异能反映稳定性。数据集采用知识共享非商业许可,商用前需要确认授权范围。
适合的对象很明确:训练中文大模型的研究团队把 CMMLU 当验证集,选型的企业开发者用这套基准横向比候选模型,写论文的研究者拿来当实验数据。和偏门刷榜的测试集不同,CMMLU 的题目设计贴近真实中文使用场景,这也是不少厂商把这一基准作为对外宣称指标的原因。
CMMLU的核心功能
- 大规模中文题库:共 67 个学科主题,覆盖自然科学、人文社科、生活常识与中国特定知识,单套题量足以支撑稳定统计。
- 中国化知识设计:题目包含中国历史地理、法律政策、驾驶规则等本地化内容,能测出通用英文基准无法覆盖的知识面。
- 双模式评测:支持零样本与少样本两种提示方式,分别评估模型的基础能力与上下文学习能力,榜单两列对照呈现。
- 主流框架接入:已集成到 lm-evaluation-harness 与 OpenCompass,通过这两个平台即可直接对模型执行评测。
- 公开排行榜:官网维护持续更新的模型榜单,区分开放测试与未开放模型,提交结果需经指令跟随与数据污染验证。
- 易用数据格式:数据按主题提供 CSV 文件,每题四选一单选,结构简单,便于二次处理与自定义采样。
- 提示工程代码:仓库提供直接回答与思路链两种提示的生成脚本,可复现论文与榜单中的评测设置。
CMMLU的价格详情
免费权益:
CMMLU 数据集与评测代码完全开源,可通过 GitHub 与 Hugging Face 免费获取,无需注册,个人与学术研究可直接使用,数据许可为知识共享非商业许可
收费模式:
CMMLU 本身没有订阅、按量或买断套餐,永久免费开放。若需要基于该基准的定制评测服务、模型评估咨询或数据商用授权,可联系维护团队或相关机构按项目沟通,官方不提供公开标价
CMMLU的应用场景
- 模型发布前自测:训练完成的中文模型先跑一遍 CMMLU,与公开榜单对比确认所处水平,再决定是否继续投入优化。
- 开源模型横向选型:企业准备接入开源模型前,用同一套题目对比多个候选的分数与稳定性,跑分结果辅助技术选型。
- 论文实验基准:做中文模型或训练方法研究时把 CMMLU 作为实验数据集,结果可与已发表工作直接对比。
- 能力短板诊断:按 STEM、人文、社科、中国特定主题分科查看得分,定位模型在哪些知识域偏弱,指导后续数据配比。
- NLP 课程教学:作为中文评测作业素材,让学生用公开框架给不同模型跑分,理解评测方法与数据污染问题。
CMMLU的适用人群
- 大模型研发团队:训练循环里需要稳定的中文验证集,CMMLU 与公开榜单提供可复现的对照基准。
- 企业算法工程师:为业务评估候选模型,用同一基准统一比较,减少不同测试集带来的偏差。
- 高校 NLP 研究者:做中文模型评测、多任务理解相关研究时作为数据与基线,论文引用成熟。
- 模型评测与社区贡献者:通过提交测试代码参与榜单共建,推动中文评测标准完善。
同类工具对比
| 对比维度 | CMMLU(本工具) | MMLU | C-Eval | AGIEval |
|---|---|---|---|---|
| 定位 | 中文语境下的多任务语言理解评测基准,突出中国化知识覆盖 | 面向英文语境的通用多任务语言理解基准 | 面向中文的大规模多学科知识评测基准 | 面向通用人工智能能力的评测基准 |
| 核心优势 | 67 主题全学科覆盖、题目本地化程度高、框架接入完善、榜单有数据污染验证机制 | 国际通用度高,学科覆盖广,便于与海外模型横向对比 | 题目贴合中文教育体系,含多个难度层次,社区接受度高 | 以人类考试题目为基础,覆盖推理、逻辑等多类能力 |
| 主要短板 | 数据许可限非商业使用,榜单更新依赖人工审核节奏不快 | 英文知识为主,中国特有知识与社会常识覆盖明显不足 | 部分题目依赖教材知识,与 CMMLU 的题目来源和侧重有差异 | 中文专项深度与中国特定知识侧重相对有限 |
| 价格 | 数据集与代码永久免费开源 | 免费开源 | 免费开源 | 免费开源 |
| 适合谁 | 中文大模型研发团队、企业选型与学术研究 | 以英文能力为主的国际对比场景 | 衡量中文模型教育知识水平的团队 | 考察模型通用智能与考试能力的场景 |
相关导航


IBM watsonx.ai

Lorka AI

文心大模型

腾讯混元

阶跃AI

