CMMLU

3小时前发布 1 0 0

评估中文大模型知识与推理能力的大型基准,覆盖67个学科主题,题目大量涉及中国特有知识,支持零样本与少样本测试并接入主流评测框架,配套公开排行榜

所在地:
中国
语言:
中文、英文
收录时间:
2026-09-06
价格完全免费需沟通询价
平台网页版

CMMLU详细介绍

模型宣传的跑分数字水分不小,各家拿手的测试集不同,直接对比容易失真。CMMLU 做的是把中文环境里的知识和推理能力拉出来单独考,题目覆盖 67 个主题,从自然科学、人文社科到中国的驾驶规则这类本地化常识都有,很多题在中国以外根本不成立,正好补上通用英文基准测不到的部分。

使用成本很低。数据以 CSV 格式按主题组织,每个问题都是四选一,通过 Hugging Face 或仓库目录都能拿到;已经接入 lm-evaluation-harness 和 OpenCompass,想给自家模型跑分的话按框架文档配置即可,仓库里也提供直接回答与思路链两种提示的预处理代码,用来复现榜单结果。

值得留意的是榜单规则。对未开放公测的 API 模型,维护方会先验证指令跟随能力并排查数据污染,通过才更新分数,所以榜单更新节奏不快但相对可信;用的时候建议同时看零样本与少样本两列,不同提示方式下模型表现差异能反映稳定性。数据集采用知识共享非商业许可,商用前需要确认授权范围。

适合的对象很明确:训练中文大模型的研究团队把 CMMLU 当验证集,选型的企业开发者用这套基准横向比候选模型,写论文的研究者拿来当实验数据。和偏门刷榜的测试集不同,CMMLU 的题目设计贴近真实中文使用场景,这也是不少厂商把这一基准作为对外宣称指标的原因。

CMMLU的核心功能

  • 大规模中文题库:共 67 个学科主题,覆盖自然科学、人文社科、生活常识与中国特定知识,单套题量足以支撑稳定统计。
  • 中国化知识设计:题目包含中国历史地理、法律政策、驾驶规则等本地化内容,能测出通用英文基准无法覆盖的知识面。
  • 双模式评测:支持零样本与少样本两种提示方式,分别评估模型的基础能力与上下文学习能力,榜单两列对照呈现。
  • 主流框架接入:已集成到 lm-evaluation-harness 与 OpenCompass,通过这两个平台即可直接对模型执行评测。
  • 公开排行榜:官网维护持续更新的模型榜单,区分开放测试与未开放模型,提交结果需经指令跟随与数据污染验证。
  • 易用数据格式:数据按主题提供 CSV 文件,每题四选一单选,结构简单,便于二次处理与自定义采样。
  • 提示工程代码:仓库提供直接回答与思路链两种提示的生成脚本,可复现论文与榜单中的评测设置。

CMMLU的价格详情

免费权益:

CMMLU 数据集与评测代码完全开源,可通过 GitHub 与 Hugging Face 免费获取,无需注册,个人与学术研究可直接使用,数据许可为知识共享非商业许可

收费模式:

CMMLU 本身没有订阅、按量或买断套餐,永久免费开放。若需要基于该基准的定制评测服务、模型评估咨询或数据商用授权,可联系维护团队或相关机构按项目沟通,官方不提供公开标价

CMMLU的应用场景

  • 模型发布前自测:训练完成的中文模型先跑一遍 CMMLU,与公开榜单对比确认所处水平,再决定是否继续投入优化。
  • 开源模型横向选型:企业准备接入开源模型前,用同一套题目对比多个候选的分数与稳定性,跑分结果辅助技术选型。
  • 论文实验基准:做中文模型或训练方法研究时把 CMMLU 作为实验数据集,结果可与已发表工作直接对比。
  • 能力短板诊断:按 STEM、人文、社科、中国特定主题分科查看得分,定位模型在哪些知识域偏弱,指导后续数据配比。
  • NLP 课程教学:作为中文评测作业素材,让学生用公开框架给不同模型跑分,理解评测方法与数据污染问题。

CMMLU的适用人群

  • 大模型研发团队:训练循环里需要稳定的中文验证集,CMMLU 与公开榜单提供可复现的对照基准。
  • 企业算法工程师:为业务评估候选模型,用同一基准统一比较,减少不同测试集带来的偏差。
  • 高校 NLP 研究者:做中文模型评测、多任务理解相关研究时作为数据与基线,论文引用成熟。
  • 模型评测与社区贡献者:通过提交测试代码参与榜单共建,推动中文评测标准完善。

同类工具对比

对比维度 CMMLU(本工具) MMLU C-Eval AGIEval
定位 中文语境下的多任务语言理解评测基准,突出中国化知识覆盖 面向英文语境的通用多任务语言理解基准 面向中文的大规模多学科知识评测基准 面向通用人工智能能力的评测基准
核心优势 67 主题全学科覆盖、题目本地化程度高、框架接入完善、榜单有数据污染验证机制 国际通用度高,学科覆盖广,便于与海外模型横向对比 题目贴合中文教育体系,含多个难度层次,社区接受度高 以人类考试题目为基础,覆盖推理、逻辑等多类能力
主要短板 数据许可限非商业使用,榜单更新依赖人工审核节奏不快 英文知识为主,中国特有知识与社会常识覆盖明显不足 部分题目依赖教材知识,与 CMMLU 的题目来源和侧重有差异 中文专项深度与中国特定知识侧重相对有限
价格 数据集与代码永久免费开源 免费开源 免费开源 免费开源
适合谁 中文大模型研发团队、企业选型与学术研究 以英文能力为主的国际对比场景 衡量中文模型教育知识水平的团队 考察模型通用智能与考试能力的场景

相关导航

暂无评论

用户投票:

none
暂无评论...