MMBench

15小时前发布 4 0 0

面向多模态大模型的公开评测基准与榜单,用约 3000 道覆盖感知与推理的选择题衡量视觉语言模型的图文理解能力,并采用循环评测降低选项顺序带来的噪声。

所在地:
中国
语言:
中文、英文
收录时间:
2026-09-04
价格完全免费需沟通询价
平台网页版

MMBench详细介绍

MMBench 是上海人工智能实验室 OpenCompass 团队推出的多模态大模型评测基准,用一套约 3000 道、覆盖感知与推理的选择题来衡量视觉语言模型看懂图和文字的能力。MMBench 的题按层级分了二十多个细粒度维度,从物体识别、文字识别到关系推理、图表理解都有。

MMBench 最有特点的是循环评测法。MMBench 把同一道题的选项顺序打乱重复问几遍,模型每次都给同一答案才视为通过,这样能压住靠蒙选项顺序涨分的噪声,比传统一次作答更接近真实水平。

我以前做多模态模型横向对比时常用 MMBench 当第一道筛子,中英文两套题能一起看,循环评测的分数也比随手跑一次的榜单可信。要注意的是,MMBench 的在线提交和评测服务已经停了,公开榜单不再更新,现在再想跑分得拉开源的 VLMEvalKit 在本地或自己机器上跑,站点本身更适合当历史参考。

MMBench 适合需要给模型做客观横评的研究和工程场景。MMBench 的题型偏选择题、偏静态图文,对长视频、agent、实时交互这类新方向覆盖不到,所以拿 MMBench 当唯一标准会偏科;配合 OpenCompass 等持续更新的评测台一起看更稳。

MMBench的核心功能

  • 多维度评测集:MMBench 提供约 3000 道选择题,分感知、推理两大层和二十多个细粒度能力维度,覆盖物体检测、文字识别、动作识别、图表理解等任务。
  • 循环评测法:MMBench 把选项顺序循环移位重复提问,模型多次答案一致才计通过,显著降低选项位置带来的评测噪声。
  • 中英文双榜:MMBench 有英文版和中文版两套题目,方便对比模型在中英文场景下的图文理解差异。
  • 客观提取打分:MMBench 借助模型把自由作答匹配到选项,即使模型不按格式输出也能对齐到最合理选项,减少人工判分。
  • 公开榜单:MMBench 把各模型的历史成绩做成可排序的榜单,研究者能按维度看强弱分布。
  • 开源数据集与代码:MMBench 放出题目和评测脚本,可配合 VLMEvalKit 在本地复现评测,不依赖在线服务。
  • 细粒度能力拆解:MMBench 的结果按层级维度拆分,能看出模型是卡在感知还是推理,而不是只给一个总分。

MMBench的价格详情

免费权益:

MMBench 为完全免费的学术评测基准与公开榜单,浏览题目、榜单和开源数据均不收费。在线提交评测服务已停止,需自行用开源工具跑分。价格可能随官方调整。

收费模式:

MMBench 完全免费,没有标准付费套餐;机构如有多模态评测合作需求可联系 OpenCompass 团队。

MMBench的应用场景

  • 模型横向选型:研发团队在上新多模态模型前,用 MMBench 跑一遍看感知与推理各维度强弱,决定要不要补训练数据。
  • 论文方法对比:研究者拿 MMBench 的中英文双榜对比自己方法和已有模型,作为论文实验的一部分。
  • 能力短板定位:工程团队用 MMBench 的细粒度拆解看模型卡在图文关系推理还是文字识别,针对性优化。
  • 历史成绩参考:做调研时翻 MMBench 公开榜单,快速了解一批视觉语言模型的大致水平分布。
  • 本地复现评测:开发者拉取 MMBench 开源题目和 VLMEvalKit,在自有算力上复现或扩展评测流程。
  • 教学与科普:讲师用 MMBench 的题型示例讲解多模态模型的能力和局限,比纯文字更直观。

MMBench的适用人群

  • 多模态研究者:MMBench 提供标准化的客观题和榜单,方便在论文里做可复现的模型对比。
  • 模型研发工程师:MMBench 的细粒度维度帮工程团队定位模型在感知或推理上的短板。
  • 高校与实验室:MMBench 的开源题目适合作为教学案例和实验作业,讲解评测方法。
  • 技术选型决策者:采购或接入视觉语言模型前,用 MMBench 的历史榜单做初步能力筛查。

同类工具对比

对比维度 MMBench(本工具) SEED-Bench MMMU OpenCompass
定位 多模态大模型客观评测基准与公开榜单,偏静态图文理解 覆盖图像与视频的多模态大模型评测基准 面向学科知识与大学级推理的多模态评测集 开源的大模型综合评测平台,含多模态榜单
核心优势 循环评测抗噪声,中英文双榜,细粒度维度拆解清晰 题型含生成与选择题,视频理解维度更全,样本量大 覆盖大量大学学科与专业图表,难度高、区分度强 持续更新、维度广,支持主客观与长文本等多种评测
主要短板 在线评测已停更,题型偏选择题,对视频与 agent 方向覆盖弱 题目偏学术场景,对真实业务噪声覆盖有限 偏知识问答,对日常感知任务覆盖少 体系庞大,新手上手成本高于单点基准
价格 完全免费,开源题目可自行跑分 公开免费学术基准 公开免费学术基准 开源免费,平台公开可用
适合谁 做多模态模型客观横评与短板定位的研究和工程团队 需要同时评测图文与视频能力的科研团队 评测模型专业学科与图文推理能力的研究者 需要一站式、长期跟踪模型能力的团队

相关导航

暂无评论

用户投票:

none
暂无评论...