
Mistral
法国公司推出的开源AI大模型与AI聊天助手,提供网页对话、AI实时搜索、AI深度研究、AI代码生成与图像生成,开放权重可自托管,多语言表现突出。
MMBench 是上海人工智能实验室 OpenCompass 团队推出的多模态大模型评测基准,用一套约 3000 道、覆盖感知与推理的选择题来衡量视觉语言模型看懂图和文字的能力。MMBench 的题按层级分了二十多个细粒度维度,从物体识别、文字识别到关系推理、图表理解都有。
MMBench 最有特点的是循环评测法。MMBench 把同一道题的选项顺序打乱重复问几遍,模型每次都给同一答案才视为通过,这样能压住靠蒙选项顺序涨分的噪声,比传统一次作答更接近真实水平。
我以前做多模态模型横向对比时常用 MMBench 当第一道筛子,中英文两套题能一起看,循环评测的分数也比随手跑一次的榜单可信。要注意的是,MMBench 的在线提交和评测服务已经停了,公开榜单不再更新,现在再想跑分得拉开源的 VLMEvalKit 在本地或自己机器上跑,站点本身更适合当历史参考。
MMBench 适合需要给模型做客观横评的研究和工程场景。MMBench 的题型偏选择题、偏静态图文,对长视频、agent、实时交互这类新方向覆盖不到,所以拿 MMBench 当唯一标准会偏科;配合 OpenCompass 等持续更新的评测台一起看更稳。
MMBench 为完全免费的学术评测基准与公开榜单,浏览题目、榜单和开源数据均不收费。在线提交评测服务已停止,需自行用开源工具跑分。价格可能随官方调整。
MMBench 完全免费,没有标准付费套餐;机构如有多模态评测合作需求可联系 OpenCompass 团队。
| 对比维度 | MMBench(本工具) | SEED-Bench | MMMU | OpenCompass |
|---|---|---|---|---|
| 定位 | 多模态大模型客观评测基准与公开榜单,偏静态图文理解 | 覆盖图像与视频的多模态大模型评测基准 | 面向学科知识与大学级推理的多模态评测集 | 开源的大模型综合评测平台,含多模态榜单 |
| 核心优势 | 循环评测抗噪声,中英文双榜,细粒度维度拆解清晰 | 题型含生成与选择题,视频理解维度更全,样本量大 | 覆盖大量大学学科与专业图表,难度高、区分度强 | 持续更新、维度广,支持主客观与长文本等多种评测 |
| 主要短板 | 在线评测已停更,题型偏选择题,对视频与 agent 方向覆盖弱 | 题目偏学术场景,对真实业务噪声覆盖有限 | 偏知识问答,对日常感知任务覆盖少 | 体系庞大,新手上手成本高于单点基准 |
| 价格 | 完全免费,开源题目可自行跑分 | 公开免费学术基准 | 公开免费学术基准 | 开源免费,平台公开可用 |
| 适合谁 | 做多模态模型客观横评与短板定位的研究和工程团队 | 需要同时评测图文与视频能力的科研团队 | 评测模型专业学科与图文推理能力的研究者 | 需要一站式、长期跟踪模型能力的团队 |







