FlagEval

6小时前发布 3 0 0

北京智源研究院的大模型评测开放平台,覆盖语言、多模态与文生图等方向的权威榜单,提供匿名盲测角斗场与多维评测工具,为模型选型和研究提供中立参照。

所在地:
中国
语言:
中文
收录时间:
2026-09-03
FlagEvalFlagEval
价格完全免费需沟通询价
平台网页版

FlagEval详细介绍

FlagEval 不是又一个聊天或画图工具,而是北京智源研究院做的第三方模型评测基础设施,给市面上大大小小的大模型当裁判。厂商自己出题、自己打分总让人犯嘀咕,FlagEval 把出题、评分、公示整套流程放到台面上,用能力、任务、指标三维框架去刻画模型,再以公开榜单和匿名盲测的形式呈现结果。FlagEval 服务的是想知道哪个模型真能打的机构与个人,而不是想被模型服务的终端用户。

对普通用户来说,最容易上手的入口是首页的大模型角斗场。机制类似盲品测试,系统抛出一个问题,参赛双方不露名字,用户分别看两款模型的回答再投一票,几轮下来榜单按类 Elo 机制滚动,反映的是真实人群的偏好而非纸面分数。语言问答、图文理解、文生图文生视频都能盲测,想验证某款热门模型的实际表现,进去点几轮就有直观感受。

专业用户的用法要深得多。研究机构可以申请提交自研模型,走完整的评测流程拿到细粒度报告;做选型的技术团队能对照榜单数据缩小候选范围。评测覆盖面很广,除了主流的语言与视觉语言模型,还有专门的代码能力、幻觉检测、K12 试卷、金融量化交易代码等专项评测,部分主观题由海淀教师团队评卷,评测维度比一般 benchmark 更贴近真实使用。

榜单的权威性来自持续维护的方法学。为了防止厂商针对旧题背答案,平台会定期更换和提升题目难度,某一轮甚至替换掉九成以上的题目;评测执行适配英伟达、昇腾、寒武纪、昆仑芯等多种芯片和主流深度学习框架,跑分环境相对统一。配套的评测工具与模型也对外开源,想自己复现评测的人可以下载代码在本地跑一遍。

需要提醒的是,FlagEval 有鲜明的研究属性,交互体验和商业产品差距明显,主要页面都是给懂指标的人看的,MMLU、Pass@k 这类概念不熟悉的话容易误读榜单。对普通爱好者而言,看热闹的方式就是去角斗场盲测,拿不准的结论少下;对研究者和工程师而言,这里的中文模型生态覆盖和第三方中立性是稀缺资源,做技术选型或写论文时值得作为交叉验证的来源之一。

FlagEval的核心功能

  • 权威公开排行榜:滚动收录国内外开闭源模型,覆盖语言、视觉语言、文生图、文生视频与语音等多领域,结果以榜单形式长期公示。
  • 匿名盲测角斗场:两类模型在同一问题下匿名作答,用户投票后按类 Elo 机制更新排名,凭真实人群偏好反映模型强弱。
  • 三维评测框架:从能力、任务、指标三个维度建立细粒度评估体系,下辖六百多个子维度,比单一总分更能定位模型的长处与短板。
  • 专项评测矩阵:除通用能力外提供代码生成、幻觉检测、K12 全学段试卷、金融量化代码等专项测试,部分主观题由一线教师团队评卷。
  • 动态防饱和机制:定期替换与升级评测题目,防止模型针对旧题背答案,尽量保证分数反映真实泛化能力。
  • 多芯片多框架适配:评测执行支持英伟达、昇腾、寒武纪、昆仑芯等硬件与 PyTorch、MindSpore 等框架,可复现性好。
  • 开源评测工具集:FlagEval、多模态评测框架、自动标注评测模型等以开源工程形式发布,研究团队可自建评测流水线。
  • 模型提交与评测申请:研究者提交自有模型申请评测,通过后获得平台侧细粒度评估结果,可作为论文与产品决策依据。

FlagEval的价格详情

免费权益:

平台面向公众与研究机构完全免费开放,查看排行榜、参与角斗场盲测、浏览评测报告均无需付费;提交自有模型参与评测走官方申请流程,平台不收取评测费用,但跑模型所需的 API 调用费或自有算力成本需用户自行承担。价格与政策可能随官方调整。

收费模式:

官网未公开任何付费套餐或商业报价,平台本身以免费方式运营;如需专项评测合作、定制榜单或深度的机构级服务,建议直接联系智源研究院官方洽谈,具体费用以官方答复为准。

FlagEval的应用场景

  • 模型选型前的横向摸底:技术团队引入新模型前,先查榜单里目标模型在各能力维度的位置,再结合价格与场景缩小候选范围。
  • 匿名盲测尝鲜:想验证网上被吹捧的模型是否名副其实,去角斗场把同一问题丢给匿名双方,靠实际观感而不是宣传口径下判断。
  • 论文与报告引用:研究者引用官方评测数据说明模型能力对比,第三方出题与评分流程让引用更有公信力。
  • 自研模型能力验收:模型团队完成训练后提交评测申请,拿到细粒度报告定位薄弱维度,为下一轮迭代提供方向。
  • 企业内部模型评估:需要向决策层说明模型选型理由时,用第三方榜单数据配合内部小规模实测,形成双重证据。
  • 了解中文模型生态格局:想快速掌握国产大模型整体水平,翻一遍综合榜单就能获得大致全貌,省去逐个试用的时间。

FlagEval的适用人群

  • 科研人员:用 FlagEval 的评测框架、开源工具与公开数据做模型能力研究,或提交自研模型获取第三方评估结果。
  • 开发者与 AI 工程师:接入模型前查阅榜单做技术选型,遇到拿不准的候选模型再用角斗场盲测快速验证实际表现。
  • 模型厂商的评测团队:把平台当作外部检验渠道,跟踪自家模型在第三方榜单上的位置变化,发现优势与短板。
  • 技术决策与采购人员:向管理层或客户说明选型依据时,引用独立第三方评测数据增强说服力。
  • AI 学习者和学生:把榜单与盲测当作认识模型差异的窗口,配合官方报告理解各项评测指标的含义。

同类工具对比

对比维度 FlagEval(本工具) OpenCompass SuperCLUE LMSYS Chatbot Arena
定位 北京智源研究院的第三方中立大模型评测开放平台,覆盖榜单、盲测与开源工具 上海人工智能实验室的开源大模型评测体系 中文大模型综合评测榜单与基准集 国际流行的模型匿名对战盲测平台
核心优势 中文模型生态与中文场景覆盖深,K12、金融量化等本土专项评测独树一帜;能力、任务、指标三维框架维度细,动态换题机制降低背题干扰;评测工具开源且适配国产芯片,具备研究级可复现性 开源生态完整、支持自建评测集,国内高校与厂商使用广泛 中文场景针对性强、榜单更新频率高、社区关注度大 参与用户基数大、覆盖模型全、国际化视野开阔
主要短板 研究属性强、面向专业人群,界面与文档对初学者不友好;交互体验与商业产品有差距;平台侧评测以申请制推进,即时性不如商业化服务 以客观题自动评测为主,用户主观对战与文生图盲测相对弱 评测集由自身团队维护,部分口径需结合细则理解 以英文与通用对话为主,中文与专业领域覆盖不如国内平台细
价格 榜单、盲测与报告全部免费开放,无商业套餐,专项合作需联系官方洽谈 开源免费 榜单免费公开 免费使用
适合谁 需要第三方中立数据做模型选型、论文引用或能力验收的研究机构、技术团队与模型厂商 需要自建评测流程的研究团队与模型厂商 关注国产模型中文能力对比的从业者 想对比全球主流模型综合口碑的用户

FlagEval的同类竞品

相关导航

暂无评论

用户投票:

none
暂无评论...