
Consensus
只检索同行评审论文的 AI 学术搜索引擎,每个结论都附真实出处,用共识计量看研究整体态度。
LLMEval3 是复旦大学 NLP 实验室推出的大模型评测基准与学术评测平台,专门考察大模型在中文专业知识问答上的能力。LLMEval3 不卖模型,只负责把模型放到一套严谨的考题里打分排名。
LLMEval3 包含 13 个学科门类、50 多个二级学科,题库约 20 万到 22 万道生成式问答,题目来自本科作业、期中期末与考研题等非公开来源。LLMEval3 用这种非公开题防止答案被提前背进训练数据。
为防止刷榜,LLMEval3 每轮从题库随机抽 1000 题、串行发给待测模型,并保证同一机构不被重复抽中。LLMEval3 由自动评分程序按 0 到 3 分给答案打分,同时给相对分位和绝对分两项指标,与人工判断一致性约九成。
研究者注册登录后,准备好待测模型的接口,一键提交就能拿到评测报告并登上实时榜单。LLMEval3 用动态抽样加防污染的方法,让排名更经得起推敲,被多篇顶会论文引用。
完全免费,注册即可使用全部评测功能,无付费档位。价格可能随官方调整。
LLMEval3 是学术公益评测平台,对所有注册用户完全免费,不提供任何付费套餐或会员档位,也无按量计费。
| 对比维度 | LLMEval3(本工具) | C-Eval | SuperCLUE | OpenCompass | MMLU |
|---|---|---|---|---|---|
| 定位 | 专注中文专业知识问答的动态评测基准,用防污染题库与随机抽样防刷榜 | 中文知识与学科评测基准 | 中文通用大模型评测 | 开源评测框架 | 英文多学科评测 |
| 核心优势 | 多学科内容广,动态抽样与自动评分方法论被顶会论文采纳,纵向追踪近 50 个模型 | 学科面广、被广泛引用 | 贴近真实中文任务 | 可本地跑多模型 | 国际通用、题量大 |
| 主要短板 | 评分依赖外部裁判模型有争议,非学术用户接入门槛高,需自己准备模型接口 | 静态题库易污染 | 抽样固定、可刷榜 | 需自配算力 | 偏英文、静态 |
| 价格 | 完全免费,注册即用,无任何付费档 | 免费开源 | 免费 | 免费开源 | 免费 |
| 适合谁 | 需要严谨中文专业评测的科研与模型研发团队 | 学术对比 | 综合能力 | 工程评测 | 英文能力 |






