
豆包
字节跳动旗下的AI助手,集智能对话、AI写作、AI绘画、视频生成与智能体于一体,中文表达自然、上手简单,适合日常聊天、内容创作与办公辅助。
AGI-Eval 是一个面向大语言模型与多模态模型的公开评测社区,由高校与产业机构共同维护,目标是用统一、可复现的评测方法把模型能力摊在阳光下。
AGI-Eval 的核心能力集中在三块:实时更新的模型榜单、人机协同评测,以及由官方与社区共建的评测数据集。榜单包含综合与分项能力,数据源透明,能直接看到每家模型的得分与短板。
对研究者和工程师来说,AGI-Eval 的价值在于把哪个模型更强从体感变成可查证的数字。选模型、写论文、做横向对比时,先来这里翻一遍榜单,能少走很多弯路。
AGI-Eval 的门槛很低,浏览器打开即用,无需安装。社区还鼓励普通人参与人机评测并换取回报,这种众包机制让榜单更新更快、收录更广。
用过 AGI-Eval 的人普遍反馈榜单更新勤、数据可溯源,但也提醒评测集本身会偏科,结论要结合实际业务再判断,不能唯分数论。
社区榜单浏览、评测集查看与人机评测参与完全免费,版本以官网为准,价格可能随官方调整。
面向企业与科研机构的定制化评测、私有化榜单与数据共建合作,需沟通询价,价格以官网为准。
| 对比维度 | AGI-Eval(本工具) | OpenCompass | SuperCLUE | LMArena |
|---|---|---|---|---|
| 定位 | 公开的多模型能力评测社区 | 上海AI实验室推出的开源评测框架 | 中文大模型综合性评测榜单 | LMSYS 人机对战胜负榜 |
| 核心优势 | 榜单透明、数据集丰富、人机协同 | 开源可本地跑、适配广 | 专注中文场景 | 真实人类偏好、更新快 |
| 主要短板 | 评测集偏科、需结合业务判断 | 偏技术、普通用户门槛高 | 多模态覆盖弱 | 偏主观、成本高 |
| 价格 | 社区功能免费 | 开源免费 | 免费查看 | 免费 |
| 适合谁 | 研究者与企业客观选型 | 研究者自建评测 | 关注中文能力的用户 | 看真实体感排名 |







