学术评测AI工具把模型和方法的学术能力测出来,选型和学者拿它看真水平,它做任务、判分和维度,也接榜单和报告,团队靠它不水。
斯坦福推出的语言模型全面评测套件,覆盖能力、多模态、安全等方向,用统一基准横向比较各家大模型。