MMLU
MMLU(大规模多任务语言理解基准)由 UC Berkeley 于 2020 年推出,涵盖 57 项任务的英文选择题测试,是衡量大模型通用知识覆盖与理解能力的最著名基准之一,被全球业界广泛引用。
核验等级未记录 · · 提交更正
编辑点评
适合:需要衡量英文模型通用知识水平的研究者与选型工程师;不适合:评估生成质量、对话体验或中文能力的场景。
决策信息
“未核验”表示证据不足,不表示该能力不存在。
MMLU是什么
MMLU(大规模多任务语言理解基准)由 UC Berkeley 于 2020 年推出,涵盖 57 项任务的英文选择题测试,是衡量大模型通用知识覆盖与理解能力的最著名基准之一,被全球业界广泛引用。
MMLU的主要功能
- 检验新模型架构或训练方法的知识提升
- 在统一基准下横向比较不同机构模型
- 作为企业选型的通用能力初筛指标
- 配合 MMLU-PRO 等加强版做高区分度评测
适合
- 57 项任务覆盖人文社科理工与专业领域
- 选择题范式客观标准,全球可复现
- 历史数据丰富,是行业通用参照系
先注意
- 仅选择题形式,测不了生成与对话质量
- 顶级模型分数趋近饱和,区分度下降
- 测试语言为英文,不衡量中文能力
如何使用MMLU
- 阅读 MMLU 原始论文了解任务构成与协议
- 从 Papers with Code 或 Hugging Face 获取数据集
- 确定 zero-shot 或 5-shot 评测方式
- 运行模型完成全部选择题并收集回答
- 统计总体与各任务准确率并对照排行榜
MMLU的适用场景
上手难度: 高级
- 检验新模型架构或训练方法的知识提升
- 在统一基准下横向比较不同机构模型
- 作为企业选型的通用能力初筛指标
- 配合 MMLU-PRO 等加强版做高区分度评测
常见问题
MMLU 考察什么内容?
57 项任务的英文多项选择题,涵盖初等数学、美国历史、计算机科学、法律等,评测模型基本知识覆盖与理解能力。
MMLU 是谁推出的?
由加州大学伯克利分校的研究人员于 2020 年 9 月推出。
MMLU 分数还够用吗?
仍是通用能力的入门标尺,但顶级模型趋于饱和,建议搭配 MMLU-PRO、BBH 等更难的基准综合评估。
来源与核验
证据状态: 核验等级未记录
信息来源:paperswithcode.com (在新窗口打开)
资料复核日期: · 提交更正 →