EN 提交工具
返回筛选结果

MMLU

MMLU(大规模多任务语言理解基准)由 UC Berkeley 于 2020 年推出,涵盖 57 项任务的英文选择题测试,是衡量大模型通用知识覆盖与理解能力的最著名基准之一,被全球业界广泛引用。

核验等级未记录 · · 提交更正

编辑点评

适合:需要衡量英文模型通用知识水平的研究者与选型工程师;不适合:评估生成质量、对话体验或中文能力的场景。

决策信息

“未核验”表示证据不足,不表示该能力不存在。

分类大模型
证据状态核验等级未记录
平台未核验
地区可用性可用
中文界面未核验
中国大陆可用性未核验
商用条款未核验

MMLU是什么

MMLU(大规模多任务语言理解基准)由 UC Berkeley 于 2020 年推出,涵盖 57 项任务的英文选择题测试,是衡量大模型通用知识覆盖与理解能力的最著名基准之一,被全球业界广泛引用。

MMLU的主要功能

  • 检验新模型架构或训练方法的知识提升
  • 在统一基准下横向比较不同机构模型
  • 作为企业选型的通用能力初筛指标
  • 配合 MMLU-PRO 等加强版做高区分度评测

适合

  • 57 项任务覆盖人文社科理工与专业领域
  • 选择题范式客观标准,全球可复现
  • 历史数据丰富,是行业通用参照系

先注意

  • 仅选择题形式,测不了生成与对话质量
  • 顶级模型分数趋近饱和,区分度下降
  • 测试语言为英文,不衡量中文能力

如何使用MMLU

  1. 阅读 MMLU 原始论文了解任务构成与协议
  2. 从 Papers with Code 或 Hugging Face 获取数据集
  3. 确定 zero-shot 或 5-shot 评测方式
  4. 运行模型完成全部选择题并收集回答
  5. 统计总体与各任务准确率并对照排行榜

MMLU的适用场景

上手难度: 高级

  • 检验新模型架构或训练方法的知识提升
  • 在统一基准下横向比较不同机构模型
  • 作为企业选型的通用能力初筛指标
  • 配合 MMLU-PRO 等加强版做高区分度评测

常见问题

MMLU 考察什么内容?

57 项任务的英文多项选择题,涵盖初等数学、美国历史、计算机科学、法律等,评测模型基本知识覆盖与理解能力。

MMLU 是谁推出的?

由加州大学伯克利分校的研究人员于 2020 年 9 月推出。

MMLU 分数还够用吗?

仍是通用能力的入门标尺,但顶级模型趋于饱和,建议搭配 MMLU-PRO、BBH 等更难的基准综合评估。

来源与核验

证据状态: 核验等级未记录

信息来源:paperswithcode.com (在新窗口打开)
资料复核日期: · 提交更正 →

类似于MMLU的工具

该分类全部