EN 提交工具

MMBench

MMBench是由上海人工智能实验室联合多所高校推出的多模态基准测试,以约3000道单选题从感知到认知细分20项能力,提供可靠的视觉语言模型评估与排行榜。

人工核验 · · 提交更正

编辑点评

适合需要细粒度评估视觉语言模型能力的研究者与开发者;不适合仅需文本模型评测或不具备部署条件的用户。

核验信息

分类大模型
人工核验

MMBench是什么

MMBench是由上海人工智能实验室联合多所高校推出的多模态基准测试,以约3000道单选题从感知到认知细分20项能力,提供可靠的视觉语言模型评估与排行榜。

MMBench的主要功能

  • 细粒度评估多模态模型在感知与认知各维度的表现
  • 提交测试结果至官方排行榜进行横向对比
  • 用VLMEvalKit对新模型做标准化评估
  • 开展多模态领域的学术研究与教学实践

适合

  • 20项细粒度能力维度,评估颗粒度高
  • 循环打乱选项的评估策略有效降低噪声
  • 提供中英双语数据集与官方评估工具VLMEvalKit

先注意

  • 单选题形式难以覆盖开放式生成质量
  • 需要自行搭建评估环境,使用门槛较高
  • 排行榜成绩需结合具体任务场景解读

如何使用MMBench

  1. 用pip安装VLMEvalKit评估工具
  2. 从MMBench官方GitHub仓库下载所需格式的数据集
  3. 用VLMEvalKit脚本加载并浏览数据样本
  4. 运行模型推理生成预测结果文件
  5. 提交测试集预测结果至领先榜获取各维度得分

MMBench的适用场景

上手难度: 进阶

  • 细粒度评估多模态模型在感知与认知各维度的表现
  • 提交测试结果至官方排行榜进行横向对比
  • 用VLMEvalKit对新模型做标准化评估
  • 开展多模态领域的学术研究与教学实践

常见问题

MMBench的数据规模有多大?

MMBench采集约3000道单项选择题,覆盖20项细粒度能力维度,提供中文和英文版本。

MMBench如何避免模型猜答案?

采用循环评估策略,多次打乱选项顺序验证输出一致性,并借助ChatGPT将模型回复精准匹配至选项。

如何在MMBench排行榜提交成绩?

用测试集推理生成预测结果文件,登录MMBench领先榜上传文件,系统会自动计算并展示各能力维度表现。

来源与核验

信息来源:mmbench.opencompass.org.cn (在新窗口打开)
核验日期: · 提交更正 →

类似于MMBench的工具

该分类全部