编辑点评
适合需要细粒度评估视觉语言模型能力的研究者与开发者;不适合仅需文本模型评测或不具备部署条件的用户。
核验信息
分类大模型
人工核验
MMBench是什么
MMBench是由上海人工智能实验室联合多所高校推出的多模态基准测试,以约3000道单选题从感知到认知细分20项能力,提供可靠的视觉语言模型评估与排行榜。
MMBench的主要功能
- 细粒度评估多模态模型在感知与认知各维度的表现
- 提交测试结果至官方排行榜进行横向对比
- 用VLMEvalKit对新模型做标准化评估
- 开展多模态领域的学术研究与教学实践
适合
- 20项细粒度能力维度,评估颗粒度高
- 循环打乱选项的评估策略有效降低噪声
- 提供中英双语数据集与官方评估工具VLMEvalKit
先注意
- 单选题形式难以覆盖开放式生成质量
- 需要自行搭建评估环境,使用门槛较高
- 排行榜成绩需结合具体任务场景解读
如何使用MMBench
- 用pip安装VLMEvalKit评估工具
- 从MMBench官方GitHub仓库下载所需格式的数据集
- 用VLMEvalKit脚本加载并浏览数据样本
- 运行模型推理生成预测结果文件
- 提交测试集预测结果至领先榜获取各维度得分
MMBench的适用场景
上手难度: 进阶
- 细粒度评估多模态模型在感知与认知各维度的表现
- 提交测试结果至官方排行榜进行横向对比
- 用VLMEvalKit对新模型做标准化评估
- 开展多模态领域的学术研究与教学实践
常见问题
MMBench的数据规模有多大?
MMBench采集约3000道单项选择题,覆盖20项细粒度能力维度,提供中文和英文版本。
MMBench如何避免模型猜答案?
采用循环评估策略,多次打乱选项顺序验证输出一致性,并借助ChatGPT将模型回复精准匹配至选项。
如何在MMBench排行榜提交成绩?
用测试集推理生成预测结果文件,登录MMBench领先榜上传文件,系统会自动计算并展示各能力维度表现。
来源与核验
信息来源:mmbench.opencompass.org.cn (在新窗口打开)
核验日期: · 提交更正 →
类似于MMBench的工具
该分类全部
MMLU
适合:需要衡量英文模型通用知识水平的研究者与选型工程师;不适合:评估生成质量、对话体验或中文能力的场景。
Watsonx.ai
适合需要全生命周期管理、企业级治理与合规要求的中大型企业与开发团队;不适合个人开发者、轻量实验或预算敏感的小型项目。
DeepFloyd IF
适合有一定技术基础、希望自托管和深入研究图像生成模型的开发者与研究人员;不适合只想在网页上输入提示词直接出图的普通用户。
HELM
适合需要多维、可复现评估语言模型的研究者与工程团队;不适合只想快速浏览单一榜单分数的用户。
PaLM 2
适合AI开发者、研究者和Google生态内的企业团队;不适合寻求开箱即用消费级聊天产品的普通用户。