EN 提交工具

OpenCompass

OpenCompass是上海人工智能实验室推出的开源大模型评测体系,集评测工具包、基准社区与排行榜于一体,支持语言与多模态模型的一站式多维评估。

人工核验 · · 提交更正

编辑点评

适合需要系统化、可复现地评估大模型的研究机构与企业团队;不适合只想快速聊天体验模型的普通用户。

核验信息

分类大模型
人工核验

OpenCompass是什么

OpenCompass是上海人工智能实验室推出的开源大模型评测体系,集评测工具包、基准社区与排行榜于一体,支持语言与多模态模型的一站式多维评估。

OpenCompass的主要功能

  • 对自研大语言模型或多模态模型进行多维度能力评估
  • 为企业应用选型时横向对比多个候选模型
  • 在学术研究中产出可复现的模型对比实验
  • 向基准社区发布自定义评测基准并查看排名

适合

  • 开源且可复现,评估流程透明
  • 覆盖语言、知识、推理等八大能力维度
  • 支持分布式评估,处理大规模模型效率高

先注意

  • 部署和使用需要一定工程能力,门槛高于普通应用
  • 评估结果受基准与提示设计影响,需结合业务解读
  • 主要面向模型研发场景,普通用户缺少直接可用的产品形态

如何使用OpenCompass

  1. 访问 OpenCompass 官网,了解 CompassKit、CompassHub 与 CompassRank 三大模块
  2. 从 GitHub 克隆 CompassKit 代码并安装依赖、配置环境
  3. 准备待评估模型的 API 或 Hugging Face 仓库地址
  4. 选择基准与评估方式(零样本或少样本)执行评估
  5. 在本地报告或 CompassRank 排行榜查看评估结果

OpenCompass的适用场景

上手难度: 进阶

  • 对自研大语言模型或多模态模型进行多维度能力评估
  • 为企业应用选型时横向对比多个候选模型
  • 在学术研究中产出可复现的模型对比实验
  • 向基准社区发布自定义评测基准并查看排名

常见问题

OpenCompass 是免费的吗?

OpenCompass 的评测框架完整开源,用户可免费使用其工具包与社区资源。

OpenCompass 支持评估哪些模型?

支持 Hugging Face 模型、API 模型等多种接入方式,涵盖大语言模型与多模态模型。

评估结果在哪里查看?

本地评估可生成实验报告,公开模型结果会定期更新至 CompassRank 排行榜。

来源与核验

信息来源:opencompass.org.cn (在新窗口打开)
核验日期: · 提交更正 →

类似于OpenCompass的工具

该分类全部