EN 提交工具
返回筛选结果

FlagEval

FlagEval(天秤)是智源研究院推出的大模型评测平台,采用能力-任务-指标三维框架,提供 22+ 数据集、8 万道题目,支持多模态与多硬件,覆盖 800+ 模型,是分量很重的评测基础设施。

核验等级未记录 · · 提交更正

编辑点评

适合:模型研发团队、企业选型方与需要多模态/国产硬件兼容评测的机构;不适合:只想快速看分数的个人轻量用户。

决策信息

“未核验”表示证据不足,不表示该能力不存在。

分类大模型
证据状态核验等级未记录
平台未核验
地区可用性可用
中文界面未核验
中国大陆可用性未核验
商用条款未核验

FlagEval是什么

FlagEval(天秤)是智源研究院推出的大模型评测平台,采用能力-任务-指标三维框架,提供 22+ 数据集、8 万道题目,支持多模态与多硬件,覆盖 800+ 模型,是分量很重的评测基础设施。

FlagEval的主要功能

  • 按三维框架系统评估基础模型认知能力
  • 提交模型走自动化主客观评测流水线
  • 评测文本、图像、视频等多模态模型
  • 对比全球 800+ 开源闭源模型表现

适合

  • 能力-任务-指标框架方法论扎实
  • 22+ 数据集 8 万题,多模态与多硬件兼容
  • 主客观评测全自动流水线,覆盖 800+ 模型

先注意

  • 送测流程有工程门槛,不够轻量
  • 具体定价与额度未公开
  • 个人用户难以独立完成全部评测

如何使用FlagEval

  1. 注册并登录 FlagEval 官网账户
  2. 准备模型文件、推理代码与配置
  3. 安装 FlagEval-Serving 工具
  4. 获取 token 并命令行上传模型与代码
  5. 创建评测任务提交后查看结果与图表

FlagEval的适用场景

上手难度: 高级

  • 按三维框架系统评估基础模型认知能力
  • 提交模型走自动化主客观评测流水线
  • 评测文本、图像、视频等多模态模型
  • 对比全球 800+ 开源闭源模型表现

常见问题

FlagEval 的评测框架是什么?

采用能力-任务-指标三维框架,覆盖对话、问答、情感分析等场景,提供 22+ 数据集和 8 万道评测题目。

支持多模态模型评测吗?

支持,覆盖文本、图像、视频等模态,并兼容 PyTorch、MindSpore 及 NVIDIA、昇腾、寒武纪、昆仑芯等硬件。

FlagEval 收费吗?

官网未公布具体定价,注册登录后可使用评测流程,资源额度以平台说明为准。

来源与核验

证据状态: 核验等级未记录

信息来源:flageval.baai.ac.cn (在新窗口打开)
资料复核日期: · 提交更正 →

类似于FlagEval的工具

该分类全部