FlagEval
FlagEval(天秤)是智源研究院推出的大模型评测平台,采用能力-任务-指标三维框架,提供 22+ 数据集、8 万道题目,支持多模态与多硬件,覆盖 800+ 模型,是分量很重的评测基础设施。
核验等级未记录 · · 提交更正
编辑点评
适合:模型研发团队、企业选型方与需要多模态/国产硬件兼容评测的机构;不适合:只想快速看分数的个人轻量用户。
决策信息
“未核验”表示证据不足,不表示该能力不存在。
FlagEval是什么
FlagEval(天秤)是智源研究院推出的大模型评测平台,采用能力-任务-指标三维框架,提供 22+ 数据集、8 万道题目,支持多模态与多硬件,覆盖 800+ 模型,是分量很重的评测基础设施。
FlagEval的主要功能
- 按三维框架系统评估基础模型认知能力
- 提交模型走自动化主客观评测流水线
- 评测文本、图像、视频等多模态模型
- 对比全球 800+ 开源闭源模型表现
适合
- 能力-任务-指标框架方法论扎实
- 22+ 数据集 8 万题,多模态与多硬件兼容
- 主客观评测全自动流水线,覆盖 800+ 模型
先注意
- 送测流程有工程门槛,不够轻量
- 具体定价与额度未公开
- 个人用户难以独立完成全部评测
如何使用FlagEval
- 注册并登录 FlagEval 官网账户
- 准备模型文件、推理代码与配置
- 安装 FlagEval-Serving 工具
- 获取 token 并命令行上传模型与代码
- 创建评测任务提交后查看结果与图表
FlagEval的适用场景
上手难度: 高级
- 按三维框架系统评估基础模型认知能力
- 提交模型走自动化主客观评测流水线
- 评测文本、图像、视频等多模态模型
- 对比全球 800+ 开源闭源模型表现
常见问题
FlagEval 的评测框架是什么?
采用能力-任务-指标三维框架,覆盖对话、问答、情感分析等场景,提供 22+ 数据集和 8 万道评测题目。
支持多模态模型评测吗?
支持,覆盖文本、图像、视频等模态,并兼容 PyTorch、MindSpore 及 NVIDIA、昇腾、寒武纪、昆仑芯等硬件。
FlagEval 收费吗?
官网未公布具体定价,注册登录后可使用评测流程,资源额度以平台说明为准。
来源与核验
证据状态: 核验等级未记录
信息来源:flageval.baai.ac.cn (在新窗口打开)
资料复核日期: · 提交更正 →