LLMEval3
LLMEval是复旦大学NLP实验室推出的大模型评测基准,最新LLMEval-3聚焦专业知识能力,覆盖13个学科门类、50余个二级学科、约20万道生成式问答题。
核验等级未记录 · · 提交更正
编辑点评
适合需要考察大模型学科专业知识深度的研究团队与教育科技机构;不适合仅关注通用聊天能力的用户。
决策信息
“未核验”表示证据不足,不表示该能力不存在。
LLMEval3是什么
LLMEval是复旦大学NLP实验室推出的大模型评测基准,最新LLMEval-3聚焦专业知识能力,覆盖13个学科门类、50余个二级学科、约20万道生成式问答题。
LLMEval3的主要功能
- 评估大模型在13个学科门类上的专业知识水平
- 对比不同模型的垂直领域知识深度
- 为专业知识类应用选型合适的基础模型
- 支撑中文大模型能力的学术研究
适合
- 聚焦专业知识能力,学科覆盖面系统完整
- 约20万道标准生成式问答题目,题量充足
- 高校实验室出品,评测设计学术性强
先注意
- 侧重知识问答,对工具调用等新型能力覆盖有限
- 公开页面信息较简略,使用细节需进一步查阅
- 生成式答案的评判对评估方法要求高
如何使用LLMEval3
- 访问 llmeval.com 了解LLMEval-3的评测设计
- 查看13个学科门类与二级学科的覆盖范围
- 了解生成式问答题目的组织形式
- 按页面指引参与或引用该基准进行模型评测
- 对比不同模型在各学科上的评测结果
LLMEval3的适用场景
上手难度: 进阶
- 评估大模型在13个学科门类上的专业知识水平
- 对比不同模型的垂直领域知识深度
- 为专业知识类应用选型合适的基础模型
- 支撑中文大模型能力的学术研究
常见问题
LLMEval由谁推出?
LLMEval由复旦大学NLP实验室推出,最新版本为聚焦专业知识能力评测的LLMEval-3。
LLMEval-3覆盖哪些学科?
涵盖哲学、经济学、法学、教育学、文学、历史学、理学、工学、农学、医学、军事学、管理学、艺术学等13个学科门类、50余个二级学科。
LLMEval-3的题量有多大?
共计约20万道标准生成式问答题目。
来源与核验
证据状态: 核验等级未记录
信息来源:llmeval.com (在新窗口打开)
资料复核日期: · 提交更正 →