LLMEval3
LLMEval是复旦大学NLP实验室推出的大模型评测基准,最新LLMEval-3聚焦专业知识能力,覆盖13个学科门类、50余个二级学科、约20万道生成式问答题。
人工核验 · · 提交更正
编辑点评
适合需要考察大模型学科专业知识深度的研究团队与教育科技机构;不适合仅关注通用聊天能力的用户。
核验信息
分类大模型
人工核验
LLMEval3是什么
LLMEval是复旦大学NLP实验室推出的大模型评测基准,最新LLMEval-3聚焦专业知识能力,覆盖13个学科门类、50余个二级学科、约20万道生成式问答题。
LLMEval3的主要功能
- 评估大模型在13个学科门类上的专业知识水平
- 对比不同模型的垂直领域知识深度
- 为专业知识类应用选型合适的基础模型
- 支撑中文大模型能力的学术研究
适合
- 聚焦专业知识能力,学科覆盖面系统完整
- 约20万道标准生成式问答题目,题量充足
- 高校实验室出品,评测设计学术性强
先注意
- 侧重知识问答,对工具调用等新型能力覆盖有限
- 公开页面信息较简略,使用细节需进一步查阅
- 生成式答案的评判对评估方法要求高
如何使用LLMEval3
- 访问 llmeval.com 了解LLMEval-3的评测设计
- 查看13个学科门类与二级学科的覆盖范围
- 了解生成式问答题目的组织形式
- 按页面指引参与或引用该基准进行模型评测
- 对比不同模型在各学科上的评测结果
LLMEval3的适用场景
上手难度: 进阶
- 评估大模型在13个学科门类上的专业知识水平
- 对比不同模型的垂直领域知识深度
- 为专业知识类应用选型合适的基础模型
- 支撑中文大模型能力的学术研究
常见问题
LLMEval由谁推出?
LLMEval由复旦大学NLP实验室推出,最新版本为聚焦专业知识能力评测的LLMEval-3。
LLMEval-3覆盖哪些学科?
涵盖哲学、经济学、法学、教育学、文学、历史学、理学、工学、农学、医学、军事学、管理学、艺术学等13个学科门类、50余个二级学科。
LLMEval-3的题量有多大?
共计约20万道标准生成式问答题目。
来源与核验
信息来源:llmeval.com (在新窗口打开)
核验日期: · 提交更正 →
类似于LLMEval3的工具
该分类全部
MMLU
适合:需要衡量英文模型通用知识水平的研究者与选型工程师;不适合:评估生成质量、对话体验或中文能力的场景。
Watsonx.ai
适合需要全生命周期管理、企业级治理与合规要求的中大型企业与开发团队;不适合个人开发者、轻量实验或预算敏感的小型项目。
DeepFloyd IF
适合有一定技术基础、希望自托管和深入研究图像生成模型的开发者与研究人员;不适合只想在网页上输入提示词直接出图的普通用户。
HELM
适合需要多维、可复现评估语言模型的研究者与工程团队;不适合只想快速浏览单一榜单分数的用户。
PaLM 2
适合AI开发者、研究者和Google生态内的企业团队;不适合寻求开箱即用消费级聊天产品的普通用户。