C-Eval
C-Eval 是由上海交大、清华和爱丁堡大学联合推出的中文基础模型评估套件,含 13948 道选择题、覆盖 52 个学科四个难度级别,支持零样本与少样本测试,是衡量中文能力的权威标尺。
核验等级未记录 · · 提交更正
编辑点评
适合:需要标准化衡量中文模型能力的研发团队、研究者与选型决策者;不适合:想评估长文本生成或对话体验的场景。
决策信息
“未核验”表示证据不足,不表示该能力不存在。
C-Eval是什么
C-Eval 是由上海交大、清华和爱丁堡大学联合推出的中文基础模型评估套件,含 13948 道选择题、覆盖 52 个学科四个难度级别,支持零样本与少样本测试,是衡量中文能力的权威标尺。
C-Eval的主要功能
- 对大模型进行中文多学科知识评测
- 零样本或少样本模式下测试模型泛化能力
- 横向对比不同模型在各学科与难度级别的表现
- 为教育、金融、医疗等行业应用评估领域知识
适合
- 52 学科四难度级别,覆盖面与颗粒度俱佳
- 客观选择题评分,横向对比可比性强
- 学术背书强,社区认可度高,数据免费开放
先注意
- 仅考察选择题形式的知识与推理
- 无法衡量长文生成、对话与指令遵循能力
- 高分可能受刷榜影响,需结合其他基准判断
如何使用C-Eval
- 通过 Hugging Face 加载或下载 ceval-exam 数据集
- 确定使用零样本还是少样本评估模式
- 加载待测模型与 tokenizer 准备推理
- 让模型回答全部选择题并收集输出
- 对照答案按学科与难度统计准确率
C-Eval的适用场景
上手难度: 高级
- 对大模型进行中文多学科知识评测
- 零样本或少样本模式下测试模型泛化能力
- 横向对比不同模型在各学科与难度级别的表现
- 为教育、金融、医疗等行业应用评估领域知识
常见问题
C-Eval 包含多少题目、覆盖哪些学科?
共 13948 道多项选择题,覆盖 52 个学科,横跨 STEM、社会科学与人文科学,分四个难度级别。
零样本和少样本测试有什么区别?
零样本不给任何示例直接作答,少样本提供少量示例引导;两者分别考察模型的裸考能力与引导下的表现。
C-Eval 收费吗?
不收费,数据集可通过 Hugging Face 免费公开下载,成本主要在自行评测的算力。
来源与核验
证据状态: 核验等级未记录
信息来源:cevalbenchmark.com (在新窗口打开)
资料复核日期: · 提交更正 →