EN 提交工具
返回筛选结果

C-Eval

C-Eval 是由上海交大、清华和爱丁堡大学联合推出的中文基础模型评估套件,含 13948 道选择题、覆盖 52 个学科四个难度级别,支持零样本与少样本测试,是衡量中文能力的权威标尺。

核验等级未记录 · · 提交更正

编辑点评

适合:需要标准化衡量中文模型能力的研发团队、研究者与选型决策者;不适合:想评估长文本生成或对话体验的场景。

决策信息

“未核验”表示证据不足,不表示该能力不存在。

分类大模型
证据状态核验等级未记录
平台未核验
地区可用性可用
中文界面未核验
中国大陆可用性未核验
商用条款未核验

C-Eval是什么

C-Eval 是由上海交大、清华和爱丁堡大学联合推出的中文基础模型评估套件,含 13948 道选择题、覆盖 52 个学科四个难度级别,支持零样本与少样本测试,是衡量中文能力的权威标尺。

C-Eval的主要功能

  • 对大模型进行中文多学科知识评测
  • 零样本或少样本模式下测试模型泛化能力
  • 横向对比不同模型在各学科与难度级别的表现
  • 为教育、金融、医疗等行业应用评估领域知识

适合

  • 52 学科四难度级别,覆盖面与颗粒度俱佳
  • 客观选择题评分,横向对比可比性强
  • 学术背书强,社区认可度高,数据免费开放

先注意

  • 仅考察选择题形式的知识与推理
  • 无法衡量长文生成、对话与指令遵循能力
  • 高分可能受刷榜影响,需结合其他基准判断

如何使用C-Eval

  1. 通过 Hugging Face 加载或下载 ceval-exam 数据集
  2. 确定使用零样本还是少样本评估模式
  3. 加载待测模型与 tokenizer 准备推理
  4. 让模型回答全部选择题并收集输出
  5. 对照答案按学科与难度统计准确率

C-Eval的适用场景

上手难度: 高级

  • 对大模型进行中文多学科知识评测
  • 零样本或少样本模式下测试模型泛化能力
  • 横向对比不同模型在各学科与难度级别的表现
  • 为教育、金融、医疗等行业应用评估领域知识

常见问题

C-Eval 包含多少题目、覆盖哪些学科?

共 13948 道多项选择题,覆盖 52 个学科,横跨 STEM、社会科学与人文科学,分四个难度级别。

零样本和少样本测试有什么区别?

零样本不给任何示例直接作答,少样本提供少量示例引导;两者分别考察模型的裸考能力与引导下的表现。

C-Eval 收费吗?

不收费,数据集可通过 Hugging Face 免费公开下载,成本主要在自行评测的算力。

来源与核验

证据状态: 核验等级未记录

信息来源:cevalbenchmark.com (在新窗口打开)
资料复核日期: · 提交更正 →

类似于C-Eval的工具

该分类全部