EN 提交工具

SuperCLUE

SuperCLUE 是中文通用大模型综合性测评基准,从四大能力象限十二项基础能力评估模型,主客观题结合,含中文特性与 AI Agent 评测,榜单每月更新,为研发与选型提供科学依据。

人工核验 · · 提交更正

编辑点评

适合:中文大模型研发团队、选型企业与跟踪中文模型演进的研究者;不适合:只需客观选择题快速评分的极简场景。

核验信息

分类大模型
人工核验

SuperCLUE是什么

SuperCLUE 是中文通用大模型综合性测评基准,从四大能力象限十二项基础能力评估模型,主客观题结合,含中文特性与 AI Agent 评测,榜单每月更新,为研发与选型提供科学依据。

SuperCLUE的主要功能

  • 评估模型在十二项中文能力维度上的表现
  • 测试多轮对话连贯性与上下文理解
  • 考察成语、诗词、方言等中文特性能力
  • 评估 AI Agent 的工具使用与任务规划能力

适合

  • 四象限十二能力,主客观题结合维度全面
  • 中文特性考察深入,非翻译式评测
  • 榜单月更并附技术报告,时效性强

先注意

  • 送测机制下并非所有模型都有成绩
  • 主观题评分稳定性需结合报告理解
  • 送测合作与费用细节未公开

如何使用SuperCLUE

  1. 访问官网或 GitHub 阅读技术报告了解评测方法
  2. 确保模型可通过 API 与评测系统交互
  3. 通过 CLUEbenchmark 官方邮箱提交模型送测
  4. 在 SuperCLUE 榜单查看结果与排名
  5. 研读报告分析各能力项表现

SuperCLUE的适用场景

上手难度: 高级

  • 评估模型在十二项中文能力维度上的表现
  • 测试多轮对话连贯性与上下文理解
  • 考察成语、诗词、方言等中文特性能力
  • 评估 AI Agent 的工具使用与任务规划能力

常见问题

SuperCLUE 评估哪些能力?

四大象限十二项能力,涵盖语言理解与生成、知识应用、专业技能(含代码与 AI Agent)、环境适应与安全性,并含中文特性能力。

如何让自己的模型上榜?

通过 CLUEbenchmark 官方邮箱联系组织者提交模型信息,由其运行测试后公布结果。

榜单多久更新一次?

评测结果每月更新,并配套发布分析模型强弱项的技术报告。

来源与核验

信息来源:www.cluebenchmarks.com (在新窗口打开)
核验日期: · 提交更正 →

类似于SuperCLUE的工具

该分类全部