SuperCLUE
SuperCLUE 是中文通用大模型综合性测评基准,从四大能力象限十二项基础能力评估模型,主客观题结合,含中文特性与 AI Agent 评测,榜单每月更新,为研发与选型提供科学依据。
核验等级未记录 · · 提交更正
编辑点评
适合:中文大模型研发团队、选型企业与跟踪中文模型演进的研究者;不适合:只需客观选择题快速评分的极简场景。
决策信息
“未核验”表示证据不足,不表示该能力不存在。
SuperCLUE是什么
SuperCLUE 是中文通用大模型综合性测评基准,从四大能力象限十二项基础能力评估模型,主客观题结合,含中文特性与 AI Agent 评测,榜单每月更新,为研发与选型提供科学依据。
SuperCLUE的主要功能
- 评估模型在十二项中文能力维度上的表现
- 测试多轮对话连贯性与上下文理解
- 考察成语、诗词、方言等中文特性能力
- 评估 AI Agent 的工具使用与任务规划能力
适合
- 四象限十二能力,主客观题结合维度全面
- 中文特性考察深入,非翻译式评测
- 榜单月更并附技术报告,时效性强
先注意
- 送测机制下并非所有模型都有成绩
- 主观题评分稳定性需结合报告理解
- 送测合作与费用细节未公开
如何使用SuperCLUE
- 访问官网或 GitHub 阅读技术报告了解评测方法
- 确保模型可通过 API 与评测系统交互
- 通过 CLUEbenchmark 官方邮箱提交模型送测
- 在 SuperCLUE 榜单查看结果与排名
- 研读报告分析各能力项表现
SuperCLUE的适用场景
上手难度: 高级
- 评估模型在十二项中文能力维度上的表现
- 测试多轮对话连贯性与上下文理解
- 考察成语、诗词、方言等中文特性能力
- 评估 AI Agent 的工具使用与任务规划能力
常见问题
SuperCLUE 评估哪些能力?
四大象限十二项能力,涵盖语言理解与生成、知识应用、专业技能(含代码与 AI Agent)、环境适应与安全性,并含中文特性能力。
如何让自己的模型上榜?
通过 CLUEbenchmark 官方邮箱联系组织者提交模型信息,由其运行测试后公布结果。
榜单多久更新一次?
评测结果每月更新,并配套发布分析模型强弱项的技术报告。
来源与核验
证据状态: 核验等级未记录
信息来源:www.cluebenchmarks.com (在新窗口打开)
资料复核日期: · 提交更正 →