SuperCLUE
SuperCLUE 是中文通用大模型综合性测评基准,从四大能力象限十二项基础能力评估模型,主客观题结合,含中文特性与 AI Agent 评测,榜单每月更新,为研发与选型提供科学依据。
人工核验 · · 提交更正
编辑点评
适合:中文大模型研发团队、选型企业与跟踪中文模型演进的研究者;不适合:只需客观选择题快速评分的极简场景。
核验信息
分类大模型
人工核验
SuperCLUE是什么
SuperCLUE 是中文通用大模型综合性测评基准,从四大能力象限十二项基础能力评估模型,主客观题结合,含中文特性与 AI Agent 评测,榜单每月更新,为研发与选型提供科学依据。
SuperCLUE的主要功能
- 评估模型在十二项中文能力维度上的表现
- 测试多轮对话连贯性与上下文理解
- 考察成语、诗词、方言等中文特性能力
- 评估 AI Agent 的工具使用与任务规划能力
适合
- 四象限十二能力,主客观题结合维度全面
- 中文特性考察深入,非翻译式评测
- 榜单月更并附技术报告,时效性强
先注意
- 送测机制下并非所有模型都有成绩
- 主观题评分稳定性需结合报告理解
- 送测合作与费用细节未公开
如何使用SuperCLUE
- 访问官网或 GitHub 阅读技术报告了解评测方法
- 确保模型可通过 API 与评测系统交互
- 通过 CLUEbenchmark 官方邮箱提交模型送测
- 在 SuperCLUE 榜单查看结果与排名
- 研读报告分析各能力项表现
SuperCLUE的适用场景
上手难度: 高级
- 评估模型在十二项中文能力维度上的表现
- 测试多轮对话连贯性与上下文理解
- 考察成语、诗词、方言等中文特性能力
- 评估 AI Agent 的工具使用与任务规划能力
常见问题
SuperCLUE 评估哪些能力?
四大象限十二项能力,涵盖语言理解与生成、知识应用、专业技能(含代码与 AI Agent)、环境适应与安全性,并含中文特性能力。
如何让自己的模型上榜?
通过 CLUEbenchmark 官方邮箱联系组织者提交模型信息,由其运行测试后公布结果。
榜单多久更新一次?
评测结果每月更新,并配套发布分析模型强弱项的技术报告。
来源与核验
信息来源:www.cluebenchmarks.com (在新窗口打开)
核验日期: · 提交更正 →
类似于SuperCLUE的工具
该分类全部
MMLU
适合:需要衡量英文模型通用知识水平的研究者与选型工程师;不适合:评估生成质量、对话体验或中文能力的场景。
Watsonx.ai
适合需要全生命周期管理、企业级治理与合规要求的中大型企业与开发团队;不适合个人开发者、轻量实验或预算敏感的小型项目。
DeepFloyd IF
适合有一定技术基础、希望自托管和深入研究图像生成模型的开发者与研究人员;不适合只想在网页上输入提示词直接出图的普通用户。
HELM
适合需要多维、可复现评估语言模型的研究者与工程团队;不适合只想快速浏览单一榜单分数的用户。
PaLM 2
适合AI开发者、研究者和Google生态内的企业团队;不适合寻求开箱即用消费级聊天产品的普通用户。