CLiB中文评测
中文语言理解测评基准,聚焦中文语义与知识能力
中文语言理解测评基准,聚焦中文语义与知识能力
上海AI实验室司南体系,提供大模型全维度开放评测
用持续更新的竞赛题评估模型真实编码能力
评估LLM在代码、游戏与网页环境中的Agent能力
以检索、推理与工具使用衡量通用AI助手能力
系统评估视频生成的动作、时序与画质表现
综合数学推理与视觉理解的多模态基准
Google的可验证指令遵循评测,减少主观裁判误差
以长度控制胜负率快速比较指令遵循模型
多轮问题加LLM裁判,评估对话与指令遵循能力
横向比较模型价格、速度、质量与上下文能力
盲测投票排行榜,反映真实用户对模型的偏好

Hugging Face Open LLM Leaderboard聚焦开源大模型,定期更新性能分数,便于选型参考。

MMLU以大规模多任务语言理解测试著称,覆盖数十个学科,是英文模型能力的重要标尺。

SuperCLUE是中文通用大模型综合评测基准,覆盖理解、生成、推理等能力并发布榜单。

H2O Elo评级机制给大模型打分,可输出相对排名,适合快速建立模型强弱的直观认识。

PubMedQA提供生物医学问答数据集和模型排行榜,便于横向比较模型在医学问答上的表现。

智源FlagEval(天秤)平台从多个维度评测模型,兼顾客观任务与开放问题。

复旦大学NLP实验室推出的LLMEval3,针对中文大模型能力设计评测任务与榜单。

C-Eval是全面的中文基础模型评估套件,侧重学科知识和综合理解能力的系统测试。

上海AI实验室的OpenCompass提供开放评测体系和模型榜单,支持复现与多维度横向比较。

CMMLU以中文基础模型评估为目标,覆盖多学科知识,是中文大模型综合能力常用基准。

斯坦福HELM强调多维度评测模型,同时考察准确性、鲁棒性、公平性、效率等,避免单分论英雄。

MMBench覆盖图像理解等多模态能力,包含中文题目,适合检验多模态模型的中文表现。

Chatbot Arena让用户盲选匿名模型回答,靠众包投票反映真实主观偏好,结果常被引用。