AI模型评测

A

AgentBench

AI模型评测

评估LLM在代码、游戏与网页环境中的Agent能力

开源英文
直达官网
G

GAIA

AI模型评测

以检索、推理与工具使用衡量通用AI助手能力

免费英文
直达官网
V

VBench

AI模型评测

系统评估视频生成的动作、时序与画质表现

开源英文
直达官网
M

MathVista

AI模型评测

综合数学推理与视觉理解的多模态基准

开源英文
直达官网
I

IFEval

AI模型评测

Google的可验证指令遵循评测,减少主观裁判误差

开源英文
直达官网
A

AlpacaEval

AI模型评测

以长度控制胜负率快速比较指令遵循模型

开源英文
直达官网
M

MT-Bench

AI模型评测

多轮问题加LLM裁判,评估对话与指令遵循能力

开源英文
直达官网
L

LM Arena

AI模型评测

盲测投票排行榜,反映真实用户对模型的偏好

免费英文
直达官网
Open LLM Leaderboard

Open LLM Leaderboard

AI模型评测

Hugging Face Open LLM Leaderboard聚焦开源大模型,定期更新性能分数,便于选型参考。

免费英文
直达官网
MMLU

MMLU

AI模型评测

MMLU以大规模多任务语言理解测试著称,覆盖数十个学科,是英文模型能力的重要标尺。

免费英文
直达官网
SuperCLUE

SuperCLUE

AI模型评测

SuperCLUE是中文通用大模型综合评测基准,覆盖理解、生成、推理等能力并发布榜单。

免费中文
直达官网
H2O EvalGPT

H2O EvalGPT

AI模型评测

H2O Elo评级机制给大模型打分,可输出相对排名,适合快速建立模型强弱的直观认识。

免费英文
直达官网
PubMedQA

PubMedQA

AI模型评测

PubMedQA提供生物医学问答数据集和模型排行榜,便于横向比较模型在医学问答上的表现。

免费英文
直达官网
FlagEval

FlagEval

AI模型评测

智源FlagEval(天秤)平台从多个维度评测模型,兼顾客观任务与开放问题。

免费中文
直达官网
LLMEval3

LLMEval3

AI模型评测

复旦大学NLP实验室推出的LLMEval3,针对中文大模型能力设计评测任务与榜单。

免费中文
直达官网
C-Eval

C-Eval

AI模型评测

C-Eval是全面的中文基础模型评估套件,侧重学科知识和综合理解能力的系统测试。

免费中文
直达官网
OpenCompass

OpenCompass

AI模型评测

上海AI实验室的OpenCompass提供开放评测体系和模型榜单,支持复现与多维度横向比较。

免费中文
直达官网
CMMLU

CMMLU

AI模型评测

CMMLU以中文基础模型评估为目标,覆盖多学科知识,是中文大模型综合能力常用基准。

免费中文
直达官网
HELM

HELM

AI模型评测

斯坦福HELM强调多维度评测模型,同时考察准确性、鲁棒性、公平性、效率等,避免单分论英雄。

免费英文
直达官网
MMBench

MMBench

AI模型评测

MMBench覆盖图像理解等多模态能力,包含中文题目,适合检验多模态模型的中文表现。

免费中文
直达官网
Chatbot Arena

Chatbot Arena

AI模型评测

Chatbot Arena让用户盲选匿名模型回答,靠众包投票反映真实主观偏好,结果常被引用。

免费英文
直达官网