模型评测
共 8 个工具(本页筛选范围内)。可按收费方式与使用方式筛选,并按访问量、收藏数或收录时间排序。
SWE-bench
模型评测
真实GitHub issue修复基准,编码能力试金石
1693浏览
161收藏
查看
EQ-Bench
模型评测
情商与写作基准,专测模型表达细腻度
1617浏览
158收藏
查看
HELM
模型评测
斯坦福全景基准,透明评测主流大模型
1369浏览
112收藏
查看
C-Eval
模型评测
中文大模型考试基准,覆盖52个学科
1258浏览
111收藏
查看
Artificial Analysis
模型评测
独立评测机构,横向比较模型能力与API价格
1120浏览
109收藏
查看
斯坦福AI指数
模型评测
年度AI指数报告,行业数据权威来源
963浏览
80收藏
查看
LiveBench
模型评测
持续换新题防数据污染,测模型真实上限
927浏览
110收藏
查看
Epoch AI
模型评测
前沿模型与算力趋势追踪,含FrontierMath基准
356浏览
31收藏
查看