已收录 891 个 AI 工具,覆盖 11 个大类 55 个子类,每日更新 查看最新收录 →

模型评测

共 15 个工具。可按收费方式与使用方式筛选,并按访问量、收藏数或收录时间排序。

广告
推广位招租 此位置用于投放广告,可在后台「广告管理」中配置图片、跳转链接与上下架时间。
广告合作
FlagEval 模型评测 智源开源评测平台,多维度模型能力榜单 4371浏览 491收藏 查看 AGI-Eval 模型评测 中文大模型评测社区,多维能力榜单持续更新 2195浏览 211收藏 查看 SWE-bench 模型评测 真实GitHub issue修复基准,编码能力试金石 1693浏览 161收藏 查看 EQ-Bench 模型评测 情商与写作基准,专测模型表达细腻度 1617浏览 158收藏 查看 DeepInfra 模型评测 低成本模型推理云,按 token 计费接主流模型 1588浏览 189收藏 查看
广告
推广位招租 此位置用于投放广告,可在后台「广告管理」中配置图片、跳转链接与上下架时间。
广告合作
Chatbot Arena 模型评测 Chatbot Arena 由 LMSYS Org(Large Model Systems Organization,加州大学伯克利分校等高校研究人员组成的研究组织)运营,是业界最具影响力的大模型评测平台之一,于 2023 年推出。它采用众包盲测的思路,让真实用户在匿名情况下同时向两个模型提问,再投票选出更好的回答。 基于大量真实对战数据,平台通过 Elo 等级分计算并实时发布大模型排行榜(Leaderboard),涵盖通用对话、编程、长上下文、视觉等多个维度。由于评测基于人类真实偏好而非固定题库,其榜单被业界公认为最贴近实际使用体验的权威参考之一,是选型时的重要依据。 1480浏览 132收藏 查看 HELM 模型评测 斯坦福全景基准,透明评测主流大模型 1369浏览 112收藏 查看 OpenCompass 模型评测 上海AI实验室开源评测体系与司南榜单 1272浏览 142收藏 查看 C-Eval 模型评测 中文大模型考试基准,覆盖52个学科 1258浏览 111收藏 查看 Artificial Analysis 模型评测 独立评测机构,横向比较模型能力与API价格 1120浏览 109收藏 查看 斯坦福AI指数 模型评测 年度AI指数报告,行业数据权威来源 963浏览 80收藏 查看 LiveBench 模型评测 持续换新题防数据污染,测模型真实上限 927浏览 110收藏 查看 SuperCLUE 模型评测 SuperCLUE 是国内专注于大语言模型评测的学术与产业结合的基准平台,由 CLUE(中文语言理解测评)团队发起并持续运营。它针对中文通用大模型的能力进行系统化评测,定期发布权威榜单与评测报告,为模型选型与技术发展提供参考依据。 平台的核心特色是覆盖多任务、多维度(如逻辑推理、代码、数学、长文本、安全性等)的中文评测体系,并结合客观指标与主观人类评估,形成细分榜单。适用于大模型研发团队了解能力短板、企业选型对比以及研究者跟踪国内模型发展水平,是中文 AI 生态中较有影响力的评测参考。 420浏览 30收藏 查看 Epoch AI 模型评测 前沿模型与算力趋势追踪,含FrontierMath基准 356浏览 31收藏 查看 LiteLLM 模型评测 统一多家模型 API 格式的网关库,换供应商不改代码 334浏览 35收藏 查看
提交工具 意见反馈