AI搜索与研究
共 16 个工具(本页筛选范围内)。可按收费方式与使用方式筛选,并按访问量、收藏数或收录时间排序。
FlagEval
模型评测
智源开源评测平台,多维度模型能力榜单
4371浏览
491收藏
查看
AGI-Eval
模型评测
中文大模型评测社区,多维能力榜单持续更新
2195浏览
211收藏
查看
SWE-bench
模型评测
真实GitHub issue修复基准,编码能力试金石
1693浏览
161收藏
查看
Andi
AI搜索
对话式AI搜索,直出摘要结果并标注信源,无广告干扰
1675浏览
196收藏
查看
EQ-Bench
模型评测
情商与写作基准,专测模型表达细腻度
1617浏览
158收藏
查看
HELM
模型评测
斯坦福全景基准,透明评测主流大模型
1369浏览
112收藏
查看
OpenCompass
模型评测
上海AI实验室开源评测体系与司南榜单
1272浏览
142收藏
查看
C-Eval
模型评测
中文大模型考试基准,覆盖52个学科
1258浏览
111收藏
查看
Artificial Analysis
模型评测
独立评测机构,横向比较模型能力与API价格
1120浏览
109收藏
查看
Globe Explorer
AI搜索
输入问题自动生成带配图的研究报告与思维导图
1021浏览
118收藏
查看
Semantic Scholar
AI搜索
AI驱动的免费学术库,语义检索2亿+论文并自动生成摘要
967浏览
109收藏
查看
斯坦福AI指数
模型评测
年度AI指数报告,行业数据权威来源
963浏览
80收藏
查看
LiveBench
模型评测
持续换新题防数据污染,测模型真实上限
927浏览
110收藏
查看
Brave Search
AI搜索
独立索引的隐私搜索引擎,自带AI答案与代码检索
777浏览
73收藏
查看
SuperCLUE
模型评测
SuperCLUE 是国内专注于大语言模型评测的学术与产业结合的基准平台,由 CLUE(中文语言理解测评)团队发起并持续运营。它针对中文通用大模型的能力进行系统化评测,定期发布权威榜单与评测报告,为模型选型与技术发展提供参考依据。
平台的核心特色是覆盖多任务、多维度(如逻辑推理、代码、数学、长文本、安全性等)的中文评测体系,并结合客观指标与主观人类评估,形成细分榜单。适用于大模型研发团队了解能力短板、企业选型对比以及研究者跟踪国内模型发展水平,是中文 AI 生态中较有影响力的评测参考。
420浏览
30收藏
查看
Epoch AI
模型评测
前沿模型与算力趋势追踪,含FrontierMath基准
356浏览
31收藏
查看