模型评测与基准

发现优质的模型评测与基准工具,基于用户评价、使用数据与活跃度综合排序。

热门推荐 16 款

MLflow

MLflow

免费

MLflow 是面向 Agent、LLM 和 ML 模型的开源 AI 工程平台,帮助各规模团队调试、评估、监控并优化生产级 AI 应用。

5 模型评测与基准
2
PromptPilot

PromptPilot

专为大模型开发,PromptPilot为你提供更精准,专业,可持续迭代提示词! PromptPilot 是一款面向大模型应用的全链路优化平台,覆盖大模型开发从构想、开发部署到迭代优化的全过程。平台提供从创意落地的 Prompt 生成,到基于用户意图与评测数据的智能调优能力,确保大模型输出更贴合真实业务需求。通过 API 接入,用户可低成本获取高质量的实时反馈数据,自动优化 Prompt,构建AI应用与真实数据间的反馈闭环。

4 模型评测与基准
3
SuperCLUE

SuperCLUE

中文AI基准测试平台,提供多维度模型能力评估与排行榜,帮助开发者对比选择合适的大语言模型。

4 模型评测与基准
4
Helm Lite

Helm Lite

HELM(语言模型整体评估)是语言模型透明度的活态基准,覆盖广泛、承认不完整性,采用多指标测量与标准化方案。

4 模型评测与基准
5
MagicArena

MagicArena

MagicArena 是国内首家视觉大模型公开对战平台。免费一站式对比不同模型的生成效果,覆盖图片生成、视频的所有头部模型,Midjourney、FLUX、可灵、海螺、即梦等应有尽有,参与对战即可获得自己的专属大模型排行榜,快来体验吧!

4 模型评测与基准
6
HELM

HELM

免费

CRFM 开发的用于全面评估语言模型的基准测试框架

4 模型评测与基准
7
AGI-Eval评测社区

AGI-Eval评测社区

【分类:模型、提示词与学习资源】AGI-Eval评测社区主要用于查找、使用或管理大模型资源,适合需要模型、提示词和学习资源能力的用户使用。

3 模型评测与基准
8
MMBench

MMBench

MMBench 是一个多模态模型评测基准,覆盖20+能力维度,用于客观对比和评估视觉语言模型的综合表现。

3 模型评测与基准
9
terminal-bench

terminal-bench

免费

面向终端复杂任务的 LLM 基准测试平台

3 模型评测与基准
10
Evidently AI

Evidently AI

Evidently AI 助你确保 AI 生产就绪,可测试 LLM 并监控 AI 应用、RAG 系统与多智能体工作流的性能,开源可用。

2 模型评测与基准
11
MMLU

MMLU

MMLU提供覆盖57个学科的多任务语言理解基准测试,用于评估和对比大模型在广泛知识领域的综合表现,是衡量模型泛化能力的重要参考标准。

2 模型评测与基准
12
FlagEval

FlagEval

FlagEval大模型评测平台,提供多维度能力基准测试与榜单对比,辅助模型选型与迭代优化。

2 模型评测与基准
13
LMArena

LMArena

【分类:模型、提示词与学习资源】LMArena是一款面向模型、提示词和学习资源场景的 AI 工具,可帮助用户评估模型能力并对比测试结果。

2 模型评测与基准
14
AI Ping

AI Ping

AI Ping 是面向大模型使用者,提供全面、客观、真实的大模型服务评测与信息汇总平台。提供长周期、高频率、多时段评测数据,助力您高效完成大模型服务的选型与服务商评估。

2 模型评测与基准
15
OpenCompass

OpenCompass

评测榜单旨在为大语言模型和多模态模型提供全面、客观且中立的得分与排名,同时提供多能力维度的评分参考,以便用户能够更全面地了解大模型的能力水平。

2 模型评测与基准
16
Revalvo

Revalvo

Revalvo 是一个 AI 提示词统一执行与评分平台,支持在多个大模型上同时运行同一提示词,自动评分并对比版本,帮助用户快速找到最优模型与提示词方案。

模型评测与基准
已显示全部 16 款