返回首页
← 全部文档

使用文档

模型能力榜

按 Benchmark、价格和推理性能比较模型。

模型能力榜把 Benchmark 成绩、模型规格、价格和推理性能放在一个页面中,适合做模型初筛和成本对照。数据来自同步的 Vellum 快照,页面未配置数据服务时会显示不可用状态。

先选择 Benchmark

页面默认选择覆盖模型最多的 Benchmark。使用下拉框可以切换任务基准,排行榜会按当前基准重新排序;分数越高代表该基准上的表现越好,但不同 Benchmark 的分数不能直接横向相加。

图表怎么读

区域用途
Benchmark 排行查看当前基准的模型名次和分数
能力覆盖热力图查看模型在哪些基准有成绩,空白代表没有数据
价格 × 综合能力对照每 1M 输入 + 1M 输出价格和平均能力
推理性能象限比较延迟与生成速度,虚线表示样本中位数
模型榜单查看完整条目并打开模型详情

点击图表中的模型可以加入对比。价格图支持切换综合平均或指定 Benchmark;综合平均要求模型至少覆盖多个基准,避免单个分数造成误判。

数据时间与刷新

页面会显示源页面更新时间和本次同步时间。点击「刷新」会从本站接口重新读取最新快照,不代表实时请求供应商或重新抓取外部页面。

价格是对照值,可能与供应商当前套餐、区域、缓存和批量折扣不同。模型能力榜适合缩小候选范围,最终选型还应结合自己的任务样本和实际成本。

常见问题

为什么有些模型没有排名? 该模型可能没有当前 Benchmark 的结果,或同步快照没有完整的模型映射。

价格越低就一定更好? 不是。价格图同时展示能力,应该结合任务质量、延迟、上下文长度和输出稳定性判断。

页面提示服务未配置怎么办? 需要在部署环境配置 Vellum 数据源;这不影响本地用量、表格、计算器和分词器功能。