使用文档
模型能力榜
按 Benchmark、价格和推理性能比较模型。
模型能力榜把 Benchmark 成绩、模型规格、价格和推理性能放在一个页面中,适合做模型初筛和成本对照。数据来自同步的 Vellum 快照,页面未配置数据服务时会显示不可用状态。
先选择 Benchmark
页面默认选择覆盖模型最多的 Benchmark。使用下拉框可以切换任务基准,排行榜会按当前基准重新排序;分数越高代表该基准上的表现越好,但不同 Benchmark 的分数不能直接横向相加。
图表怎么读
| 区域 | 用途 |
|---|---|
| Benchmark 排行 | 查看当前基准的模型名次和分数 |
| 能力覆盖热力图 | 查看模型在哪些基准有成绩,空白代表没有数据 |
| 价格 × 综合能力 | 对照每 1M 输入 + 1M 输出价格和平均能力 |
| 推理性能象限 | 比较延迟与生成速度,虚线表示样本中位数 |
| 模型榜单 | 查看完整条目并打开模型详情 |
点击图表中的模型可以加入对比。价格图支持切换综合平均或指定 Benchmark;综合平均要求模型至少覆盖多个基准,避免单个分数造成误判。
数据时间与刷新
页面会显示源页面更新时间和本次同步时间。点击「刷新」会从本站接口重新读取最新快照,不代表实时请求供应商或重新抓取外部页面。
价格是对照值,可能与供应商当前套餐、区域、缓存和批量折扣不同。模型能力榜适合缩小候选范围,最终选型还应结合自己的任务样本和实际成本。
常见问题
为什么有些模型没有排名? 该模型可能没有当前 Benchmark 的结果,或同步快照没有完整的模型映射。
价格越低就一定更好? 不是。价格图同时展示能力,应该结合任务质量、延迟、上下文长度和输出稳定性判断。
页面提示服务未配置怎么办? 需要在部署环境配置 Vellum 数据源;这不影响本地用量、表格、计算器和分词器功能。
