返回首页
Model intelligence

模型能力榜

把能力、价格和推理体验放在同一张地图里,快速找到更适合任务与预算的模型。

数据来源 Vellum 页面更新 未知同步 9月7日 10:15
Benchmark 排行
切换任务基准;点击柱条即可加入模型对比
分数越高越好
生成速度模拟
选择模型或自定义 token/s,观察同一段文本在不同速度下的生成耗时

请填写大于 0 的 token/s 后开始模拟。

Claude Fable 5.10 / 476 tokens
预计总耗时
已用时间
0s
状态
待开始
能力覆盖热力图
空白表示该模型没有对应成绩;点击任意格加入模型对比
价格 × 综合能力
价格为 1M 输入 + 1M 输出;平均分至少覆盖 3 项 Benchmark
价格越低、分数越高越好
推理性能象限
越靠左延迟越低,越靠上生成速度越快;虚线为样本中位数
模型榜单
按当前 Benchmark 分数排名;点击任意一行查看完整模型详情
排名模型Benchmark 分数
1
Claude Fable 5.1
65
2
Claude Mythos 5.1
65
3
Claude Opus 5
64.7
4
GPT-6 Astra
57.2
5
Kimi K3
56
6
GLM-5.3-Flash
55.3
7
GLM 5.2
54.7
8
DeepSeek V4 Flash
51.6
9
DeepSeek V4 Pro
48.2
10
GPT-5.6 Sol
47.2
11
Gemini 3.1 Pro
44.4
12
Gemini 3.5 Flash
40.2