分数领先者
GPT-5.6 Sol · Max effort
82.4 · 总体
分数领先者
GPT-5.6 Sol · Max effort
82.4 · 总体
最低运行成本
DeepSeek V4 Pro
$0.050 · 每次成功任务
顶级开源权重
Kimi K3
78.5 · 总体
对每个类别进行排序,缩小列表,并打开模型以查看其发布的子任务细分。
| 模型 | 比较 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
成本是所选LiveBench范围的来源提供的每次成功任务成本指标。
分数与成本和模型的类别概况一起看更清晰。使用比较功能可以保持权衡可见。
成本视图
越高越好。成本越低越靠左。点使用来源提供的成本指标。
比较
从排行榜中选择最多三个模型来比较它们的七个类别分数。
使用表格中的比较按钮添加最多三个模型。