スコアリーダー
GPT-5.6 Sol · Max effort
82.4 · 全体
ソース属性付きのLiveBenchスコアビュー。詳細を失わずに能力、カテゴリの強み、実行コストを比較できます。
スコアリーダー
GPT-5.6 Sol · Max effort
82.4 · 全体
最低実行コスト
DeepSeek V4 Pro
$0.050 · 成功タスクあたり
トップオープンウェイト
Kimi K3
78.5 · 全体
すべてのカテゴリを並べ替え、リストを絞り込み、モデルを開いて公開されたサブタスクの内訳を確認します。
| モデル | 比較 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
コストは、選択されたLiveBenchスコープのソース提供の成功タスクあたりのコスト指標です。
スコアはコストとモデルのカテゴリプロファイルと共に明確になります。比較を使用してトレードオフを可視化します。
コストビュー
高いほど強い。低コストは左に位置します。ポイントはソース提供のコスト指標を使用します。
比較
リーダーボードから最大3つのモデルを選んで、7つのカテゴリスコアを比較します。
テーブルの比較ボタンを使用して最大3つのモデルを追加します。