Grok 4.6
Same $2 / $6 API price as Grok 4.5. xAI reports an Artificial Analysis Intelligence Index of 61 — tied with GPT-5.6 Sol Max, one point behind Fable 5 Max. Strong on knowledge-work evals; 26% on Terminal-Bench v3.
Read the Grok 4.6 briefingAIベンチマーク
A practical view of published model scores that helps you compare capability, category strengths, and run cost without losing the detail.
Latest benchmark & model updates
The leaderboard on this page is LiveBench's 25 June release, re-captured on 22 September 2026. It now includes Grok 4.7 xHigh and DeepSeek V4.1 Flash Max Effort. The model notes below are from the vendors' own pages, labelled as such.
Same $2 / $6 API price as Grok 4.5. xAI reports an Artificial Analysis Intelligence Index of 61 — tied with GPT-5.6 Sol Max, one point behind Fable 5 Max. Strong on knowledge-work evals; 26% on Terminal-Bench v3.
Read the Grok 4.6 briefingDeepSeek V4.1 Flash replaced V4 Flash on 10 Sep 2026 on the new deepseek-flash API id, at $0.15 / $0.60 per 1M tokens off-peak and $0.30 / $1.20 at peak. From 14 Sep, V4 Pro requests are routed to it too, so switch model ids now. LiveBench now scores V4.1 Flash Max Effort at 81.1 overall.
See it in the model trackerLeaderboard rows come only from published LiveBench data. We do not invent scores.
Best overall
Claude Fable 5.1 Max Effort leads this snapshot at 83.4 overall, $1.212 per successful task.
Best value per task
Union Alpha runs at $0.000 per successful task and still scores 76.1 overall.
Best open weights
DeepSeek V4.1 Flash Max Effort is the strongest open-weight model here at 81.1 overall — the option you can host yourself.
Best per capability
If your work is mostly one kind of task, these lead their category in this snapshot.
Every number above comes from the 2026-06-25 release dated 2026-06-25, published by a third-party benchmark and reproduced unaltered.
最初のチャートは「誰が最強か」に答えます。2番目は、実際にコストがかかる質問「どれに支払う価値があるか」に答えます。
長いほど良いです。バーは100点満点中の全体スコアを示し、各バーの横の数字は正確な値です。行を選択すると、そのモデルが下のコストチャートに反映されます。
上位12件(全54件)を表示中。すべてのモデルの完全な比較ビューに切り替えます。
上に行くほど強く、左に行くほど安い — つまり最良の買い物は左上に位置します。階段状の線は、それより安いものには負けないモデルをつないでいます。線より下のものは、より安い何かにスコアで負けています。
Selected
Claude Fable 5.1 Max Effort
Anthropic
#5 · 価値のフロンティア上。
Best buys (cheapest → strongest)
プロットにタブで移動し、矢印キーで最も安いモデルから最も高いモデルまで移動します。
| モデル | 組織 | 全体 | 成功タスクあたり |
|---|---|---|---|
| Claude Fable 5.1 Max Effort#5 · その価格で最高の価値 | Anthropic | 83.4 | $1.212 |
| Claude Fable 5 Max Effort | Anthropic | 83.0 | $1.439 |
| GPT-6 Astra Max Effort#4 · その価格で最高の価値 | OpenAI | 82.2 | $0.736 |
| Muse Spark 1.3 xHigh Effort#3 · その価格で最高の価値 | Meta | 81.6 | $0.219 |
| DeepSeek V4.1 Flash Max Effort#2 · その価格で最高の価値 | DeepSeek | 81.1 | $0.029 |
| GPT-5.6 Sol Max Effort | OpenAI | 81.0 | $0.515 |
| GPT-5.5 Thinking xHigh Effort | OpenAI | 80.2 | $0.435 |
| Claude 5 Opus Thinking Max Effort | Anthropic | 80.1 | $0.699 |
| Kimi K3 | Moonshot AI | 79.2 | $0.348 |
| Gemini 3.7 Flash High | 78.8 | $0.157 | |
| Qwen 3.8 Max | Alibaba | 78.5 | $0.275 |
| Grok 4.6 | xAI | 78.0 | $0.207 |
| Muse Spark 1.2 xHigh Effort | Meta | 78.0 | $0.375 |
| GPT-5.4 Thinking xHigh Effort | OpenAI | 78.0 | $0.387 |
| GPT-5.6 Terra Max Effort | OpenAI | 77.9 | $0.352 |
| DeepSeek V4 Pro 0813 | DeepSeek | 77.4 | $0.044 |
| Grok 4.7 xHigh | xAI | 77.4 | $0.718 |
| Gemini 3.1 Pro Preview High | 77.0 | $0.286 | |
| DeepSeek V4 Flash Vision Exp | DeepSeek | 76.8 | $0.051 |
| Claude 4.7 Opus Thinking xHigh Effort | Anthropic | 76.5 | $0.528 |
| Qwen 3.8 Flash Next | Alibaba | 76.2 | $0.042 |
| Claude 4.8 Opus Thinking Max Effort | Anthropic | 76.2 | $0.983 |
| GLM-5.3 | Z.AI | 76.1 | $0.450 |
| Claude Sonnet 5 xHigh Effort | Anthropic | 76.0 | $0.505 |
| Grok 4.5 | xAI | 75.8 | $0.131 |
| Gemini 3.8 Flash High | 75.8 | $0.307 | |
| Qwen3.8 27B | Alibaba | 75.3 | $0.094 |
| Muse Spark 1.1 xHigh Effort | Meta | 75.3 | $0.198 |
| GPT-5.2 High | OpenAI | 74.6 | $0.234 |
| Gemini 3.5 Flash High | 74.6 | $0.249 | |
| Claude 4.6 Opus Thinking High Effort | Anthropic | 74.5 | $0.404 |
| DeepSeek V4 Flash 0731 | DeepSeek | 74.2 | $0.060 |
| GPT-5.2 Codex | OpenAI | 74.0 | $0.187 |
| GPT-5.6 Luna Max Effort | OpenAI | 73.6 | $0.169 |
| Gemini 3.6 Flash High | 73.6 | $0.235 | |
| GLM-5.2 | Z.AI | 73.2 | $0.225 |
| Qwen 3.7 Max | Alibaba | 73.1 | $0.182 |
| Claude 4.6 Sonnet Thinking Medium Effort | Anthropic | 73.0 | $0.306 |
| Claude 4.5 Opus Thinking High Effort | Anthropic | 72.6 | $0.610 |
| Inkling xHigh Effort | Thinking Machines | 71.9 | $0.310 |
| GLM-5.3 Flash | Z.AI | 71.6 | $0.031 |
| Kimi K2.6 Thinking | Moonshot AI | 70.5 | $0.169 |
| GPT-5.4 Nano xHigh | OpenAI | 69.6 | $0.091 |
| Qwen 3.6 Plus | Alibaba | 68.9 | $0.227 |
| Kimi K2.7 Code | Moonshot AI | 68.4 | $0.100 |
| Grok Build 0.1#1 · その価格で最高の価値 | xAI | 67.8 | $0.024 |
| Nemotron 3 Ultra 550B A55B | NVIDIA | 67.4 | $0.371 |
| Minimax M3 | Minimax | 67.3 | $0.060 |
| GPT-5.4 Mini xHigh | OpenAI | 66.4 | $0.334 |
| Qwen 3.6 27B | Alibaba | 64.0 | $0.202 |
| Gemini 3.5 Flash-Lite High | 63.9 | $0.069 | |
| Grok 4.3 | xAI | 62.3 | $0.061 |
リーダーボードから最大3つのモデルを選んで、7つのカテゴリスコアを比較します。
各トラックは0から100までです。右に行くほど強く、太字の数字がその行のリーダーです。
| カテゴリ | Claude Fable 5.1 Max Effort | Union Alpha | DeepSeek V4.1 Flash Max Effort |
|---|---|---|---|
| 推論 | 91.7 | 80.8 | 86.7 |
| コーディング | 86.4 | 82.1 | 80.0 |
| エージェンティックコーディング | 66.1 | 54.7 | 77.3 |
| 数学 | 97.0 | 95.3 | 93.3 |
| データ分析 | 80.3 | 74.6 | 79.3 |
| 言語 | 89.5 | 85.9 | 81.2 |
| 指示追従 | 73.0 | 59.5 | 70.0 |
すべてのカテゴリを並べ替え、リストを絞り込み、モデルを開いて公開されたサブタスクの内訳を確認します。
Claude Fable 5.1 Max Effort
Anthropic
83.4
全体
$1.212
成功タスクあたり
Claude Fable 5 Max Effort
Anthropic
83.0
全体
$1.439
成功タスクあたり
GPT-6 Astra Max Effort
OpenAI
82.2
全体
$0.736
成功タスクあたり
Muse Spark 1.3 xHigh Effort
Meta
81.6
全体
$0.219
成功タスクあたり
DeepSeek V4.1 Flash Max Effort
オープンDeepSeek
81.1
全体
$0.029
成功タスクあたり
GPT-5.6 Sol Max Effort
OpenAI
81.0
全体
$0.515
成功タスクあたり
GPT-5.5 Thinking xHigh Effort
OpenAI
80.2
全体
$0.435
成功タスクあたり
Claude 5 Opus Thinking Max Effort
Anthropic
80.1
全体
$0.699
成功タスクあたり
Kimi K3
オープンMoonshot AI
79.2
全体
$0.348
成功タスクあたり
Gemini 3.7 Flash High
78.8
全体
$0.157
成功タスクあたり
Qwen 3.8 Max
オープンAlibaba
78.5
全体
$0.275
成功タスクあたり
Muse Spark 1.2 xHigh Effort
Meta
78.0
全体
$0.375
成功タスクあたり
GPT-5.4 Thinking xHigh Effort
OpenAI
78.0
全体
$0.387
成功タスクあたり
Grok 4.6
xAI
78.0
全体
$0.207
成功タスクあたり
GPT-5.6 Terra Max Effort
OpenAI
77.9
全体
$0.352
成功タスクあたり
DeepSeek V4 Pro 0813
オープンDeepSeek
77.4
全体
$0.044
成功タスクあたり
Grok 4.7 xHigh
xAI
77.4
全体
$0.718
成功タスクあたり
Gemini 3.1 Pro Preview High
77.0
全体
$0.286
成功タスクあたり
DeepSeek V4 Flash Vision Exp
オープンDeepSeek
76.8
全体
$0.051
成功タスクあたり
Claude 4.7 Opus Thinking xHigh Effort
Anthropic
76.5
全体
$0.528
成功タスクあたり
Qwen 3.8 Flash Next
オープンAlibaba
76.2
全体
$0.042
成功タスクあたり
Claude 4.8 Opus Thinking Max Effort
Anthropic
76.2
全体
$0.983
成功タスクあたり
GLM-5.3
オープンZ.AI
76.1
全体
$0.450
成功タスクあたり
Union Alpha
Stealth
76.1
全体
$0.000
成功タスクあたり
Claude Sonnet 5 xHigh Effort
Anthropic
76.0
全体
$0.505
成功タスクあたり
Gemini 3.8 Flash High
75.8
全体
$0.307
成功タスクあたり
Grok 4.5
xAI
75.8
全体
$0.131
成功タスクあたり
Qwen3.8 27B
オープンAlibaba
75.3
全体
$0.094
成功タスクあたり
Muse Spark 1.1 xHigh Effort
Meta
75.3
全体
$0.198
成功タスクあたり
GPT-5.2 High
OpenAI
74.6
全体
$0.234
成功タスクあたり
Gemini 3.5 Flash High
74.6
全体
$0.249
成功タスクあたり
Claude 4.6 Opus Thinking High Effort
Anthropic
74.5
全体
$0.404
成功タスクあたり
DeepSeek V4 Flash 0731
オープンDeepSeek
74.2
全体
$0.060
成功タスクあたり
GPT-5.2 Codex
OpenAI
74.0
全体
$0.187
成功タスクあたり
Gemini 3.6 Flash High
73.6
全体
$0.235
成功タスクあたり
GPT-5.6 Luna Max Effort
OpenAI
73.6
全体
$0.169
成功タスクあたり
GLM-5.2
オープンZ.AI
73.2
全体
$0.225
成功タスクあたり
Qwen 3.7 Max
Alibaba
73.1
全体
$0.182
成功タスクあたり
Claude 4.6 Sonnet Thinking Medium Effort
Anthropic
73.0
全体
$0.306
成功タスクあたり
Claude 4.5 Opus Thinking High Effort
Anthropic
72.6
全体
$0.610
成功タスクあたり
Inkling xHigh Effort
オープンThinking Machines
71.9
全体
$0.310
成功タスクあたり
GLM-5.3 Flash
オープンZ.AI
71.6
全体
$0.031
成功タスクあたり
Kimi K2.6 Thinking
オープンMoonshot AI
70.5
全体
$0.169
成功タスクあたり
GPT-5.4 Nano xHigh
OpenAI
69.6
全体
$0.091
成功タスクあたり
ox-alpha-max
Stealth
69.2
全体
$0.000
成功タスクあたり
Qwen 3.6 Plus
Alibaba
68.9
全体
$0.227
成功タスクあたり
Kimi K2.7 Code
オープンMoonshot AI
68.4
全体
$0.100
成功タスクあたり
Grok Build 0.1
xAI
67.8
全体
$0.024
成功タスクあたり
Nemotron 3 Ultra 550B A55B
オープンNVIDIA
67.4
全体
$0.371
成功タスクあたり
Minimax M3
Minimax
67.3
全体
$0.060
成功タスクあたり
GPT-5.4 Mini xHigh
OpenAI
66.4
全体
$0.334
成功タスクあたり
Qwen 3.6 27B
オープンAlibaba
64.0
全体
$0.202
成功タスクあたり
Gemini 3.5 Flash-Lite High
63.9
全体
$0.069
成功タスクあたり
Grok 4.3
xAI
62.3
全体
$0.061
成功タスクあたり
Cost is the source-provided cost-per-successful-task metric for the selected scope.
These scores say which model is strongest at a set of held-out tasks. They don’t say which one fits your workflow, your budget, or the tools you already pay for — and the cheapest model that clears your bar usually beats the highest scorer.
What changed recently
Dated releases from every major lab, with the vendor's own claims labelled as claims.
OpenWhat it costs to run
Our tool catalogue carries the price we last verified and the date we checked it.
OpenWhat to actually build
A deployment plan picks the stack for one workflow at your budget — models included.
Open