Grok 4.6
Same $2 / $6 API price as Grok 4.5. xAI reports an Artificial Analysis Intelligence Index of 61 — tied with GPT-5.6 Sol Max, one point behind Fable 5 Max. Strong on knowledge-work evals; 26% on Terminal-Bench v3.
Read the Grok 4.6 briefingمعايير الذكاء الاصطناعي
A practical view of published model scores that helps you compare capability, category strengths, and run cost without losing the detail.
Latest benchmark & model updates
The leaderboard on this page is LiveBench's 25 June release, re-captured on 22 September 2026. It now includes Grok 4.7 xHigh and DeepSeek V4.1 Flash Max Effort. The model notes below are from the vendors' own pages, labelled as such.
Same $2 / $6 API price as Grok 4.5. xAI reports an Artificial Analysis Intelligence Index of 61 — tied with GPT-5.6 Sol Max, one point behind Fable 5 Max. Strong on knowledge-work evals; 26% on Terminal-Bench v3.
Read the Grok 4.6 briefingDeepSeek V4.1 Flash replaced V4 Flash on 10 Sep 2026 on the new deepseek-flash API id, at $0.15 / $0.60 per 1M tokens off-peak and $0.30 / $1.20 at peak. From 14 Sep, V4 Pro requests are routed to it too, so switch model ids now. LiveBench now scores V4.1 Flash Max Effort at 81.1 overall.
See it in the model trackerLeaderboard rows come only from published LiveBench data. We do not invent scores.
Best overall
Claude Fable 5.1 Max Effort leads this snapshot at 83.4 overall, $1.212 per successful task.
Best value per task
Union Alpha runs at $0.000 per successful task and still scores 76.1 overall.
Best open weights
DeepSeek V4.1 Flash Max Effort is the strongest open-weight model here at 81.1 overall — the option you can host yourself.
Best per capability
If your work is mostly one kind of task, these lead their category in this snapshot.
Every number above comes from the 2026-06-25 release dated 2026-06-25, published by a third-party benchmark and reproduced unaltered.
الرسم البياني الأول يجيب عن «من هو الأقوى». أما الثاني فيجيب عن السؤال الذي يكلفك المال فعليًا: أيّ منها يستحق أن تدفع مقابله؟
الأطول أفضل. الأعمدة تُظهر درجة الإجمالي من 100؛ الرقم بجانب كل عمود هو القيمة الدقيقة. حدد صفًا لنقل هذا النموذج إلى مخطط التكلفة أدناه.
عرض أفضل 12 من أصل 54. انتقل إلى عرض المقارنة الكامل لكل نموذج.
الأعلى أقوى، والأيسر أرخص — لذا أفضل الخيارات تكون في أعلى اليسار. الخط المتدرج يربط النماذج التي لا يتفوق عليها أي خيار أرخص؛ أي شيء أسفل هذا الخط يتفوق عليه خيار أقل تكلفة.
Selected
Claude Fable 5.1 Max Effort
Anthropic
#5 · على حدود القيمة.
Best buys (cheapest → strongest)
انتقل بالتبويب إلى الرسم البياني، ثم استخدم مفاتيح الأسهم للتنقل بين النماذج من الأرخص إلى الأغلى.
| النموذج | المنظمة | الإجمالي | لكل مهمة ناجحة |
|---|---|---|---|
| Claude Fable 5.1 Max Effort#5 · أفضل قيمة بسعرها | Anthropic | 83.4 | 1.212 US$ |
| Claude Fable 5 Max Effort | Anthropic | 83.0 | 1.439 US$ |
| GPT-6 Astra Max Effort#4 · أفضل قيمة بسعرها | OpenAI | 82.2 | 0.736 US$ |
| Muse Spark 1.3 xHigh Effort#3 · أفضل قيمة بسعرها | Meta | 81.6 | 0.219 US$ |
| DeepSeek V4.1 Flash Max Effort#2 · أفضل قيمة بسعرها | DeepSeek | 81.1 | 0.029 US$ |
| GPT-5.6 Sol Max Effort | OpenAI | 81.0 | 0.515 US$ |
| GPT-5.5 Thinking xHigh Effort | OpenAI | 80.2 | 0.435 US$ |
| Claude 5 Opus Thinking Max Effort | Anthropic | 80.1 | 0.699 US$ |
| Kimi K3 | Moonshot AI | 79.2 | 0.348 US$ |
| Gemini 3.7 Flash High | 78.8 | 0.157 US$ | |
| Qwen 3.8 Max | Alibaba | 78.5 | 0.275 US$ |
| Grok 4.6 | xAI | 78.0 | 0.207 US$ |
| Muse Spark 1.2 xHigh Effort | Meta | 78.0 | 0.375 US$ |
| GPT-5.4 Thinking xHigh Effort | OpenAI | 78.0 | 0.387 US$ |
| GPT-5.6 Terra Max Effort | OpenAI | 77.9 | 0.352 US$ |
| DeepSeek V4 Pro 0813 | DeepSeek | 77.4 | 0.044 US$ |
| Grok 4.7 xHigh | xAI | 77.4 | 0.718 US$ |
| Gemini 3.1 Pro Preview High | 77.0 | 0.286 US$ | |
| DeepSeek V4 Flash Vision Exp | DeepSeek | 76.8 | 0.051 US$ |
| Claude 4.7 Opus Thinking xHigh Effort | Anthropic | 76.5 | 0.528 US$ |
| Qwen 3.8 Flash Next | Alibaba | 76.2 | 0.042 US$ |
| Claude 4.8 Opus Thinking Max Effort | Anthropic | 76.2 | 0.983 US$ |
| GLM-5.3 | Z.AI | 76.1 | 0.450 US$ |
| Claude Sonnet 5 xHigh Effort | Anthropic | 76.0 | 0.505 US$ |
| Grok 4.5 | xAI | 75.8 | 0.131 US$ |
| Gemini 3.8 Flash High | 75.8 | 0.307 US$ | |
| Qwen3.8 27B | Alibaba | 75.3 | 0.094 US$ |
| Muse Spark 1.1 xHigh Effort | Meta | 75.3 | 0.198 US$ |
| GPT-5.2 High | OpenAI | 74.6 | 0.234 US$ |
| Gemini 3.5 Flash High | 74.6 | 0.249 US$ | |
| Claude 4.6 Opus Thinking High Effort | Anthropic | 74.5 | 0.404 US$ |
| DeepSeek V4 Flash 0731 | DeepSeek | 74.2 | 0.060 US$ |
| GPT-5.2 Codex | OpenAI | 74.0 | 0.187 US$ |
| GPT-5.6 Luna Max Effort | OpenAI | 73.6 | 0.169 US$ |
| Gemini 3.6 Flash High | 73.6 | 0.235 US$ | |
| GLM-5.2 | Z.AI | 73.2 | 0.225 US$ |
| Qwen 3.7 Max | Alibaba | 73.1 | 0.182 US$ |
| Claude 4.6 Sonnet Thinking Medium Effort | Anthropic | 73.0 | 0.306 US$ |
| Claude 4.5 Opus Thinking High Effort | Anthropic | 72.6 | 0.610 US$ |
| Inkling xHigh Effort | Thinking Machines | 71.9 | 0.310 US$ |
| GLM-5.3 Flash | Z.AI | 71.6 | 0.031 US$ |
| Kimi K2.6 Thinking | Moonshot AI | 70.5 | 0.169 US$ |
| GPT-5.4 Nano xHigh | OpenAI | 69.6 | 0.091 US$ |
| Qwen 3.6 Plus | Alibaba | 68.9 | 0.227 US$ |
| Kimi K2.7 Code | Moonshot AI | 68.4 | 0.100 US$ |
| Grok Build 0.1#1 · أفضل قيمة بسعرها | xAI | 67.8 | 0.024 US$ |
| Nemotron 3 Ultra 550B A55B | NVIDIA | 67.4 | 0.371 US$ |
| Minimax M3 | Minimax | 67.3 | 0.060 US$ |
| GPT-5.4 Mini xHigh | OpenAI | 66.4 | 0.334 US$ |
| Qwen 3.6 27B | Alibaba | 64.0 | 0.202 US$ |
| Gemini 3.5 Flash-Lite High | 63.9 | 0.069 US$ | |
| Grok 4.3 | xAI | 62.3 | 0.061 US$ |
اختر ما يصل إلى ثلاثة نماذج من لوحة المتصدرة لمقارنة نتائجها في الفئات السبع.
كل مسار يتراوح من 0 إلى 100. كلما اتجهت لليمين كان أقوى؛ الرقم بالخط العريض هو الرائد في هذا الصف.
| الفئة | Claude Fable 5.1 Max Effort | Union Alpha | DeepSeek V4.1 Flash Max Effort |
|---|---|---|---|
| الاستدلال | 91.7 | 80.8 | 86.7 |
| البرمجة | 86.4 | 82.1 | 80.0 |
| البرمجة الوكيلية | 66.1 | 54.7 | 77.3 |
| الرياضيات | 97.0 | 95.3 | 93.3 |
| تحليل البيانات | 80.3 | 74.6 | 79.3 |
| اللغة | 89.5 | 85.9 | 81.2 |
| اتباع التعليمات | 73.0 | 59.5 | 70.0 |
فرز كل فئة، تضييق القائمة، وافتح نموذجًا لرؤية تحليل مهامه الفرعية المنشورة.
Claude Fable 5.1 Max Effort
Anthropic
83.4
الإجمالي
1.212 US$
لكل مهمة ناجحة
Claude Fable 5 Max Effort
Anthropic
83.0
الإجمالي
1.439 US$
لكل مهمة ناجحة
GPT-6 Astra Max Effort
OpenAI
82.2
الإجمالي
0.736 US$
لكل مهمة ناجحة
Muse Spark 1.3 xHigh Effort
Meta
81.6
الإجمالي
0.219 US$
لكل مهمة ناجحة
DeepSeek V4.1 Flash Max Effort
مفتوحDeepSeek
81.1
الإجمالي
0.029 US$
لكل مهمة ناجحة
GPT-5.6 Sol Max Effort
OpenAI
81.0
الإجمالي
0.515 US$
لكل مهمة ناجحة
GPT-5.5 Thinking xHigh Effort
OpenAI
80.2
الإجمالي
0.435 US$
لكل مهمة ناجحة
Claude 5 Opus Thinking Max Effort
Anthropic
80.1
الإجمالي
0.699 US$
لكل مهمة ناجحة
Kimi K3
مفتوحMoonshot AI
79.2
الإجمالي
0.348 US$
لكل مهمة ناجحة
Gemini 3.7 Flash High
78.8
الإجمالي
0.157 US$
لكل مهمة ناجحة
Qwen 3.8 Max
مفتوحAlibaba
78.5
الإجمالي
0.275 US$
لكل مهمة ناجحة
Muse Spark 1.2 xHigh Effort
Meta
78.0
الإجمالي
0.375 US$
لكل مهمة ناجحة
GPT-5.4 Thinking xHigh Effort
OpenAI
78.0
الإجمالي
0.387 US$
لكل مهمة ناجحة
Grok 4.6
xAI
78.0
الإجمالي
0.207 US$
لكل مهمة ناجحة
GPT-5.6 Terra Max Effort
OpenAI
77.9
الإجمالي
0.352 US$
لكل مهمة ناجحة
DeepSeek V4 Pro 0813
مفتوحDeepSeek
77.4
الإجمالي
0.044 US$
لكل مهمة ناجحة
Grok 4.7 xHigh
xAI
77.4
الإجمالي
0.718 US$
لكل مهمة ناجحة
Gemini 3.1 Pro Preview High
77.0
الإجمالي
0.286 US$
لكل مهمة ناجحة
DeepSeek V4 Flash Vision Exp
مفتوحDeepSeek
76.8
الإجمالي
0.051 US$
لكل مهمة ناجحة
Claude 4.7 Opus Thinking xHigh Effort
Anthropic
76.5
الإجمالي
0.528 US$
لكل مهمة ناجحة
Qwen 3.8 Flash Next
مفتوحAlibaba
76.2
الإجمالي
0.042 US$
لكل مهمة ناجحة
Claude 4.8 Opus Thinking Max Effort
Anthropic
76.2
الإجمالي
0.983 US$
لكل مهمة ناجحة
GLM-5.3
مفتوحZ.AI
76.1
الإجمالي
0.450 US$
لكل مهمة ناجحة
Union Alpha
Stealth
76.1
الإجمالي
0.000 US$
لكل مهمة ناجحة
Claude Sonnet 5 xHigh Effort
Anthropic
76.0
الإجمالي
0.505 US$
لكل مهمة ناجحة
Gemini 3.8 Flash High
75.8
الإجمالي
0.307 US$
لكل مهمة ناجحة
Grok 4.5
xAI
75.8
الإجمالي
0.131 US$
لكل مهمة ناجحة
Qwen3.8 27B
مفتوحAlibaba
75.3
الإجمالي
0.094 US$
لكل مهمة ناجحة
Muse Spark 1.1 xHigh Effort
Meta
75.3
الإجمالي
0.198 US$
لكل مهمة ناجحة
GPT-5.2 High
OpenAI
74.6
الإجمالي
0.234 US$
لكل مهمة ناجحة
Gemini 3.5 Flash High
74.6
الإجمالي
0.249 US$
لكل مهمة ناجحة
Claude 4.6 Opus Thinking High Effort
Anthropic
74.5
الإجمالي
0.404 US$
لكل مهمة ناجحة
DeepSeek V4 Flash 0731
مفتوحDeepSeek
74.2
الإجمالي
0.060 US$
لكل مهمة ناجحة
GPT-5.2 Codex
OpenAI
74.0
الإجمالي
0.187 US$
لكل مهمة ناجحة
Gemini 3.6 Flash High
73.6
الإجمالي
0.235 US$
لكل مهمة ناجحة
GPT-5.6 Luna Max Effort
OpenAI
73.6
الإجمالي
0.169 US$
لكل مهمة ناجحة
GLM-5.2
مفتوحZ.AI
73.2
الإجمالي
0.225 US$
لكل مهمة ناجحة
Qwen 3.7 Max
Alibaba
73.1
الإجمالي
0.182 US$
لكل مهمة ناجحة
Claude 4.6 Sonnet Thinking Medium Effort
Anthropic
73.0
الإجمالي
0.306 US$
لكل مهمة ناجحة
Claude 4.5 Opus Thinking High Effort
Anthropic
72.6
الإجمالي
0.610 US$
لكل مهمة ناجحة
Inkling xHigh Effort
مفتوحThinking Machines
71.9
الإجمالي
0.310 US$
لكل مهمة ناجحة
GLM-5.3 Flash
مفتوحZ.AI
71.6
الإجمالي
0.031 US$
لكل مهمة ناجحة
Kimi K2.6 Thinking
مفتوحMoonshot AI
70.5
الإجمالي
0.169 US$
لكل مهمة ناجحة
GPT-5.4 Nano xHigh
OpenAI
69.6
الإجمالي
0.091 US$
لكل مهمة ناجحة
ox-alpha-max
Stealth
69.2
الإجمالي
0.000 US$
لكل مهمة ناجحة
Qwen 3.6 Plus
Alibaba
68.9
الإجمالي
0.227 US$
لكل مهمة ناجحة
Kimi K2.7 Code
مفتوحMoonshot AI
68.4
الإجمالي
0.100 US$
لكل مهمة ناجحة
Grok Build 0.1
xAI
67.8
الإجمالي
0.024 US$
لكل مهمة ناجحة
Nemotron 3 Ultra 550B A55B
مفتوحNVIDIA
67.4
الإجمالي
0.371 US$
لكل مهمة ناجحة
Minimax M3
Minimax
67.3
الإجمالي
0.060 US$
لكل مهمة ناجحة
GPT-5.4 Mini xHigh
OpenAI
66.4
الإجمالي
0.334 US$
لكل مهمة ناجحة
Qwen 3.6 27B
مفتوحAlibaba
64.0
الإجمالي
0.202 US$
لكل مهمة ناجحة
Gemini 3.5 Flash-Lite High
63.9
الإجمالي
0.069 US$
لكل مهمة ناجحة
Grok 4.3
xAI
62.3
الإجمالي
0.061 US$
لكل مهمة ناجحة
Cost is the source-provided cost-per-successful-task metric for the selected scope.
These scores say which model is strongest at a set of held-out tasks. They don’t say which one fits your workflow, your budget, or the tools you already pay for — and the cheapest model that clears your bar usually beats the highest scorer.
What changed recently
Dated releases from every major lab, with the vendor's own claims labelled as claims.
OpenWhat it costs to run
Our tool catalogue carries the price we last verified and the date we checked it.
OpenWhat to actually build
A deployment plan picks the stack for one workflow at your budget — models included.
Open