مرکزی مواد پر جائیں

AI بینچ مارکس

AI ماڈلز، معیار اور لاگت پر موازنہ۔

شائع شدہ ماڈل اسکورز کا عملی جائزہ جو تفصیل کھوئے بغیر صلاحیت، زمرہ وار خوبیوں اور چلانے کی لاگت کا موازنہ کرنے میں مدد دیتا ہے۔

لیڈر بورڈ دیکھیںبینچ مارک کا ماخذ تازہ ترین منتخب ریلیز · 25 جون، 2026

تازہ ترین بینچ مارک اور ماڈل اپ ڈیٹس

اس صفحے کا لیڈر بورڈ LiveBench کی 25 جون کی ریلیز ہے، 22 ستمبر 2026 کو دوبارہ حاصل کی گئی۔ اس میں اب Grok 4.7 xHigh اور DeepSeek V4.1 Flash Max Effort شامل ہیں۔ نیچے ماڈل کے نوٹس وینڈرز کے اپنے صفحات سے ہیں، اسی لیبل کے ساتھ۔

Grok 4.6

Grok 4.5 جیسی ہی $2 / $6 API قیمت۔ xAI کے مطابق Artificial Analysis Intelligence Index پر 61 — GPT-5.6 Sol Max کے برابر، Fable 5 Max سے ایک پوائنٹ پیچھے۔ علمی کام کی جانچ میں مضبوط؛ Terminal-Bench v3 پر 26%۔

Grok 4.6 بریفنگ پڑھیں

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash نے 10 ستمبر 2026 کو نئے deepseek-flash API id پر V4 Flash کی جگہ لی، آف پیک $0.15 / $0.60 اور پیک پر $0.30 / $1.20 فی 1M ٹوکنز۔ 14 ستمبر سے V4 Pro کی درخواستیں بھی اسی کی طرف بھیجی جاتی ہیں، اس لیے ابھی ماڈل ids بدل لیں۔ LiveBench اب V4.1 Flash Max Effort کو مجموعی طور پر 81.1 اسکور دیتا ہے۔

اسے ماڈل ٹریکر میں دیکھیں

لیڈر بورڈ کی قطاریں صرف شائع شدہ LiveBench ڈیٹا سے آتی ہیں۔ ہم اسکورز گھڑتے نہیں۔

Best overall

Claude Fable 5.1 Max Effort leads this snapshot at 83.4 overall, $1.212 per successful task.

Best value per task

ox-alpha-max runs at $0.000 per successful task and still scores 69.2 overall.

Best open weights

DeepSeek V4.1 Flash Max Effort is the strongest open-weight model here at 81.1 overall — the option you can host yourself.

Best per capability

If your work is mostly one kind of task, these lead their category in this snapshot.

استدلال
GPT-6 Astra Max Effort 92.7
کوڈنگ
Claude 5.5 Opus Thinking Max Effort 89.3
ایجنٹک کوڈنگ
DeepSeek V4.1 Flash Max Effort 77.3
ریاضی
Claude 5.5 Opus Thinking Max Effort 97.1
ڈیٹا کا تجزیہ
GPT-6 Astra Max Effort 83.0
زبان
Claude Fable 5 Max Effort 90.7
ہدایات پر عمل
Gemini 3.8 Flash High 81.4

Every number above comes from the 2026-06-25 release dated 2026-06-25, published by a third-party benchmark and reproduced unaltered.

میدان کی شکل، دو تصویروں میں۔

پہلا چارٹ بتاتا ہے کہ “سب سے مضبوط کون ہے”۔ دوسرا اس سوال کا جواب دیتا ہے جس پر آپ کا پیسہ لگتا ہے: ان میں سے کس کی ادائیگی کرنا فائدہ مند ہے۔

ان کی درجہ بندی

لمبا بہتر ہے۔ بارز 100 میں سے مجموعی اسکور دکھاتی ہیں؛ ہر بار کے ساتھ والا عدد درست قدر ہے۔ کسی قطار کو منتخب کریں تاکہ وہ ماڈل نیچے لاگت کے چارٹ میں آ جائے۔

58 میں سے سرفہرست 12 دکھائے جا رہے ہیں۔ ہر ماڈل کے لیے مکمل موازنے کے منظر پر جائیں۔

معیار بمقابلہ لاگت

اوپر زیادہ مضبوط، بائیں زیادہ سستا — اس لیے بہترین خریداریاں اوپر بائیں ہیں۔ نمبر والے نقاط قدر کی سرحد ہیں: اس سے سستا کوئی زیادہ اسکور نہیں کرتا۔ سرمئی نقاط اسکور اور قیمت دونوں میں پیچھے ہیں۔

60657075808590$0.024$0.050$0.100$0.200$0.500$1.00$1.4391234567Claude Fable 5.1 Max Effort83.4 · $1.212فی کامیاب کام لاگت (لاگ پیمانہ — ہر قدم ضرب ہے، جمع نہیں)مجموعی

منتخب

Claude Fable 5.1 Max Effort

Anthropic

مجموعی
83.4
فی کامیاب کام
$1.212

#7 · قدر کی سرحد پر۔

بہترین خریداریاں (سب سے سستا ← سب سے مضبوط)

  • اپنی قیمت پر بہترین قدر
  • اسکور اور قیمت دونوں میں پیچھے

درست اسکور اور لاگت پڑھنے کے لیے کسی نمبر والے نقطے (یا دائیں طرف اس کی قطار) پر ہوور یا ٹیپ کریں۔ تیر والی کلیدیں سب سے سستے سے سب سے مہنگے ماڈل تک لے جاتی ہیں۔

یہی 57 اعداد جدول کی شکل میں پڑھیں
معیار بمقابلہ لاگت
ماڈلادارہمجموعیفی کامیاب کام
Claude Fable 5.1 Max Effort#7 · اپنی قیمت پر بہترین قدرAnthropic83.4$1.212
Claude 5.5 Opus Thinking Max Effort#6 · اپنی قیمت پر بہترین قدرAnthropic83.2$0.799
Claude Fable 5 Max EffortAnthropic83.0$1.439
GPT-6 Astra Max Effort#5 · اپنی قیمت پر بہترین قدرOpenAI82.2$0.736
GPT-6.1 Sol Max Effort#4 · اپنی قیمت پر بہترین قدرOpenAI81.6$0.142
Muse Spark 1.3 xHigh EffortMeta81.6$0.219
DeepSeek V4.1 Flash Max Effort#3 · اپنی قیمت پر بہترین قدرDeepSeek81.1$0.029
GPT-5.6 Sol Max EffortOpenAI81.0$0.515
GPT-5.5 Thinking xHigh EffortOpenAI80.2$0.435
Claude 5 Opus Thinking Max EffortAnthropic80.1$0.699
GPT-6 Sol Max EffortOpenAI79.3$0.268
Kimi K3Moonshot AI79.2$0.348
Gemini 3.7 Flash HighGoogle78.8$0.157
Qwen 3.8 MaxAlibaba78.5$0.275
Grok 4.6 xHighxAI78.0$0.207
Muse Spark 1.2 xHigh EffortMeta78.0$0.375
GPT-5.4 Thinking xHigh EffortOpenAI78.0$0.387
GPT-5.6 Terra Max EffortOpenAI77.9$0.352
Claude Sonnet 5.5 xHigh EffortAnthropic77.8$0.141
DeepSeek V4 Pro 0813DeepSeek77.4$0.044
Grok 4.7 xHighxAI77.4$0.718
Gemini 3.1 Pro Preview HighGoogle77.0$0.286
DeepSeek V4 Flash Vision ExpDeepSeek76.8$0.051
Claude 4.7 Opus Thinking xHigh EffortAnthropic76.5$0.528
Qwen 3.8 Flash NextAlibaba76.2$0.042
Claude 4.8 Opus Thinking Max EffortAnthropic76.2$0.983
GLM-5.3Z.AI76.1$0.450
Claude Sonnet 5 xHigh EffortAnthropic76.0$0.505
Grok 4.5xAI75.8$0.131
Gemini 3.8 Flash HighGoogle75.8$0.307
Qwen3.8 27BAlibaba75.3$0.094
Muse Spark 1.1 xHigh EffortMeta75.3$0.198
GPT-5.2 HighOpenAI74.6$0.234
Gemini 3.5 Flash HighGoogle74.6$0.249
Claude 4.6 Opus Thinking High EffortAnthropic74.5$0.404
DeepSeek V4 Flash 0731DeepSeek74.2$0.060
GPT-5.2 CodexOpenAI74.0$0.187
GPT-5.6 Luna Max EffortOpenAI73.6$0.169
Gemini 3.6 Flash HighGoogle73.6$0.235
GLM-5.2Z.AI73.2$0.225
Qwen 3.7 MaxAlibaba73.1$0.182
Claude 4.6 Sonnet Thinking Medium EffortAnthropic73.0$0.306
Claude 4.5 Opus Thinking High EffortAnthropic72.6$0.610
GPT-6 Luna Max Effort#2 · اپنی قیمت پر بہترین قدرOpenAI72.0$0.026
Inkling xHigh EffortThinking Machines71.9$0.310
GLM-5.3 FlashZ.AI71.6$0.031
Kimi K2.6 ThinkingMoonshot AI70.5$0.169
GPT-5.4 Nano xHighOpenAI69.6$0.091
Qwen 3.6 PlusAlibaba68.9$0.227
Kimi K2.7 CodeMoonshot AI68.4$0.100
Grok Build 0.1#1 · اپنی قیمت پر بہترین قدرxAI67.8$0.024
Nemotron 3 Ultra 550B A55BNVIDIA67.4$0.371
Minimax M3Minimax67.3$0.060
GPT-5.4 Mini xHighOpenAI66.4$0.334
Qwen 3.6 27BAlibaba64.0$0.202
Gemini 3.5 Flash-Lite HighGoogle63.9$0.069
Grok 4.3xAI62.3$0.061

زمرہ وار خاکہ

لیڈر بورڈ سے تین تک ماڈلز چنیں تاکہ ان کے سات زمروں کے اسکورز کا موازنہ ہو۔

  • Claude Fable 5.1 Max Effort83.4
  • ox-alpha-max69.2
  • DeepSeek V4.1 Flash Max Effort81.1
  • استدلال91.776.686.7
  • کوڈنگ86.475.880.0
  • ایجنٹک کوڈنگ66.152.677.3
  • ریاضی97.077.593.3
  • ڈیٹا کا تجزیہ80.375.879.3
  • زبان89.566.181.2
  • ہدایات پر عمل73.060.370.0

ہر ٹریک 0 سے 100 تک ہے۔ زیادہ دائیں زیادہ مضبوط ہے؛ نمایاں عدد اس قطار میں سرفہرست ہے۔

یہ اسکورز جدول کی شکل میں پڑھیں
زمرہ وار خاکہ
زمرہClaude Fable 5.1 Max Effortox-alpha-maxDeepSeek V4.1 Flash Max Effort
استدلال91.776.686.7
کوڈنگ86.475.880.0
ایجنٹک کوڈنگ66.152.677.3
ریاضی97.077.593.3
ڈیٹا کا تجزیہ80.375.879.3
زبان89.566.181.2
ہدایات پر عمل73.060.370.0

لیڈر بورڈ

ہر زمرے کو ترتیب دیں، فہرست محدود کریں، اور کسی ماڈل کو کھول کر اس کے شائع شدہ ذیلی کاموں کی تفصیل دیکھیں۔

  1. 01

    Claude Fable 5.1 Max Effort

    Anthropic

    83.4

    مجموعی

    $1.212

    فی کامیاب کام

    ریاضی97.0استدلال91.7زبان89.5
  2. 02

    Claude 5.5 Opus Thinking Max Effort

    Anthropic

    83.2

    مجموعی

    $0.799

    فی کامیاب کام

    ریاضی97.1استدلال92.2کوڈنگ89.3
  3. 03

    Claude Fable 5 Max Effort

    Anthropic

    83.0

    مجموعی

    $1.439

    فی کامیاب کام

    ریاضی96.0زبان90.7استدلال89.7
  4. 04

    GPT-6 Astra Max Effort

    OpenAI

    82.2

    مجموعی

    $0.736

    فی کامیاب کام

    ریاضی96.8استدلال92.7زبان89.4
  5. 05

    GPT-6.1 Sol Max Effort

    OpenAI

    81.6

    مجموعی

    $0.142

    فی کامیاب کام

    ریاضی96.8استدلال92.6زبان90.1
  6. 06

    Muse Spark 1.3 xHigh Effort

    Meta

    81.6

    مجموعی

    $0.219

    فی کامیاب کام

    ریاضی95.9استدلال89.7زبان82.8
  7. 07

    DeepSeek V4.1 Flash Max Effort

    کھولیں

    DeepSeek

    81.1

    مجموعی

    $0.029

    فی کامیاب کام

    ریاضی93.3استدلال86.7زبان81.2
  8. 08

    GPT-5.6 Sol Max Effort

    OpenAI

    81.0

    مجموعی

    $0.515

    فی کامیاب کام

    ریاضی96.2استدلال91.7زبان87.7
  9. 09

    GPT-5.5 Thinking xHigh Effort

    OpenAI

    80.2

    مجموعی

    $0.435

    فی کامیاب کام

    ریاضی95.9استدلال89.7زبان87.4
  10. 10

    Claude 5 Opus Thinking Max Effort

    Anthropic

    80.1

    مجموعی

    $0.699

    فی کامیاب کام

    ریاضی95.7استدلال91.2زبان88.7
  11. 11

    GPT-6 Sol Max Effort

    OpenAI

    79.3

    مجموعی

    $0.268

    فی کامیاب کام

    ریاضی96.4استدلال88.7زبان85.3
  12. 12

    Kimi K3

    کھولیں

    Moonshot AI

    79.2

    مجموعی

    $0.348

    فی کامیاب کام

    استدلال90.7زبان85.5ریاضی84.4
  13. 13

    Gemini 3.7 Flash High

    Google

    78.8

    مجموعی

    $0.157

    فی کامیاب کام

    ریاضی93.5استدلال87.8زبان85.5
  14. 14

    Qwen 3.8 Max

    کھولیں

    Alibaba

    78.5

    مجموعی

    $0.275

    فی کامیاب کام

    ریاضی91.3استدلال88.2زبان79.7
  15. 15

    Muse Spark 1.2 xHigh Effort

    Meta

    78.0

    مجموعی

    $0.375

    فی کامیاب کام

    ریاضی91.2استدلال90.0زبان78.6
  16. 16

    Grok 4.6 xHigh

    xAI

    78.0

    مجموعی

    $0.207

    فی کامیاب کام

    ریاضی92.6استدلال90.5زبان83.7
  17. 17

    GPT-5.4 Thinking xHigh Effort

    OpenAI

    78.0

    مجموعی

    $0.387

    فی کامیاب کام

    ریاضی94.1استدلال88.1زبان82.6
  18. 18

    GPT-5.6 Terra Max Effort

    OpenAI

    77.9

    مجموعی

    $0.352

    فی کامیاب کام

    ریاضی94.9استدلال90.6زبان82.9
  19. 19

    Claude Sonnet 5.5 xHigh Effort

    Anthropic

    77.8

    مجموعی

    $0.141

    فی کامیاب کام

    ریاضی96.7کوڈنگ88.9استدلال86.8
  20. 20

    DeepSeek V4 Pro 0813

    کھولیں

    DeepSeek

    77.4

    مجموعی

    $0.044

    فی کامیاب کام

    ریاضی95.1استدلال85.8زبان82.1
  21. 21

    Grok 4.7 xHigh

    xAI

    77.4

    مجموعی

    $0.718

    فی کامیاب کام

    ریاضی95.7استدلال82.7زبان80.1
  22. 22

    Gemini 3.1 Pro Preview High

    Google

    77.0

    مجموعی

    $0.286

    فی کامیاب کام

    ریاضی91.0زبان85.4استدلال84.0
  23. 23

    DeepSeek V4 Flash Vision Exp

    کھولیں

    DeepSeek

    76.8

    مجموعی

    $0.051

    فی کامیاب کام

    ریاضی87.8استدلال85.4زبان80.4
  24. 24

    Claude 4.7 Opus Thinking xHigh Effort

    Anthropic

    76.5

    مجموعی

    $0.528

    فی کامیاب کام

    ریاضی92.9استدلال87.2کوڈنگ82.1
  25. 25

    Claude 4.8 Opus Thinking Max Effort

    Anthropic

    76.2

    مجموعی

    $0.983

    فی کامیاب کام

    ریاضی94.3استدلال89.2کوڈنگ81.8
  26. 26

    Qwen 3.8 Flash Next

    کھولیں

    Alibaba

    76.2

    مجموعی

    $0.042

    فی کامیاب کام

    استدلال87.4ریاضی85.8ہدایات پر عمل77.1
  27. 27

    GLM-5.3

    کھولیں

    Z.AI

    76.1

    مجموعی

    $0.450

    فی کامیاب کام

    ریاضی87.9استدلال85.8زبان79.9
  28. 28

    Claude Sonnet 5 xHigh Effort

    Anthropic

    76.0

    مجموعی

    $0.505

    فی کامیاب کام

    ریاضی92.9استدلال88.7کوڈنگ80.7
  29. 29

    Grok 4.5

    xAI

    75.8

    مجموعی

    $0.131

    فی کامیاب کام

    ریاضی90.8استدلال87.2زبان82.8
  30. 30

    Gemini 3.8 Flash High

    Google

    75.8

    مجموعی

    $0.307

    فی کامیاب کام

    ریاضی91.6استدلال89.3زبان87.8
  31. 31

    Qwen3.8 27B

    کھولیں

    Alibaba

    75.3

    مجموعی

    $0.094

    فی کامیاب کام

    ریاضی86.2استدلال80.0ڈیٹا کا تجزیہ76.6
  32. 32

    Muse Spark 1.1 xHigh Effort

    Meta

    75.3

    مجموعی

    $0.198

    فی کامیاب کام

    استدلال87.7ریاضی87.1کوڈنگ77.2
  33. 33

    GPT-5.2 High

    OpenAI

    74.6

    مجموعی

    $0.234

    فی کامیاب کام

    ریاضی93.2استدلال83.2زبان79.8
  34. 34

    Gemini 3.5 Flash High

    Google

    74.6

    مجموعی

    $0.249

    فی کامیاب کام

    ریاضی88.2زبان84.6استدلال82.0
  35. 35

    Claude 4.6 Opus Thinking High Effort

    Anthropic

    74.5

    مجموعی

    $0.404

    فی کامیاب کام

    ریاضی89.3استدلال88.7زبان83.3
  36. 36

    DeepSeek V4 Flash 0731

    کھولیں

    DeepSeek

    74.2

    مجموعی

    $0.060

    فی کامیاب کام

    ریاضی86.8استدلال86.6ڈیٹا کا تجزیہ79.3
  37. 37

    GPT-5.2 Codex

    OpenAI

    74.0

    مجموعی

    $0.187

    فی کامیاب کام

    ریاضی88.8کوڈنگ83.6ڈیٹا کا تجزیہ78.2
  38. 38

    GPT-5.6 Luna Max Effort

    OpenAI

    73.6

    مجموعی

    $0.169

    فی کامیاب کام

    ریاضی87.2استدلال85.6کوڈنگ82.9
  39. 39

    Gemini 3.6 Flash High

    Google

    73.6

    مجموعی

    $0.235

    فی کامیاب کام

    ریاضی86.4استدلال85.1زبان83.9
  40. 40

    GLM-5.2

    کھولیں

    Z.AI

    73.2

    مجموعی

    $0.225

    فی کامیاب کام

    ریاضی89.8کوڈنگ79.7استدلال78.6
  41. 41

    Qwen 3.7 Max

    Alibaba

    73.1

    مجموعی

    $0.182

    فی کامیاب کام

    ریاضی85.2استدلال83.3زبان79.7
  42. 42

    Claude 4.6 Sonnet Thinking Medium Effort

    Anthropic

    73.0

    مجموعی

    $0.306

    فی کامیاب کام

    ریاضی87.0استدلال84.8کوڈنگ79.3
  43. 43

    Claude 4.5 Opus Thinking High Effort

    Anthropic

    72.6

    مجموعی

    $0.610

    فی کامیاب کام

    ریاضی90.4زبان81.3استدلال80.1
  44. 44

    GPT-6 Luna Max Effort

    OpenAI

    72.0

    مجموعی

    $0.026

    فی کامیاب کام

    ریاضی89.1استدلال81.8کوڈنگ79.0
  45. 45

    Inkling xHigh Effort

    کھولیں

    Thinking Machines

    71.9

    مجموعی

    $0.310

    فی کامیاب کام

    ریاضی88.4استدلال78.3زبان73.5
  46. 46

    GLM-5.3 Flash

    کھولیں

    Z.AI

    71.6

    مجموعی

    $0.031

    فی کامیاب کام

    ریاضی81.2کوڈنگ79.0استدلال77.6
  47. 47

    Kimi K2.6 Thinking

    کھولیں

    Moonshot AI

    70.5

    مجموعی

    $0.169

    فی کامیاب کام

    ریاضی84.3استدلال79.4کوڈنگ78.6
  48. 48

    GPT-5.4 Nano xHigh

    OpenAI

    69.6

    مجموعی

    $0.091

    فی کامیاب کام

    ریاضی91.0استدلال81.1کوڈنگ70.8
  49. 49

    ox-alpha-max

    Stealth

    69.2

    مجموعی

    $0.000

    فی کامیاب کام

    ریاضی77.5استدلال76.6کوڈنگ75.8
  50. 50

    Qwen 3.6 Plus

    Alibaba

    68.9

    مجموعی

    $0.227

    فی کامیاب کام

    ریاضی83.7کوڈنگ78.2استدلال75.8
  51. 51

    Kimi K2.7 Code

    کھولیں

    Moonshot AI

    68.4

    مجموعی

    $0.100

    فی کامیاب کام

    استدلال82.8ریاضی79.6زبان77.9
  52. 52

    Grok Build 0.1

    xAI

    67.8

    مجموعی

    $0.024

    فی کامیاب کام

    ریاضی78.4استدلال76.4زبان72.5
  53. 53

    Nemotron 3 Ultra 550B A55B

    کھولیں

    NVIDIA

    67.4

    مجموعی

    $0.371

    فی کامیاب کام

    ریاضی88.7استدلال74.7ہدایات پر عمل73.4
  54. 54

    Minimax M3

    Minimax

    67.3

    مجموعی

    $0.060

    فی کامیاب کام

    ریاضی76.9زبان76.8ڈیٹا کا تجزیہ76.2
  55. 55

    GPT-5.4 Mini xHigh

    OpenAI

    66.4

    مجموعی

    $0.334

    فی کامیاب کام

    ریاضی78.5کوڈنگ71.6استدلال71.3
  56. 56

    Qwen 3.6 27B

    کھولیں

    Alibaba

    64.0

    مجموعی

    $0.202

    فی کامیاب کام

    ریاضی79.9کوڈنگ71.8ڈیٹا کا تجزیہ70.4
  57. 57

    Gemini 3.5 Flash-Lite High

    Google

    63.9

    مجموعی

    $0.069

    فی کامیاب کام

    کوڈنگ76.1ریاضی73.7زبان71.8
  58. 58

    Grok 4.3

    xAI

    62.3

    مجموعی

    $0.061

    فی کامیاب کام

    ریاضی84.3زبان73.6استدلال70.8

لاگت منتخب دائرے کے لیے ماخذ کی فراہم کردہ فی کامیاب کام لاگت کا پیمانہ ہے۔

اسکورز ایک عوامی تیسرے فریق کے بینچ مارک کا اسنیپ شاٹ ہیں، بغیر تبدیلی کے پیش کیے گئے۔ Dapols اس کے اوپر فی کامیاب کام لاگت کا تجزیہ شامل کرتا ہے۔ماخذ دیکھیں

A benchmark rank is not a hiring decision.

These scores say which model is strongest at a set of held-out tasks. They don’t say which one fits your workflow, your budget, or the tools you already pay for — and the cheapest model that clears your bar usually beats the highest scorer.