Langkau ke kandungan utama

Penanda aras AI

Model AI, dibandingkan dari segi kualiti dan kos.

Paparan praktikal skor model yang diterbitkan untuk membantu anda membandingkan keupayaan, kekuatan kategori dan kos larian tanpa kehilangan butiran.

Teroka papan pendahuluSumber penanda aras Keluaran terkini yang dipilih · 25 Jun 2026

Kemas kini penanda aras & model terkini

Papan pendahulu di halaman ini ialah keluaran LiveBench pada 25 Jun, ditangkap semula pada 22 September 2026. Ia kini termasuk Grok 4.7 xHigh dan DeepSeek V4.1 Flash Max Effort. Nota model di bawah diambil daripada laman vendor sendiri, dilabel sebagai sedemikian.

Grok 4.6

Harga API $2 / $6 yang sama seperti Grok 4.5. xAI melaporkan Indeks Kecerdasan Artificial Analysis sebanyak 61 — sama dengan GPT-5.6 Sol Max, satu mata di belakang Fable 5 Max. Kukuh dalam penilaian kerja pengetahuan; 26% pada Terminal-Bench v3.

Baca ringkasan Grok 4.6

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash menggantikan V4 Flash pada 10 Sep 2026 pada ID API deepseek-flash yang baharu, pada $0.15 / $0.60 setiap 1 juta token di luar waktu puncak dan $0.30 / $1.20 pada waktu puncak. Dari 14 Sep, permintaan V4 Pro juga dihalakan kepadanya, jadi tukar ID model sekarang. LiveBench kini menilai V4.1 Flash Max Effort pada 81.1 keseluruhan.

Lihat dalam penjejak model

Baris papan pendahulu hanya datang daripada data LiveBench yang diterbitkan. Kami tidak mereka-reka skor.

Best overall

Claude Fable 5.1 Max Effort leads this snapshot at 83.4 overall, $1.212 per successful task.

Best value per task

ox-alpha-max runs at $0.000 per successful task and still scores 69.2 overall.

Best open weights

DeepSeek V4.1 Flash Max Effort is the strongest open-weight model here at 81.1 overall — the option you can host yourself.

Best per capability

If your work is mostly one kind of task, these lead their category in this snapshot.

Penaakulan
GPT-6 Astra Max Effort 92.7
Pengekodan
Claude 5.5 Opus Thinking Max Effort 89.3
Pengekodan agentik
DeepSeek V4.1 Flash Max Effort 77.3
Matematik
Claude 5.5 Opus Thinking Max Effort 97.1
Analisis data
GPT-6 Astra Max Effort 83.0
Bahasa
Claude Fable 5 Max Effort 90.7
Mengikut arahan
Gemini 3.8 Flash High 81.4

Every number above comes from the 2026-06-25 release dated 2026-06-25, published by a third-party benchmark and reproduced unaltered.

Bentuk bidang ini, dalam dua gambar.

Carta pertama menjawab “siapa yang paling kuat”. Carta kedua menjawab soalan yang sebenarnya menjejaskan wang anda: yang mana satu berbaloi untuk dibayar.

Kedudukan mereka

Lebih panjang bermakna lebih baik. Bar menunjukkan skor Keseluruhan daripada 100; angka di sebelah setiap bar ialah nilai tepat. Pilih satu baris untuk membawa model itu ke carta kos di bawah.

Menunjukkan 12 teratas daripada 58. Tukar kepada paparan perbandingan penuh untuk setiap model.

Kualiti berbanding kos

Naik bermakna lebih kuat, kiri bermakna lebih murah — jadi pembelian terbaik berada di sudut kiri atas. Titik bernombor ialah sempadan nilai: tiada yang lebih murah mendapat skor lebih tinggi. Titik kelabu dikalahkan dari segi skor dan harga.

60657075808590USD 0.024USD 0.050USD 0.100USD 0.200USD 0.500USD 1.00USD 1.4391234567Claude Fable 5.1 Max Effort83.4 · USD 1.212Kos setiap tugas berjaya (skala log — setiap langkah ialah gandaan, bukan penambahan)Keseluruhan

Dipilih

Claude Fable 5.1 Max Effort

Anthropic

Keseluruhan
83.4
setiap tugas berjaya
USD 1.212

#7 · Pada sempadan nilai.

Pembelian terbaik (termurah → terkuat)

  • Nilai terbaik pada harganya
  • Dikalahkan dari segi skor dan harga

Letakkan kursor atau ketik titik bernombor (atau barisnya di sebelah kanan) untuk membaca skor dan kos tepat. Kekunci anak panah menggerakkan model dari yang termurah ke yang termahal.

Baca 57 nombor yang sama sebagai jadual
Kualiti berbanding kos
ModelOrganisasiKeseluruhansetiap tugas berjaya
Claude Fable 5.1 Max Effort#7 · Nilai terbaik pada harganyaAnthropic83.4USD 1.212
Claude 5.5 Opus Thinking Max Effort#6 · Nilai terbaik pada harganyaAnthropic83.2USD 0.799
Claude Fable 5 Max EffortAnthropic83.0USD 1.439
GPT-6 Astra Max Effort#5 · Nilai terbaik pada harganyaOpenAI82.2USD 0.736
GPT-6.1 Sol Max Effort#4 · Nilai terbaik pada harganyaOpenAI81.6USD 0.142
Muse Spark 1.3 xHigh EffortMeta81.6USD 0.219
DeepSeek V4.1 Flash Max Effort#3 · Nilai terbaik pada harganyaDeepSeek81.1USD 0.029
GPT-5.6 Sol Max EffortOpenAI81.0USD 0.515
GPT-5.5 Thinking xHigh EffortOpenAI80.2USD 0.435
Claude 5 Opus Thinking Max EffortAnthropic80.1USD 0.699
GPT-6 Sol Max EffortOpenAI79.3USD 0.268
Kimi K3Moonshot AI79.2USD 0.348
Gemini 3.7 Flash HighGoogle78.8USD 0.157
Qwen 3.8 MaxAlibaba78.5USD 0.275
Grok 4.6 xHighxAI78.0USD 0.207
Muse Spark 1.2 xHigh EffortMeta78.0USD 0.375
GPT-5.4 Thinking xHigh EffortOpenAI78.0USD 0.387
GPT-5.6 Terra Max EffortOpenAI77.9USD 0.352
Claude Sonnet 5.5 xHigh EffortAnthropic77.8USD 0.141
DeepSeek V4 Pro 0813DeepSeek77.4USD 0.044
Grok 4.7 xHighxAI77.4USD 0.718
Gemini 3.1 Pro Preview HighGoogle77.0USD 0.286
DeepSeek V4 Flash Vision ExpDeepSeek76.8USD 0.051
Claude 4.7 Opus Thinking xHigh EffortAnthropic76.5USD 0.528
Qwen 3.8 Flash NextAlibaba76.2USD 0.042
Claude 4.8 Opus Thinking Max EffortAnthropic76.2USD 0.983
GLM-5.3Z.AI76.1USD 0.450
Claude Sonnet 5 xHigh EffortAnthropic76.0USD 0.505
Grok 4.5xAI75.8USD 0.131
Gemini 3.8 Flash HighGoogle75.8USD 0.307
Qwen3.8 27BAlibaba75.3USD 0.094
Muse Spark 1.1 xHigh EffortMeta75.3USD 0.198
GPT-5.2 HighOpenAI74.6USD 0.234
Gemini 3.5 Flash HighGoogle74.6USD 0.249
Claude 4.6 Opus Thinking High EffortAnthropic74.5USD 0.404
DeepSeek V4 Flash 0731DeepSeek74.2USD 0.060
GPT-5.2 CodexOpenAI74.0USD 0.187
GPT-5.6 Luna Max EffortOpenAI73.6USD 0.169
Gemini 3.6 Flash HighGoogle73.6USD 0.235
GLM-5.2Z.AI73.2USD 0.225
Qwen 3.7 MaxAlibaba73.1USD 0.182
Claude 4.6 Sonnet Thinking Medium EffortAnthropic73.0USD 0.306
Claude 4.5 Opus Thinking High EffortAnthropic72.6USD 0.610
GPT-6 Luna Max Effort#2 · Nilai terbaik pada harganyaOpenAI72.0USD 0.026
Inkling xHigh EffortThinking Machines71.9USD 0.310
GLM-5.3 FlashZ.AI71.6USD 0.031
Kimi K2.6 ThinkingMoonshot AI70.5USD 0.169
GPT-5.4 Nano xHighOpenAI69.6USD 0.091
Qwen 3.6 PlusAlibaba68.9USD 0.227
Kimi K2.7 CodeMoonshot AI68.4USD 0.100
Grok Build 0.1#1 · Nilai terbaik pada harganyaxAI67.8USD 0.024
Nemotron 3 Ultra 550B A55BNVIDIA67.4USD 0.371
Minimax M3Minimax67.3USD 0.060
GPT-5.4 Mini xHighOpenAI66.4USD 0.334
Qwen 3.6 27BAlibaba64.0USD 0.202
Gemini 3.5 Flash-Lite HighGoogle63.9USD 0.069
Grok 4.3xAI62.3USD 0.061

Profil kategori

Pilih sehingga tiga model daripada papan pendahulu untuk membandingkan tujuh skor kategori mereka.

  • Claude Fable 5.1 Max Effort83.4
  • ox-alpha-max69.2
  • DeepSeek V4.1 Flash Max Effort81.1
  • Penaakulan91.776.686.7
  • Pengekodan86.475.880.0
  • Pengekodan agentik66.152.677.3
  • Matematik97.077.593.3
  • Analisis data80.375.879.3
  • Bahasa89.566.181.2
  • Mengikut arahan73.060.370.0

Setiap trek berjalan dari 0 hingga 100. Lebih ke kanan bermakna lebih kuat; angka tebal ialah pendahulu dalam baris itu.

Baca skor ini sebagai jadual
Profil kategori
KategoriClaude Fable 5.1 Max Effortox-alpha-maxDeepSeek V4.1 Flash Max Effort
Penaakulan91.776.686.7
Pengekodan86.475.880.0
Pengekodan agentik66.152.677.3
Matematik97.077.593.3
Analisis data80.375.879.3
Bahasa89.566.181.2
Mengikut arahan73.060.370.0

Papan pendahulu

Susun setiap kategori, persempitkan senarai, dan buka model untuk pecahan subtugas yang diterbitkan.

  1. 01

    Claude Fable 5.1 Max Effort

    Anthropic

    83.4

    Keseluruhan

    USD 1.212

    setiap tugas berjaya

    Matematik97.0Penaakulan91.7Bahasa89.5
  2. 02

    Claude 5.5 Opus Thinking Max Effort

    Anthropic

    83.2

    Keseluruhan

    USD 0.799

    setiap tugas berjaya

    Matematik97.1Penaakulan92.2Pengekodan89.3
  3. 03

    Claude Fable 5 Max Effort

    Anthropic

    83.0

    Keseluruhan

    USD 1.439

    setiap tugas berjaya

    Matematik96.0Bahasa90.7Penaakulan89.7
  4. 04

    GPT-6 Astra Max Effort

    OpenAI

    82.2

    Keseluruhan

    USD 0.736

    setiap tugas berjaya

    Matematik96.8Penaakulan92.7Bahasa89.4
  5. 05

    GPT-6.1 Sol Max Effort

    OpenAI

    81.6

    Keseluruhan

    USD 0.142

    setiap tugas berjaya

    Matematik96.8Penaakulan92.6Bahasa90.1
  6. 06

    Muse Spark 1.3 xHigh Effort

    Meta

    81.6

    Keseluruhan

    USD 0.219

    setiap tugas berjaya

    Matematik95.9Penaakulan89.7Bahasa82.8
  7. 07

    DeepSeek V4.1 Flash Max Effort

    buka

    DeepSeek

    81.1

    Keseluruhan

    USD 0.029

    setiap tugas berjaya

    Matematik93.3Penaakulan86.7Bahasa81.2
  8. 08

    GPT-5.6 Sol Max Effort

    OpenAI

    81.0

    Keseluruhan

    USD 0.515

    setiap tugas berjaya

    Matematik96.2Penaakulan91.7Bahasa87.7
  9. 09

    GPT-5.5 Thinking xHigh Effort

    OpenAI

    80.2

    Keseluruhan

    USD 0.435

    setiap tugas berjaya

    Matematik95.9Penaakulan89.7Bahasa87.4
  10. 10

    Claude 5 Opus Thinking Max Effort

    Anthropic

    80.1

    Keseluruhan

    USD 0.699

    setiap tugas berjaya

    Matematik95.7Penaakulan91.2Bahasa88.7
  11. 11

    GPT-6 Sol Max Effort

    OpenAI

    79.3

    Keseluruhan

    USD 0.268

    setiap tugas berjaya

    Matematik96.4Penaakulan88.7Bahasa85.3
  12. 12

    Kimi K3

    buka

    Moonshot AI

    79.2

    Keseluruhan

    USD 0.348

    setiap tugas berjaya

    Penaakulan90.7Bahasa85.5Matematik84.4
  13. 13

    Gemini 3.7 Flash High

    Google

    78.8

    Keseluruhan

    USD 0.157

    setiap tugas berjaya

    Matematik93.5Penaakulan87.8Bahasa85.5
  14. 14

    Qwen 3.8 Max

    buka

    Alibaba

    78.5

    Keseluruhan

    USD 0.275

    setiap tugas berjaya

    Matematik91.3Penaakulan88.2Bahasa79.7
  15. 15

    Muse Spark 1.2 xHigh Effort

    Meta

    78.0

    Keseluruhan

    USD 0.375

    setiap tugas berjaya

    Matematik91.2Penaakulan90.0Bahasa78.6
  16. 16

    Grok 4.6 xHigh

    xAI

    78.0

    Keseluruhan

    USD 0.207

    setiap tugas berjaya

    Matematik92.6Penaakulan90.5Bahasa83.7
  17. 17

    GPT-5.4 Thinking xHigh Effort

    OpenAI

    78.0

    Keseluruhan

    USD 0.387

    setiap tugas berjaya

    Matematik94.1Penaakulan88.1Bahasa82.6
  18. 18

    GPT-5.6 Terra Max Effort

    OpenAI

    77.9

    Keseluruhan

    USD 0.352

    setiap tugas berjaya

    Matematik94.9Penaakulan90.6Bahasa82.9
  19. 19

    Claude Sonnet 5.5 xHigh Effort

    Anthropic

    77.8

    Keseluruhan

    USD 0.141

    setiap tugas berjaya

    Matematik96.7Pengekodan88.9Penaakulan86.8
  20. 20

    DeepSeek V4 Pro 0813

    buka

    DeepSeek

    77.4

    Keseluruhan

    USD 0.044

    setiap tugas berjaya

    Matematik95.1Penaakulan85.8Bahasa82.1
  21. 21

    Grok 4.7 xHigh

    xAI

    77.4

    Keseluruhan

    USD 0.718

    setiap tugas berjaya

    Matematik95.7Penaakulan82.7Bahasa80.1
  22. 22

    Gemini 3.1 Pro Preview High

    Google

    77.0

    Keseluruhan

    USD 0.286

    setiap tugas berjaya

    Matematik91.0Bahasa85.4Penaakulan84.0
  23. 23

    DeepSeek V4 Flash Vision Exp

    buka

    DeepSeek

    76.8

    Keseluruhan

    USD 0.051

    setiap tugas berjaya

    Matematik87.8Penaakulan85.4Bahasa80.4
  24. 24

    Claude 4.7 Opus Thinking xHigh Effort

    Anthropic

    76.5

    Keseluruhan

    USD 0.528

    setiap tugas berjaya

    Matematik92.9Penaakulan87.2Pengekodan82.1
  25. 25

    Claude 4.8 Opus Thinking Max Effort

    Anthropic

    76.2

    Keseluruhan

    USD 0.983

    setiap tugas berjaya

    Matematik94.3Penaakulan89.2Pengekodan81.8
  26. 26

    Qwen 3.8 Flash Next

    buka

    Alibaba

    76.2

    Keseluruhan

    USD 0.042

    setiap tugas berjaya

    Penaakulan87.4Matematik85.8Mengikut arahan77.1
  27. 27

    GLM-5.3

    buka

    Z.AI

    76.1

    Keseluruhan

    USD 0.450

    setiap tugas berjaya

    Matematik87.9Penaakulan85.8Bahasa79.9
  28. 28

    Claude Sonnet 5 xHigh Effort

    Anthropic

    76.0

    Keseluruhan

    USD 0.505

    setiap tugas berjaya

    Matematik92.9Penaakulan88.7Pengekodan80.7
  29. 29

    Grok 4.5

    xAI

    75.8

    Keseluruhan

    USD 0.131

    setiap tugas berjaya

    Matematik90.8Penaakulan87.2Bahasa82.8
  30. 30

    Gemini 3.8 Flash High

    Google

    75.8

    Keseluruhan

    USD 0.307

    setiap tugas berjaya

    Matematik91.6Penaakulan89.3Bahasa87.8
  31. 31

    Qwen3.8 27B

    buka

    Alibaba

    75.3

    Keseluruhan

    USD 0.094

    setiap tugas berjaya

    Matematik86.2Penaakulan80.0Analisis data76.6
  32. 32

    Muse Spark 1.1 xHigh Effort

    Meta

    75.3

    Keseluruhan

    USD 0.198

    setiap tugas berjaya

    Penaakulan87.7Matematik87.1Pengekodan77.2
  33. 33

    GPT-5.2 High

    OpenAI

    74.6

    Keseluruhan

    USD 0.234

    setiap tugas berjaya

    Matematik93.2Penaakulan83.2Bahasa79.8
  34. 34

    Gemini 3.5 Flash High

    Google

    74.6

    Keseluruhan

    USD 0.249

    setiap tugas berjaya

    Matematik88.2Bahasa84.6Penaakulan82.0
  35. 35

    Claude 4.6 Opus Thinking High Effort

    Anthropic

    74.5

    Keseluruhan

    USD 0.404

    setiap tugas berjaya

    Matematik89.3Penaakulan88.7Bahasa83.3
  36. 36

    DeepSeek V4 Flash 0731

    buka

    DeepSeek

    74.2

    Keseluruhan

    USD 0.060

    setiap tugas berjaya

    Matematik86.8Penaakulan86.6Analisis data79.3
  37. 37

    GPT-5.2 Codex

    OpenAI

    74.0

    Keseluruhan

    USD 0.187

    setiap tugas berjaya

    Matematik88.8Pengekodan83.6Analisis data78.2
  38. 38

    GPT-5.6 Luna Max Effort

    OpenAI

    73.6

    Keseluruhan

    USD 0.169

    setiap tugas berjaya

    Matematik87.2Penaakulan85.6Pengekodan82.9
  39. 39

    Gemini 3.6 Flash High

    Google

    73.6

    Keseluruhan

    USD 0.235

    setiap tugas berjaya

    Matematik86.4Penaakulan85.1Bahasa83.9
  40. 40

    GLM-5.2

    buka

    Z.AI

    73.2

    Keseluruhan

    USD 0.225

    setiap tugas berjaya

    Matematik89.8Pengekodan79.7Penaakulan78.6
  41. 41

    Qwen 3.7 Max

    Alibaba

    73.1

    Keseluruhan

    USD 0.182

    setiap tugas berjaya

    Matematik85.2Penaakulan83.3Bahasa79.7
  42. 42

    Claude 4.6 Sonnet Thinking Medium Effort

    Anthropic

    73.0

    Keseluruhan

    USD 0.306

    setiap tugas berjaya

    Matematik87.0Penaakulan84.8Pengekodan79.3
  43. 43

    Claude 4.5 Opus Thinking High Effort

    Anthropic

    72.6

    Keseluruhan

    USD 0.610

    setiap tugas berjaya

    Matematik90.4Bahasa81.3Penaakulan80.1
  44. 44

    GPT-6 Luna Max Effort

    OpenAI

    72.0

    Keseluruhan

    USD 0.026

    setiap tugas berjaya

    Matematik89.1Penaakulan81.8Pengekodan79.0
  45. 45

    Inkling xHigh Effort

    buka

    Thinking Machines

    71.9

    Keseluruhan

    USD 0.310

    setiap tugas berjaya

    Matematik88.4Penaakulan78.3Bahasa73.5
  46. 46

    GLM-5.3 Flash

    buka

    Z.AI

    71.6

    Keseluruhan

    USD 0.031

    setiap tugas berjaya

    Matematik81.2Pengekodan79.0Penaakulan77.6
  47. 47

    Kimi K2.6 Thinking

    buka

    Moonshot AI

    70.5

    Keseluruhan

    USD 0.169

    setiap tugas berjaya

    Matematik84.3Penaakulan79.4Pengekodan78.6
  48. 48

    GPT-5.4 Nano xHigh

    OpenAI

    69.6

    Keseluruhan

    USD 0.091

    setiap tugas berjaya

    Matematik91.0Penaakulan81.1Pengekodan70.8
  49. 49

    ox-alpha-max

    Stealth

    69.2

    Keseluruhan

    USD 0.000

    setiap tugas berjaya

    Matematik77.5Penaakulan76.6Pengekodan75.8
  50. 50

    Qwen 3.6 Plus

    Alibaba

    68.9

    Keseluruhan

    USD 0.227

    setiap tugas berjaya

    Matematik83.7Pengekodan78.2Penaakulan75.8
  51. 51

    Kimi K2.7 Code

    buka

    Moonshot AI

    68.4

    Keseluruhan

    USD 0.100

    setiap tugas berjaya

    Penaakulan82.8Matematik79.6Bahasa77.9
  52. 52

    Grok Build 0.1

    xAI

    67.8

    Keseluruhan

    USD 0.024

    setiap tugas berjaya

    Matematik78.4Penaakulan76.4Bahasa72.5
  53. 53

    Nemotron 3 Ultra 550B A55B

    buka

    NVIDIA

    67.4

    Keseluruhan

    USD 0.371

    setiap tugas berjaya

    Matematik88.7Penaakulan74.7Mengikut arahan73.4
  54. 54

    Minimax M3

    Minimax

    67.3

    Keseluruhan

    USD 0.060

    setiap tugas berjaya

    Matematik76.9Bahasa76.8Analisis data76.2
  55. 55

    GPT-5.4 Mini xHigh

    OpenAI

    66.4

    Keseluruhan

    USD 0.334

    setiap tugas berjaya

    Matematik78.5Pengekodan71.6Penaakulan71.3
  56. 56

    Qwen 3.6 27B

    buka

    Alibaba

    64.0

    Keseluruhan

    USD 0.202

    setiap tugas berjaya

    Matematik79.9Pengekodan71.8Analisis data70.4
  57. 57

    Gemini 3.5 Flash-Lite High

    Google

    63.9

    Keseluruhan

    USD 0.069

    setiap tugas berjaya

    Pengekodan76.1Matematik73.7Bahasa71.8
  58. 58

    Grok 4.3

    xAI

    62.3

    Keseluruhan

    USD 0.061

    setiap tugas berjaya

    Matematik84.3Bahasa73.6Penaakulan70.8

Kos ialah metrik kos-setiap-tugas-berjaya yang dibekalkan sumber untuk skop yang dipilih.

Skor ialah snapshot penanda aras pihak ketiga awam yang diterbitkan semula tanpa pengubahan. Dapols menambah analisis kos-setiap-tugas-berjaya di atasnya.Lihat sumber

A benchmark rank is not a hiring decision.

These scores say which model is strongest at a set of held-out tasks. They don’t say which one fits your workflow, your budget, or the tools you already pay for — and the cheapest model that clears your bar usually beats the highest scorer.