跳到主要內容

AI 基準測試

依品質與成本比較 AI 模型。

一個實用的視角,檢視已發布的模型分數,協助你在不失細節的情況下,比較能力、類別強項與運作成本。

探索排行榜基準測試來源 最新選定的發布 · 2026年6月25日

最新基準測試與模型更新

本頁的排行榜是 LiveBench 於 6 月 25 日的發布版本,已於 2026 年 9 月 22 日重新擷取。目前已納入 Grok 4.7 xHigh 與 DeepSeek V4.1 Flash Max Effort。下方的模型說明取自各供應商自己的頁面,並已如此標示。

Grok 4.6

API 價格與 Grok 4.5 相同,皆為 $2 / $6。xAI 公布的 Artificial Analysis Intelligence Index 為 61 — 與 GPT-5.6 Sol Max 並列,比 Fable 5 Max 低一分。在知識工作評測中表現強勁;在 Terminal-Bench v3 上為 26%。

閱讀 Grok 4.6 簡報

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash 於 2026 年 9 月 10 日取代 V4 Flash,改用全新的 deepseek-flash API ID;離峰時段每 100 萬 tokens 為 $0.15 / $0.60,尖峰時段為 $0.30 / $1.20。從 9 月 14 日起,V4 Pro 的請求也會轉送至此模型,因此請立即切換模型 ID。LiveBench 目前將 V4.1 Flash Max Effort 的綜合分數評為 81.1。

在模型追蹤中查看

排行榜的列僅來自已發布的 LiveBench 數據。我們不會虛構分數。

Best overall

Claude Fable 5.1 Max Effort leads this snapshot at 83.4 overall, $1.212 per successful task.

Best value per task

ox-alpha-max runs at $0.000 per successful task and still scores 69.2 overall.

Best open weights

DeepSeek V4.1 Flash Max Effort is the strongest open-weight model here at 81.1 overall — the option you can host yourself.

Best per capability

If your work is mostly one kind of task, these lead their category in this snapshot.

推理
GPT-6 Astra Max Effort 92.7
程式設計
Claude 5.5 Opus Thinking Max Effort 89.3
代理式程式設計
DeepSeek V4.1 Flash Max Effort 77.3
數學
Claude 5.5 Opus Thinking Max Effort 97.1
資料分析
GPT-6 Astra Max Effort 83.0
語言
Claude Fable 5 Max Effort 90.7
指令遵循
Gemini 3.8 Flash High 81.4

Every number above comes from the 2026-06-25 release dated 2026-06-25, published by a third-party benchmark and reproduced unaltered.

以兩張圖看懂整個領域的輪廓。

第一張圖回答「誰最強」。第二張圖回答真正會讓你花錢的問題:其中哪一個值得付費。

排名情況

越長越好。長條顯示滿分 100 的 綜合 分數;每個長條旁的數字為精確數值。選取某一列,即可將該模型帶入下方的成本圖表。

顯示前 12 名,共 58 名。切換至完整比較檢視,即可查看所有模型。

品質與成本

越高越強,越左越便宜 — 因此最佳選擇位於左上方。編號的點為價值前緣:沒有更便宜又得分更高的模型。灰色的點在分數與價格上都被超越。

60657075808590US$0.024US$0.050US$0.100US$0.200US$0.500US$1.00US$1.4391234567Claude Fable 5.1 Max Effort83.4 · US$1.212每次成功任務的成本(對數刻度 — 每一格代表倍數,而非加法)綜合

已選取

Claude Fable 5.1 Max Effort

Anthropic

綜合
83.4
每次成功任務
US$1.212

#7 · 位於價值前緣。

最佳選擇(由便宜到最強)

  • 同價位中的最佳價值
  • 在分數與價格上皆被超越

將滑鼠移到或點選編號的點(或右側對應的列),即可讀取精確的分數與成本。方向鍵可讓你依由便宜到昂貴的順序逐一瀏覽模型。

以表格閱讀相同的 57 個數字
品質與成本
模型機構綜合每次成功任務
Claude Fable 5.1 Max Effort#7 · 同價位中的最佳價值Anthropic83.4US$1.212
Claude 5.5 Opus Thinking Max Effort#6 · 同價位中的最佳價值Anthropic83.2US$0.799
Claude Fable 5 Max EffortAnthropic83.0US$1.439
GPT-6 Astra Max Effort#5 · 同價位中的最佳價值OpenAI82.2US$0.736
GPT-6.1 Sol Max Effort#4 · 同價位中的最佳價值OpenAI81.6US$0.142
Muse Spark 1.3 xHigh EffortMeta81.6US$0.219
DeepSeek V4.1 Flash Max Effort#3 · 同價位中的最佳價值DeepSeek81.1US$0.029
GPT-5.6 Sol Max EffortOpenAI81.0US$0.515
GPT-5.5 Thinking xHigh EffortOpenAI80.2US$0.435
Claude 5 Opus Thinking Max EffortAnthropic80.1US$0.699
GPT-6 Sol Max EffortOpenAI79.3US$0.268
Kimi K3Moonshot AI79.2US$0.348
Gemini 3.7 Flash HighGoogle78.8US$0.157
Qwen 3.8 MaxAlibaba78.5US$0.275
Grok 4.6 xHighxAI78.0US$0.207
Muse Spark 1.2 xHigh EffortMeta78.0US$0.375
GPT-5.4 Thinking xHigh EffortOpenAI78.0US$0.387
GPT-5.6 Terra Max EffortOpenAI77.9US$0.352
Claude Sonnet 5.5 xHigh EffortAnthropic77.8US$0.141
DeepSeek V4 Pro 0813DeepSeek77.4US$0.044
Grok 4.7 xHighxAI77.4US$0.718
Gemini 3.1 Pro Preview HighGoogle77.0US$0.286
DeepSeek V4 Flash Vision ExpDeepSeek76.8US$0.051
Claude 4.7 Opus Thinking xHigh EffortAnthropic76.5US$0.528
Qwen 3.8 Flash NextAlibaba76.2US$0.042
Claude 4.8 Opus Thinking Max EffortAnthropic76.2US$0.983
GLM-5.3Z.AI76.1US$0.450
Claude Sonnet 5 xHigh EffortAnthropic76.0US$0.505
Grok 4.5xAI75.8US$0.131
Gemini 3.8 Flash HighGoogle75.8US$0.307
Qwen3.8 27BAlibaba75.3US$0.094
Muse Spark 1.1 xHigh EffortMeta75.3US$0.198
GPT-5.2 HighOpenAI74.6US$0.234
Gemini 3.5 Flash HighGoogle74.6US$0.249
Claude 4.6 Opus Thinking High EffortAnthropic74.5US$0.404
DeepSeek V4 Flash 0731DeepSeek74.2US$0.060
GPT-5.2 CodexOpenAI74.0US$0.187
GPT-5.6 Luna Max EffortOpenAI73.6US$0.169
Gemini 3.6 Flash HighGoogle73.6US$0.235
GLM-5.2Z.AI73.2US$0.225
Qwen 3.7 MaxAlibaba73.1US$0.182
Claude 4.6 Sonnet Thinking Medium EffortAnthropic73.0US$0.306
Claude 4.5 Opus Thinking High EffortAnthropic72.6US$0.610
GPT-6 Luna Max Effort#2 · 同價位中的最佳價值OpenAI72.0US$0.026
Inkling xHigh EffortThinking Machines71.9US$0.310
GLM-5.3 FlashZ.AI71.6US$0.031
Kimi K2.6 ThinkingMoonshot AI70.5US$0.169
GPT-5.4 Nano xHighOpenAI69.6US$0.091
Qwen 3.6 PlusAlibaba68.9US$0.227
Kimi K2.7 CodeMoonshot AI68.4US$0.100
Grok Build 0.1#1 · 同價位中的最佳價值xAI67.8US$0.024
Nemotron 3 Ultra 550B A55BNVIDIA67.4US$0.371
Minimax M3Minimax67.3US$0.060
GPT-5.4 Mini xHighOpenAI66.4US$0.334
Qwen 3.6 27BAlibaba64.0US$0.202
Gemini 3.5 Flash-Lite HighGoogle63.9US$0.069
Grok 4.3xAI62.3US$0.061

類別輪廓

從排行榜中最多選擇三個模型,比較它們的七個類別分數。

  • Claude Fable 5.1 Max Effort83.4
  • ox-alpha-max69.2
  • DeepSeek V4.1 Flash Max Effort81.1
  • 推理91.776.686.7
  • 程式設計86.475.880.0
  • 代理式程式設計66.152.677.3
  • 數學97.077.593.3
  • 資料分析80.375.879.3
  • 語言89.566.181.2
  • 指令遵循73.060.370.0

每條軸皆為 0 到 100。越靠右越強;粗體數字為該列的領先者。

以表格閱讀這些分數
類別輪廓
類別Claude Fable 5.1 Max Effortox-alpha-maxDeepSeek V4.1 Flash Max Effort
推理91.776.686.7
程式設計86.475.880.0
代理式程式設計66.152.677.3
數學97.077.593.3
資料分析80.375.879.3
語言89.566.181.2
指令遵循73.060.370.0

排行榜

排序每個類別、縮小清單範圍,並開啟模型查看其公開的子任務細項。

  1. 01

    Claude Fable 5.1 Max Effort

    Anthropic

    83.4

    綜合

    US$1.212

    每次成功任務

    數學97.0推理91.7語言89.5
  2. 02

    Claude 5.5 Opus Thinking Max Effort

    Anthropic

    83.2

    綜合

    US$0.799

    每次成功任務

    數學97.1推理92.2程式設計89.3
  3. 03

    Claude Fable 5 Max Effort

    Anthropic

    83.0

    綜合

    US$1.439

    每次成功任務

    數學96.0語言90.7推理89.7
  4. 04

    GPT-6 Astra Max Effort

    OpenAI

    82.2

    綜合

    US$0.736

    每次成功任務

    數學96.8推理92.7語言89.4
  5. 05

    GPT-6.1 Sol Max Effort

    OpenAI

    81.6

    綜合

    US$0.142

    每次成功任務

    數學96.8推理92.6語言90.1
  6. 06

    Muse Spark 1.3 xHigh Effort

    Meta

    81.6

    綜合

    US$0.219

    每次成功任務

    數學95.9推理89.7語言82.8
  7. 07

    DeepSeek V4.1 Flash Max Effort

    開放

    DeepSeek

    81.1

    綜合

    US$0.029

    每次成功任務

    數學93.3推理86.7語言81.2
  8. 08

    GPT-5.6 Sol Max Effort

    OpenAI

    81.0

    綜合

    US$0.515

    每次成功任務

    數學96.2推理91.7語言87.7
  9. 09

    GPT-5.5 Thinking xHigh Effort

    OpenAI

    80.2

    綜合

    US$0.435

    每次成功任務

    數學95.9推理89.7語言87.4
  10. 10

    Claude 5 Opus Thinking Max Effort

    Anthropic

    80.1

    綜合

    US$0.699

    每次成功任務

    數學95.7推理91.2語言88.7
  11. 11

    GPT-6 Sol Max Effort

    OpenAI

    79.3

    綜合

    US$0.268

    每次成功任務

    數學96.4推理88.7語言85.3
  12. 12

    Kimi K3

    開放

    Moonshot AI

    79.2

    綜合

    US$0.348

    每次成功任務

    推理90.7語言85.5數學84.4
  13. 13

    Gemini 3.7 Flash High

    Google

    78.8

    綜合

    US$0.157

    每次成功任務

    數學93.5推理87.8語言85.5
  14. 14

    Qwen 3.8 Max

    開放

    Alibaba

    78.5

    綜合

    US$0.275

    每次成功任務

    數學91.3推理88.2語言79.7
  15. 15

    Muse Spark 1.2 xHigh Effort

    Meta

    78.0

    綜合

    US$0.375

    每次成功任務

    數學91.2推理90.0語言78.6
  16. 16

    Grok 4.6 xHigh

    xAI

    78.0

    綜合

    US$0.207

    每次成功任務

    數學92.6推理90.5語言83.7
  17. 17

    GPT-5.4 Thinking xHigh Effort

    OpenAI

    78.0

    綜合

    US$0.387

    每次成功任務

    數學94.1推理88.1語言82.6
  18. 18

    GPT-5.6 Terra Max Effort

    OpenAI

    77.9

    綜合

    US$0.352

    每次成功任務

    數學94.9推理90.6語言82.9
  19. 19

    Claude Sonnet 5.5 xHigh Effort

    Anthropic

    77.8

    綜合

    US$0.141

    每次成功任務

    數學96.7程式設計88.9推理86.8
  20. 20

    DeepSeek V4 Pro 0813

    開放

    DeepSeek

    77.4

    綜合

    US$0.044

    每次成功任務

    數學95.1推理85.8語言82.1
  21. 21

    Grok 4.7 xHigh

    xAI

    77.4

    綜合

    US$0.718

    每次成功任務

    數學95.7推理82.7語言80.1
  22. 22

    Gemini 3.1 Pro Preview High

    Google

    77.0

    綜合

    US$0.286

    每次成功任務

    數學91.0語言85.4推理84.0
  23. 23

    DeepSeek V4 Flash Vision Exp

    開放

    DeepSeek

    76.8

    綜合

    US$0.051

    每次成功任務

    數學87.8推理85.4語言80.4
  24. 24

    Claude 4.7 Opus Thinking xHigh Effort

    Anthropic

    76.5

    綜合

    US$0.528

    每次成功任務

    數學92.9推理87.2程式設計82.1
  25. 25

    Claude 4.8 Opus Thinking Max Effort

    Anthropic

    76.2

    綜合

    US$0.983

    每次成功任務

    數學94.3推理89.2程式設計81.8
  26. 26

    Qwen 3.8 Flash Next

    開放

    Alibaba

    76.2

    綜合

    US$0.042

    每次成功任務

    推理87.4數學85.8指令遵循77.1
  27. 27

    GLM-5.3

    開放

    Z.AI

    76.1

    綜合

    US$0.450

    每次成功任務

    數學87.9推理85.8語言79.9
  28. 28

    Claude Sonnet 5 xHigh Effort

    Anthropic

    76.0

    綜合

    US$0.505

    每次成功任務

    數學92.9推理88.7程式設計80.7
  29. 29

    Grok 4.5

    xAI

    75.8

    綜合

    US$0.131

    每次成功任務

    數學90.8推理87.2語言82.8
  30. 30

    Gemini 3.8 Flash High

    Google

    75.8

    綜合

    US$0.307

    每次成功任務

    數學91.6推理89.3語言87.8
  31. 31

    Qwen3.8 27B

    開放

    Alibaba

    75.3

    綜合

    US$0.094

    每次成功任務

    數學86.2推理80.0資料分析76.6
  32. 32

    Muse Spark 1.1 xHigh Effort

    Meta

    75.3

    綜合

    US$0.198

    每次成功任務

    推理87.7數學87.1程式設計77.2
  33. 33

    GPT-5.2 High

    OpenAI

    74.6

    綜合

    US$0.234

    每次成功任務

    數學93.2推理83.2語言79.8
  34. 34

    Gemini 3.5 Flash High

    Google

    74.6

    綜合

    US$0.249

    每次成功任務

    數學88.2語言84.6推理82.0
  35. 35

    Claude 4.6 Opus Thinking High Effort

    Anthropic

    74.5

    綜合

    US$0.404

    每次成功任務

    數學89.3推理88.7語言83.3
  36. 36

    DeepSeek V4 Flash 0731

    開放

    DeepSeek

    74.2

    綜合

    US$0.060

    每次成功任務

    數學86.8推理86.6資料分析79.3
  37. 37

    GPT-5.2 Codex

    OpenAI

    74.0

    綜合

    US$0.187

    每次成功任務

    數學88.8程式設計83.6資料分析78.2
  38. 38

    GPT-5.6 Luna Max Effort

    OpenAI

    73.6

    綜合

    US$0.169

    每次成功任務

    數學87.2推理85.6程式設計82.9
  39. 39

    Gemini 3.6 Flash High

    Google

    73.6

    綜合

    US$0.235

    每次成功任務

    數學86.4推理85.1語言83.9
  40. 40

    GLM-5.2

    開放

    Z.AI

    73.2

    綜合

    US$0.225

    每次成功任務

    數學89.8程式設計79.7推理78.6
  41. 41

    Qwen 3.7 Max

    Alibaba

    73.1

    綜合

    US$0.182

    每次成功任務

    數學85.2推理83.3語言79.7
  42. 42

    Claude 4.6 Sonnet Thinking Medium Effort

    Anthropic

    73.0

    綜合

    US$0.306

    每次成功任務

    數學87.0推理84.8程式設計79.3
  43. 43

    Claude 4.5 Opus Thinking High Effort

    Anthropic

    72.6

    綜合

    US$0.610

    每次成功任務

    數學90.4語言81.3推理80.1
  44. 44

    GPT-6 Luna Max Effort

    OpenAI

    72.0

    綜合

    US$0.026

    每次成功任務

    數學89.1推理81.8程式設計79.0
  45. 45

    Inkling xHigh Effort

    開放

    Thinking Machines

    71.9

    綜合

    US$0.310

    每次成功任務

    數學88.4推理78.3語言73.5
  46. 46

    GLM-5.3 Flash

    開放

    Z.AI

    71.6

    綜合

    US$0.031

    每次成功任務

    數學81.2程式設計79.0推理77.6
  47. 47

    Kimi K2.6 Thinking

    開放

    Moonshot AI

    70.5

    綜合

    US$0.169

    每次成功任務

    數學84.3推理79.4程式設計78.6
  48. 48

    GPT-5.4 Nano xHigh

    OpenAI

    69.6

    綜合

    US$0.091

    每次成功任務

    數學91.0推理81.1程式設計70.8
  49. 49

    ox-alpha-max

    Stealth

    69.2

    綜合

    US$0.000

    每次成功任務

    數學77.5推理76.6程式設計75.8
  50. 50

    Qwen 3.6 Plus

    Alibaba

    68.9

    綜合

    US$0.227

    每次成功任務

    數學83.7程式設計78.2推理75.8
  51. 51

    Kimi K2.7 Code

    開放

    Moonshot AI

    68.4

    綜合

    US$0.100

    每次成功任務

    推理82.8數學79.6語言77.9
  52. 52

    Grok Build 0.1

    xAI

    67.8

    綜合

    US$0.024

    每次成功任務

    數學78.4推理76.4語言72.5
  53. 53

    Nemotron 3 Ultra 550B A55B

    開放

    NVIDIA

    67.4

    綜合

    US$0.371

    每次成功任務

    數學88.7推理74.7指令遵循73.4
  54. 54

    Minimax M3

    Minimax

    67.3

    綜合

    US$0.060

    每次成功任務

    數學76.9語言76.8資料分析76.2
  55. 55

    GPT-5.4 Mini xHigh

    OpenAI

    66.4

    綜合

    US$0.334

    每次成功任務

    數學78.5程式設計71.6推理71.3
  56. 56

    Qwen 3.6 27B

    開放

    Alibaba

    64.0

    綜合

    US$0.202

    每次成功任務

    數學79.9程式設計71.8資料分析70.4
  57. 57

    Gemini 3.5 Flash-Lite High

    Google

    63.9

    綜合

    US$0.069

    每次成功任務

    程式設計76.1數學73.7語言71.8
  58. 58

    Grok 4.3

    xAI

    62.3

    綜合

    US$0.061

    每次成功任務

    數學84.3語言73.6推理70.8

成本為所選範圍中,來源提供的「每次成功任務成本」指標。

分數是某個公開第三方基準測試的快照,未經修改地轉載。Dapols 在其上加入每次成功任務成本的分析。查看來源

A benchmark rank is not a hiring decision.

These scores say which model is strongest at a set of held-out tasks. They don’t say which one fits your workflow, your budget, or the tools you already pay for — and the cheapest model that clears your bar usually beats the highest scorer.