ข้ามไปยังเนื้อหาหลัก

เบนช์มาร์ก AI

โมเดล AI เปรียบเทียบกันด้วยคุณภาพและค่าใช้จ่าย

มุมมองที่ใช้งานได้จริงของคะแนนโมเดลที่เผยแพร่แล้ว ช่วยให้คุณเปรียบเทียบความสามารถ จุดแข็งตามหมวดหมู่ และค่าใช้จ่ายในการรัน โดยไม่สูญเสียรายละเอียด

สำรวจตารางอันดับแหล่งเบนช์มาร์ก การเปิดตัวที่เลือกล่าสุด · 25 มิ.ย. 2569

อัปเดตเบนช์มาร์กและโมเดลล่าสุด

ตารางอันดับในหน้านี้คือการเปิดตัว 25 มิถุนายนของ LiveBench บันทึกใหม่เมื่อ 22 กันยายน 2026 ตอนนี้รวม Grok 4.7 xHigh และ DeepSeek V4.1 Flash Max Effort แล้ว หมายเหตุโมเดลด้านล่างมาจากหน้าของผู้ให้บริการเอง และระบุไว้เช่นนั้น

Grok 4.6

ราคา API $2 / $6 เท่ากับ Grok 4.5 xAI รายงานคะแนน Artificial Analysis Intelligence Index ที่ 61 — เท่ากับ GPT-5.6 Sol Max และต่ำกว่า Fable 5 Max อยู่หนึ่งคะแนน แข็งแกร่งในการประเมินงานความรู้ และได้ 26% ใน Terminal-Bench v3

อ่านสรุป Grok 4.6

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash แทนที่ V4 Flash เมื่อ 10 กันยายน 2026 บนรหัส API deepseek-flash ใหม่ ในราคา $0.15 / $0.60 ต่อ 1 ล้านโทเคนนอกช่วงพีก และ $0.30 / $1.20 ช่วงพีก ตั้งแต่ 14 กันยายน คำขอ V4 Pro ก็ถูกส่งไปยังตัวนี้ด้วย ดังนั้นให้เปลี่ยนรหัสโมเดลตอนนี้ LiveBench ให้คะแนน V4.1 Flash Max Effort ที่ 81.1 โดยรวม

ดูในตัวติดตามโมเดล

แถวในตารางอันดับมาจากข้อมูล LiveBench ที่เผยแพร่เท่านั้น เราไม่ได้คิดคะแนนขึ้นเอง

Best overall

Claude Fable 5.1 Max Effort leads this snapshot at 83.4 overall, $1.212 per successful task.

Best value per task

ox-alpha-max runs at $0.000 per successful task and still scores 69.2 overall.

Best open weights

DeepSeek V4.1 Flash Max Effort is the strongest open-weight model here at 81.1 overall — the option you can host yourself.

Best per capability

If your work is mostly one kind of task, these lead their category in this snapshot.

การให้เหตุผล
GPT-6 Astra Max Effort 92.7
การเขียนโค้ด
Claude 5.5 Opus Thinking Max Effort 89.3
การเขียนโค้ดแบบเอเจนต์
DeepSeek V4.1 Flash Max Effort 77.3
คณิตศาสตร์
Claude 5.5 Opus Thinking Max Effort 97.1
การวิเคราะห์ข้อมูล
GPT-6 Astra Max Effort 83.0
ภาษา
Claude Fable 5 Max Effort 90.7
การทำตามคำสั่ง
Gemini 3.8 Flash High 81.4

Every number above comes from the 2026-06-25 release dated 2026-06-25, published by a third-party benchmark and reproduced unaltered.

รูปร่างของสนาม ในสองภาพ

แผนภูมิแรกตอบคำถามว่า "ใครแข็งแกร่งที่สุด" แผนภูมิที่สองตอบคำถามที่ทำให้คุณเสียเงินจริง: ตัวไหนคุ้มค่าที่จะจ่าย

จัดอันดับอย่างไร

ยาวกว่าดีกว่า แท่งแสดงคะแนน โดยรวม จาก 100 ตัวเลขข้างแต่ละแท่งคือค่าที่แน่นอน เลือกแถวเพื่อนำโมเดลนั้นไปยังแผนภูมิค่าใช้จ่ายด้านล่าง

แสดง 12 อันดับแรกจาก 58 เปลี่ยนไปที่มุมมองการเปรียบเทียบเต็มเพื่อดูทุกโมเดล

คุณภาพเทียบกับค่าใช้จ่าย

ขึ้นคือแข็งแกร่งกว่า ซ้ายคือถูกกว่า — ดังนั้นตัวที่คุ้มที่สุดจะอยู่มุมซ้ายบน จุดที่มีหมายเลขคือเส้นคุณค่า: ไม่มีตัวที่ถูกกว่าที่ให้คะแนนสูงกว่า จุดสีเทาถูกแซงทั้งด้านคะแนนและราคา

60657075808590US$0.024US$0.050US$0.100US$0.200US$0.500US$1.00US$1.4391234567Claude Fable 5.1 Max Effort83.4 · US$1.212ค่าใช้จ่ายต่องานที่สำเร็จ (สเกลลอการิทึม — แต่ละขั้นคือการคูณ ไม่ใช่การบวก)โดยรวม

ที่เลือก

Claude Fable 5.1 Max Effort

Anthropic

โดยรวม
83.4
ต่องานที่สำเร็จ
US$1.212

#7 · อยู่บนเส้นคุณค่า

ตัวที่คุ้มค่า (ถูกที่สุด → แข็งแกร่งที่สุด)

  • คุ้มค่าที่สุดในราคาของมัน
  • ถูกแซงทั้งด้านคะแนนและราคา

วางเมาส์หรือแตะจุดที่มีหมายเลข (หรือแถวทางขวา) เพื่ออ่านคะแนนและค่าใช้จ่ายที่แน่นอน ปุ่มลูกศรเลื่อนดูโมเดลจากถูกที่สุดไปแพงที่สุด

อ่านตัวเลข 57 ชุดเดียวกันเป็นตาราง
คุณภาพเทียบกับค่าใช้จ่าย
โมเดลองค์กรโดยรวมต่องานที่สำเร็จ
Claude Fable 5.1 Max Effort#7 · คุ้มค่าที่สุดในราคาของมันAnthropic83.4US$1.212
Claude 5.5 Opus Thinking Max Effort#6 · คุ้มค่าที่สุดในราคาของมันAnthropic83.2US$0.799
Claude Fable 5 Max EffortAnthropic83.0US$1.439
GPT-6 Astra Max Effort#5 · คุ้มค่าที่สุดในราคาของมันOpenAI82.2US$0.736
GPT-6.1 Sol Max Effort#4 · คุ้มค่าที่สุดในราคาของมันOpenAI81.6US$0.142
Muse Spark 1.3 xHigh EffortMeta81.6US$0.219
DeepSeek V4.1 Flash Max Effort#3 · คุ้มค่าที่สุดในราคาของมันDeepSeek81.1US$0.029
GPT-5.6 Sol Max EffortOpenAI81.0US$0.515
GPT-5.5 Thinking xHigh EffortOpenAI80.2US$0.435
Claude 5 Opus Thinking Max EffortAnthropic80.1US$0.699
GPT-6 Sol Max EffortOpenAI79.3US$0.268
Kimi K3Moonshot AI79.2US$0.348
Gemini 3.7 Flash HighGoogle78.8US$0.157
Qwen 3.8 MaxAlibaba78.5US$0.275
Grok 4.6 xHighxAI78.0US$0.207
Muse Spark 1.2 xHigh EffortMeta78.0US$0.375
GPT-5.4 Thinking xHigh EffortOpenAI78.0US$0.387
GPT-5.6 Terra Max EffortOpenAI77.9US$0.352
Claude Sonnet 5.5 xHigh EffortAnthropic77.8US$0.141
DeepSeek V4 Pro 0813DeepSeek77.4US$0.044
Grok 4.7 xHighxAI77.4US$0.718
Gemini 3.1 Pro Preview HighGoogle77.0US$0.286
DeepSeek V4 Flash Vision ExpDeepSeek76.8US$0.051
Claude 4.7 Opus Thinking xHigh EffortAnthropic76.5US$0.528
Qwen 3.8 Flash NextAlibaba76.2US$0.042
Claude 4.8 Opus Thinking Max EffortAnthropic76.2US$0.983
GLM-5.3Z.AI76.1US$0.450
Claude Sonnet 5 xHigh EffortAnthropic76.0US$0.505
Grok 4.5xAI75.8US$0.131
Gemini 3.8 Flash HighGoogle75.8US$0.307
Qwen3.8 27BAlibaba75.3US$0.094
Muse Spark 1.1 xHigh EffortMeta75.3US$0.198
GPT-5.2 HighOpenAI74.6US$0.234
Gemini 3.5 Flash HighGoogle74.6US$0.249
Claude 4.6 Opus Thinking High EffortAnthropic74.5US$0.404
DeepSeek V4 Flash 0731DeepSeek74.2US$0.060
GPT-5.2 CodexOpenAI74.0US$0.187
GPT-5.6 Luna Max EffortOpenAI73.6US$0.169
Gemini 3.6 Flash HighGoogle73.6US$0.235
GLM-5.2Z.AI73.2US$0.225
Qwen 3.7 MaxAlibaba73.1US$0.182
Claude 4.6 Sonnet Thinking Medium EffortAnthropic73.0US$0.306
Claude 4.5 Opus Thinking High EffortAnthropic72.6US$0.610
GPT-6 Luna Max Effort#2 · คุ้มค่าที่สุดในราคาของมันOpenAI72.0US$0.026
Inkling xHigh EffortThinking Machines71.9US$0.310
GLM-5.3 FlashZ.AI71.6US$0.031
Kimi K2.6 ThinkingMoonshot AI70.5US$0.169
GPT-5.4 Nano xHighOpenAI69.6US$0.091
Qwen 3.6 PlusAlibaba68.9US$0.227
Kimi K2.7 CodeMoonshot AI68.4US$0.100
Grok Build 0.1#1 · คุ้มค่าที่สุดในราคาของมันxAI67.8US$0.024
Nemotron 3 Ultra 550B A55BNVIDIA67.4US$0.371
Minimax M3Minimax67.3US$0.060
GPT-5.4 Mini xHighOpenAI66.4US$0.334
Qwen 3.6 27BAlibaba64.0US$0.202
Gemini 3.5 Flash-Lite HighGoogle63.9US$0.069
Grok 4.3xAI62.3US$0.061

โปรไฟล์หมวดหมู่

เลือกได้สูงสุดสามโมเดลจากตารางอันดับเพื่อเปรียบเทียบคะแนนทั้งเจ็ดหมวดหมู่

  • Claude Fable 5.1 Max Effort83.4
  • ox-alpha-max69.2
  • DeepSeek V4.1 Flash Max Effort81.1
  • การให้เหตุผล91.776.686.7
  • การเขียนโค้ด86.475.880.0
  • การเขียนโค้ดแบบเอเจนต์66.152.677.3
  • คณิตศาสตร์97.077.593.3
  • การวิเคราะห์ข้อมูล80.375.879.3
  • ภาษา89.566.181.2
  • การทำตามคำสั่ง73.060.370.0

ทุกแทร็กวิ่งจาก 0 ถึง 100 ยิ่งไปทางขวาแข็งแกร่งขึ้น ตัวเลขตัวหนาคือผู้นำในแถวนั้น

อ่านคะแนนเหล่านี้เป็นตาราง
โปรไฟล์หมวดหมู่
หมวดหมู่Claude Fable 5.1 Max Effortox-alpha-maxDeepSeek V4.1 Flash Max Effort
การให้เหตุผล91.776.686.7
การเขียนโค้ด86.475.880.0
การเขียนโค้ดแบบเอเจนต์66.152.677.3
คณิตศาสตร์97.077.593.3
การวิเคราะห์ข้อมูล80.375.879.3
ภาษา89.566.181.2
การทำตามคำสั่ง73.060.370.0

ตารางอันดับ

เรียงทุกหมวดหมู่ กรองรายการ และเปิดโมเดลเพื่อดูการแจกแจงงานย่อยที่เผยแพร่

  1. 01

    Claude Fable 5.1 Max Effort

    Anthropic

    83.4

    โดยรวม

    US$1.212

    ต่องานที่สำเร็จ

    คณิตศาสตร์97.0การให้เหตุผล91.7ภาษา89.5
  2. 02

    Claude 5.5 Opus Thinking Max Effort

    Anthropic

    83.2

    โดยรวม

    US$0.799

    ต่องานที่สำเร็จ

    คณิตศาสตร์97.1การให้เหตุผล92.2การเขียนโค้ด89.3
  3. 03

    Claude Fable 5 Max Effort

    Anthropic

    83.0

    โดยรวม

    US$1.439

    ต่องานที่สำเร็จ

    คณิตศาสตร์96.0ภาษา90.7การให้เหตุผล89.7
  4. 04

    GPT-6 Astra Max Effort

    OpenAI

    82.2

    โดยรวม

    US$0.736

    ต่องานที่สำเร็จ

    คณิตศาสตร์96.8การให้เหตุผล92.7ภาษา89.4
  5. 05

    GPT-6.1 Sol Max Effort

    OpenAI

    81.6

    โดยรวม

    US$0.142

    ต่องานที่สำเร็จ

    คณิตศาสตร์96.8การให้เหตุผล92.6ภาษา90.1
  6. 06

    Muse Spark 1.3 xHigh Effort

    Meta

    81.6

    โดยรวม

    US$0.219

    ต่องานที่สำเร็จ

    คณิตศาสตร์95.9การให้เหตุผล89.7ภาษา82.8
  7. 07

    DeepSeek V4.1 Flash Max Effort

    เปิด

    DeepSeek

    81.1

    โดยรวม

    US$0.029

    ต่องานที่สำเร็จ

    คณิตศาสตร์93.3การให้เหตุผล86.7ภาษา81.2
  8. 08

    GPT-5.6 Sol Max Effort

    OpenAI

    81.0

    โดยรวม

    US$0.515

    ต่องานที่สำเร็จ

    คณิตศาสตร์96.2การให้เหตุผล91.7ภาษา87.7
  9. 09

    GPT-5.5 Thinking xHigh Effort

    OpenAI

    80.2

    โดยรวม

    US$0.435

    ต่องานที่สำเร็จ

    คณิตศาสตร์95.9การให้เหตุผล89.7ภาษา87.4
  10. 10

    Claude 5 Opus Thinking Max Effort

    Anthropic

    80.1

    โดยรวม

    US$0.699

    ต่องานที่สำเร็จ

    คณิตศาสตร์95.7การให้เหตุผล91.2ภาษา88.7
  11. 11

    GPT-6 Sol Max Effort

    OpenAI

    79.3

    โดยรวม

    US$0.268

    ต่องานที่สำเร็จ

    คณิตศาสตร์96.4การให้เหตุผล88.7ภาษา85.3
  12. 12

    Kimi K3

    เปิด

    Moonshot AI

    79.2

    โดยรวม

    US$0.348

    ต่องานที่สำเร็จ

    การให้เหตุผล90.7ภาษา85.5คณิตศาสตร์84.4
  13. 13

    Gemini 3.7 Flash High

    Google

    78.8

    โดยรวม

    US$0.157

    ต่องานที่สำเร็จ

    คณิตศาสตร์93.5การให้เหตุผล87.8ภาษา85.5
  14. 14

    Qwen 3.8 Max

    เปิด

    Alibaba

    78.5

    โดยรวม

    US$0.275

    ต่องานที่สำเร็จ

    คณิตศาสตร์91.3การให้เหตุผล88.2ภาษา79.7
  15. 15

    Muse Spark 1.2 xHigh Effort

    Meta

    78.0

    โดยรวม

    US$0.375

    ต่องานที่สำเร็จ

    คณิตศาสตร์91.2การให้เหตุผล90.0ภาษา78.6
  16. 16

    Grok 4.6 xHigh

    xAI

    78.0

    โดยรวม

    US$0.207

    ต่องานที่สำเร็จ

    คณิตศาสตร์92.6การให้เหตุผล90.5ภาษา83.7
  17. 17

    GPT-5.4 Thinking xHigh Effort

    OpenAI

    78.0

    โดยรวม

    US$0.387

    ต่องานที่สำเร็จ

    คณิตศาสตร์94.1การให้เหตุผล88.1ภาษา82.6
  18. 18

    GPT-5.6 Terra Max Effort

    OpenAI

    77.9

    โดยรวม

    US$0.352

    ต่องานที่สำเร็จ

    คณิตศาสตร์94.9การให้เหตุผล90.6ภาษา82.9
  19. 19

    Claude Sonnet 5.5 xHigh Effort

    Anthropic

    77.8

    โดยรวม

    US$0.141

    ต่องานที่สำเร็จ

    คณิตศาสตร์96.7การเขียนโค้ด88.9การให้เหตุผล86.8
  20. 20

    DeepSeek V4 Pro 0813

    เปิด

    DeepSeek

    77.4

    โดยรวม

    US$0.044

    ต่องานที่สำเร็จ

    คณิตศาสตร์95.1การให้เหตุผล85.8ภาษา82.1
  21. 21

    Grok 4.7 xHigh

    xAI

    77.4

    โดยรวม

    US$0.718

    ต่องานที่สำเร็จ

    คณิตศาสตร์95.7การให้เหตุผล82.7ภาษา80.1
  22. 22

    Gemini 3.1 Pro Preview High

    Google

    77.0

    โดยรวม

    US$0.286

    ต่องานที่สำเร็จ

    คณิตศาสตร์91.0ภาษา85.4การให้เหตุผล84.0
  23. 23

    DeepSeek V4 Flash Vision Exp

    เปิด

    DeepSeek

    76.8

    โดยรวม

    US$0.051

    ต่องานที่สำเร็จ

    คณิตศาสตร์87.8การให้เหตุผล85.4ภาษา80.4
  24. 24

    Claude 4.7 Opus Thinking xHigh Effort

    Anthropic

    76.5

    โดยรวม

    US$0.528

    ต่องานที่สำเร็จ

    คณิตศาสตร์92.9การให้เหตุผล87.2การเขียนโค้ด82.1
  25. 25

    Claude 4.8 Opus Thinking Max Effort

    Anthropic

    76.2

    โดยรวม

    US$0.983

    ต่องานที่สำเร็จ

    คณิตศาสตร์94.3การให้เหตุผล89.2การเขียนโค้ด81.8
  26. 26

    Qwen 3.8 Flash Next

    เปิด

    Alibaba

    76.2

    โดยรวม

    US$0.042

    ต่องานที่สำเร็จ

    การให้เหตุผล87.4คณิตศาสตร์85.8การทำตามคำสั่ง77.1
  27. 27

    GLM-5.3

    เปิด

    Z.AI

    76.1

    โดยรวม

    US$0.450

    ต่องานที่สำเร็จ

    คณิตศาสตร์87.9การให้เหตุผล85.8ภาษา79.9
  28. 28

    Claude Sonnet 5 xHigh Effort

    Anthropic

    76.0

    โดยรวม

    US$0.505

    ต่องานที่สำเร็จ

    คณิตศาสตร์92.9การให้เหตุผล88.7การเขียนโค้ด80.7
  29. 29

    Grok 4.5

    xAI

    75.8

    โดยรวม

    US$0.131

    ต่องานที่สำเร็จ

    คณิตศาสตร์90.8การให้เหตุผล87.2ภาษา82.8
  30. 30

    Gemini 3.8 Flash High

    Google

    75.8

    โดยรวม

    US$0.307

    ต่องานที่สำเร็จ

    คณิตศาสตร์91.6การให้เหตุผล89.3ภาษา87.8
  31. 31

    Qwen3.8 27B

    เปิด

    Alibaba

    75.3

    โดยรวม

    US$0.094

    ต่องานที่สำเร็จ

    คณิตศาสตร์86.2การให้เหตุผล80.0การวิเคราะห์ข้อมูล76.6
  32. 32

    Muse Spark 1.1 xHigh Effort

    Meta

    75.3

    โดยรวม

    US$0.198

    ต่องานที่สำเร็จ

    การให้เหตุผล87.7คณิตศาสตร์87.1การเขียนโค้ด77.2
  33. 33

    GPT-5.2 High

    OpenAI

    74.6

    โดยรวม

    US$0.234

    ต่องานที่สำเร็จ

    คณิตศาสตร์93.2การให้เหตุผล83.2ภาษา79.8
  34. 34

    Gemini 3.5 Flash High

    Google

    74.6

    โดยรวม

    US$0.249

    ต่องานที่สำเร็จ

    คณิตศาสตร์88.2ภาษา84.6การให้เหตุผล82.0
  35. 35

    Claude 4.6 Opus Thinking High Effort

    Anthropic

    74.5

    โดยรวม

    US$0.404

    ต่องานที่สำเร็จ

    คณิตศาสตร์89.3การให้เหตุผล88.7ภาษา83.3
  36. 36

    DeepSeek V4 Flash 0731

    เปิด

    DeepSeek

    74.2

    โดยรวม

    US$0.060

    ต่องานที่สำเร็จ

    คณิตศาสตร์86.8การให้เหตุผล86.6การวิเคราะห์ข้อมูล79.3
  37. 37

    GPT-5.2 Codex

    OpenAI

    74.0

    โดยรวม

    US$0.187

    ต่องานที่สำเร็จ

    คณิตศาสตร์88.8การเขียนโค้ด83.6การวิเคราะห์ข้อมูล78.2
  38. 38

    GPT-5.6 Luna Max Effort

    OpenAI

    73.6

    โดยรวม

    US$0.169

    ต่องานที่สำเร็จ

    คณิตศาสตร์87.2การให้เหตุผล85.6การเขียนโค้ด82.9
  39. 39

    Gemini 3.6 Flash High

    Google

    73.6

    โดยรวม

    US$0.235

    ต่องานที่สำเร็จ

    คณิตศาสตร์86.4การให้เหตุผล85.1ภาษา83.9
  40. 40

    GLM-5.2

    เปิด

    Z.AI

    73.2

    โดยรวม

    US$0.225

    ต่องานที่สำเร็จ

    คณิตศาสตร์89.8การเขียนโค้ด79.7การให้เหตุผล78.6
  41. 41

    Qwen 3.7 Max

    Alibaba

    73.1

    โดยรวม

    US$0.182

    ต่องานที่สำเร็จ

    คณิตศาสตร์85.2การให้เหตุผล83.3ภาษา79.7
  42. 42

    Claude 4.6 Sonnet Thinking Medium Effort

    Anthropic

    73.0

    โดยรวม

    US$0.306

    ต่องานที่สำเร็จ

    คณิตศาสตร์87.0การให้เหตุผล84.8การเขียนโค้ด79.3
  43. 43

    Claude 4.5 Opus Thinking High Effort

    Anthropic

    72.6

    โดยรวม

    US$0.610

    ต่องานที่สำเร็จ

    คณิตศาสตร์90.4ภาษา81.3การให้เหตุผล80.1
  44. 44

    GPT-6 Luna Max Effort

    OpenAI

    72.0

    โดยรวม

    US$0.026

    ต่องานที่สำเร็จ

    คณิตศาสตร์89.1การให้เหตุผล81.8การเขียนโค้ด79.0
  45. 45

    Inkling xHigh Effort

    เปิด

    Thinking Machines

    71.9

    โดยรวม

    US$0.310

    ต่องานที่สำเร็จ

    คณิตศาสตร์88.4การให้เหตุผล78.3ภาษา73.5
  46. 46

    GLM-5.3 Flash

    เปิด

    Z.AI

    71.6

    โดยรวม

    US$0.031

    ต่องานที่สำเร็จ

    คณิตศาสตร์81.2การเขียนโค้ด79.0การให้เหตุผล77.6
  47. 47

    Kimi K2.6 Thinking

    เปิด

    Moonshot AI

    70.5

    โดยรวม

    US$0.169

    ต่องานที่สำเร็จ

    คณิตศาสตร์84.3การให้เหตุผล79.4การเขียนโค้ด78.6
  48. 48

    GPT-5.4 Nano xHigh

    OpenAI

    69.6

    โดยรวม

    US$0.091

    ต่องานที่สำเร็จ

    คณิตศาสตร์91.0การให้เหตุผล81.1การเขียนโค้ด70.8
  49. 49

    ox-alpha-max

    Stealth

    69.2

    โดยรวม

    US$0.000

    ต่องานที่สำเร็จ

    คณิตศาสตร์77.5การให้เหตุผล76.6การเขียนโค้ด75.8
  50. 50

    Qwen 3.6 Plus

    Alibaba

    68.9

    โดยรวม

    US$0.227

    ต่องานที่สำเร็จ

    คณิตศาสตร์83.7การเขียนโค้ด78.2การให้เหตุผล75.8
  51. 51

    Kimi K2.7 Code

    เปิด

    Moonshot AI

    68.4

    โดยรวม

    US$0.100

    ต่องานที่สำเร็จ

    การให้เหตุผล82.8คณิตศาสตร์79.6ภาษา77.9
  52. 52

    Grok Build 0.1

    xAI

    67.8

    โดยรวม

    US$0.024

    ต่องานที่สำเร็จ

    คณิตศาสตร์78.4การให้เหตุผล76.4ภาษา72.5
  53. 53

    Nemotron 3 Ultra 550B A55B

    เปิด

    NVIDIA

    67.4

    โดยรวม

    US$0.371

    ต่องานที่สำเร็จ

    คณิตศาสตร์88.7การให้เหตุผล74.7การทำตามคำสั่ง73.4
  54. 54

    Minimax M3

    Minimax

    67.3

    โดยรวม

    US$0.060

    ต่องานที่สำเร็จ

    คณิตศาสตร์76.9ภาษา76.8การวิเคราะห์ข้อมูล76.2
  55. 55

    GPT-5.4 Mini xHigh

    OpenAI

    66.4

    โดยรวม

    US$0.334

    ต่องานที่สำเร็จ

    คณิตศาสตร์78.5การเขียนโค้ด71.6การให้เหตุผล71.3
  56. 56

    Qwen 3.6 27B

    เปิด

    Alibaba

    64.0

    โดยรวม

    US$0.202

    ต่องานที่สำเร็จ

    คณิตศาสตร์79.9การเขียนโค้ด71.8การวิเคราะห์ข้อมูล70.4
  57. 57

    Gemini 3.5 Flash-Lite High

    Google

    63.9

    โดยรวม

    US$0.069

    ต่องานที่สำเร็จ

    การเขียนโค้ด76.1คณิตศาสตร์73.7ภาษา71.8
  58. 58

    Grok 4.3

    xAI

    62.3

    โดยรวม

    US$0.061

    ต่องานที่สำเร็จ

    คณิตศาสตร์84.3ภาษา73.6การให้เหตุผล70.8

ค่าใช้จ่ายคือเมตริกค่าใช้จ่ายต่องานที่สำเร็จตามที่แหล่งข้อมูลให้มา สำหรับขอบเขตที่เลือก

คะแนนเป็นสแน็ปช็อตของเบนช์มาร์กสาธารณะของบุคคลที่สาม ทำซ้ำโดยไม่เปลี่ยนแปลง Dapols เพิ่มการวิเคราะห์ค่าใช้จ่ายต่องานที่สำเร็จเข้าไปด้านบนดูแหล่งที่มา

A benchmark rank is not a hiring decision.

These scores say which model is strongest at a set of held-out tasks. They don’t say which one fits your workflow, your budget, or the tools you already pay for — and the cheapest model that clears your bar usually beats the highest scorer.