Przejdź do głównej treści

Benchmarki AI

Modele AI porównane pod względem jakości i kosztu.

Praktyczny widok opublikowanych wyników modeli, który pomaga porównać możliwości, mocne strony w kategoriach i koszt działania, bez gubienia szczegółów.

Przeglądaj rankingŹródło benchmarku Ostatnia wybrana wersja · 25 cze 2026

Najnowsze aktualizacje benchmarków i modeli

Ranking na tej stronie to wydanie LiveBench z 25 czerwca, ponownie zapisane 22 września 2026. Obejmuje teraz Grok 4.7 xHigh i DeepSeek V4.1 Flash Max Effort. Poniższe uwagi o modelach pochodzą ze stron samych dostawców i są tak oznaczone.

Grok 4.6

Ta sama cena API, 2 $ / 6 $, co w Grok 4.5. xAI podaje Artificial Analysis Intelligence Index na poziomie 61: remis z GPT-5.6 Sol Max i punkt za Fable 5 Max. Mocny w ewaluacjach pracy wiedzowej; 26% w Terminal-Bench v3.

Przeczytaj omówienie Grok 4.6

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash zastąpił V4 Flash 10 Sep 2026 pod nowym identyfikatorem API deepseek-flash, w cenie 0,15 $ / 0,60 $ za 1 mln tokenów poza szczytem i 0,30 $ / 1,20 $ w szczycie. Od 14 Sep żądania V4 Pro też są kierowane do niego, więc zmień identyfikatory modeli już teraz. LiveBench ocenia teraz V4.1 Flash Max Effort na 81,1 ogółem.

Zobacz to w trackerze modeli

Wiersze rankingu pochodzą wyłącznie z opublikowanych danych LiveBench. Nie wymyślamy wyników.

Best overall

Claude Fable 5.1 Max Effort leads this snapshot at 83.4 overall, $1.212 per successful task.

Best value per task

ox-alpha-max runs at $0.000 per successful task and still scores 69.2 overall.

Best open weights

DeepSeek V4.1 Flash Max Effort is the strongest open-weight model here at 81.1 overall — the option you can host yourself.

Best per capability

If your work is mostly one kind of task, these lead their category in this snapshot.

Rozumowanie
GPT-6 Astra Max Effort 92.7
Kodowanie
Claude 5.5 Opus Thinking Max Effort 89.3
Kodowanie agentowe
DeepSeek V4.1 Flash Max Effort 77.3
Matematyka
Claude 5.5 Opus Thinking Max Effort 97.1
Analiza danych
GPT-6 Astra Max Effort 83.0
Język
Claude Fable 5 Max Effort 90.7
Wykonywanie instrukcji
Gemini 3.8 Flash High 81.4

Every number above comes from the 2026-06-25 release dated 2026-06-25, published by a third-party benchmark and reproduced unaltered.

Kształt całej dziedziny w dwóch wykresach.

Pierwszy wykres odpowiada na pytanie „który jest najsilniejszy”. Drugi odpowiada na pytanie, które naprawdę kosztuje pieniądze: za który warto zapłacić.

Jak się układają

Dłuższy słupek znaczy lepszy wynik. Słupki pokazują wynik Ogółem w skali 100, a liczba obok każdego słupka to dokładna wartość. Wybierz wiersz, by przenieść ten model na wykres kosztu poniżej.

Pokazano 12 z 58 najlepszych. Przełącz na pełny widok porównania, by zobaczyć każdy model.

Jakość a koszt

W górę jest mocniej, w lewo taniej, więc najlepsze zakupy są w lewym górnym rogu. Ponumerowane punkty tworzą granicę wartości: nic tańszego nie ma wyższego wyniku. Szare punkty są przegrane zarówno pod względem wyniku, jak i ceny.

606570758085900,024 USD0,050 USD0,100 USD0,200 USD0,500 USD1,00 USD1,439 USD1234567Claude Fable 5.1 Max Effort83.4 · 1,212 USDKoszt za udane zadanie (skala logarytmiczna, każdy krok to mnożnik, a nie dodawanie)Ogółem

Wybrany

Claude Fable 5.1 Max Effort

Anthropic

Ogółem
83.4
za udane zadanie
1,212 USD

#7 · Na granicy wartości.

Najlepsze zakupy (od najtańszego do najmocniejszego)

  • Najlepsza wartość za swoją cenę
  • Przegrany pod względem wyniku i ceny

Najedź lub dotknij ponumerowanego punktu (albo jego wiersza po prawej), by odczytać dokładny wynik i koszt. Klawisze strzałek przechodzą od najtańszego do najdroższego modelu.

Odczytaj te same 57 liczb jako tabelę
Jakość a koszt
ModelOrganizacjaOgółemza udane zadanie
Claude Fable 5.1 Max Effort#7 · Najlepsza wartość za swoją cenęAnthropic83.41,212 USD
Claude 5.5 Opus Thinking Max Effort#6 · Najlepsza wartość za swoją cenęAnthropic83.20,799 USD
Claude Fable 5 Max EffortAnthropic83.01,439 USD
GPT-6 Astra Max Effort#5 · Najlepsza wartość za swoją cenęOpenAI82.20,736 USD
GPT-6.1 Sol Max Effort#4 · Najlepsza wartość za swoją cenęOpenAI81.60,142 USD
Muse Spark 1.3 xHigh EffortMeta81.60,219 USD
DeepSeek V4.1 Flash Max Effort#3 · Najlepsza wartość za swoją cenęDeepSeek81.10,029 USD
GPT-5.6 Sol Max EffortOpenAI81.00,515 USD
GPT-5.5 Thinking xHigh EffortOpenAI80.20,435 USD
Claude 5 Opus Thinking Max EffortAnthropic80.10,699 USD
GPT-6 Sol Max EffortOpenAI79.30,268 USD
Kimi K3Moonshot AI79.20,348 USD
Gemini 3.7 Flash HighGoogle78.80,157 USD
Qwen 3.8 MaxAlibaba78.50,275 USD
Grok 4.6 xHighxAI78.00,207 USD
Muse Spark 1.2 xHigh EffortMeta78.00,375 USD
GPT-5.4 Thinking xHigh EffortOpenAI78.00,387 USD
GPT-5.6 Terra Max EffortOpenAI77.90,352 USD
Claude Sonnet 5.5 xHigh EffortAnthropic77.80,141 USD
DeepSeek V4 Pro 0813DeepSeek77.40,044 USD
Grok 4.7 xHighxAI77.40,718 USD
Gemini 3.1 Pro Preview HighGoogle77.00,286 USD
DeepSeek V4 Flash Vision ExpDeepSeek76.80,051 USD
Claude 4.7 Opus Thinking xHigh EffortAnthropic76.50,528 USD
Qwen 3.8 Flash NextAlibaba76.20,042 USD
Claude 4.8 Opus Thinking Max EffortAnthropic76.20,983 USD
GLM-5.3Z.AI76.10,450 USD
Claude Sonnet 5 xHigh EffortAnthropic76.00,505 USD
Grok 4.5xAI75.80,131 USD
Gemini 3.8 Flash HighGoogle75.80,307 USD
Qwen3.8 27BAlibaba75.30,094 USD
Muse Spark 1.1 xHigh EffortMeta75.30,198 USD
GPT-5.2 HighOpenAI74.60,234 USD
Gemini 3.5 Flash HighGoogle74.60,249 USD
Claude 4.6 Opus Thinking High EffortAnthropic74.50,404 USD
DeepSeek V4 Flash 0731DeepSeek74.20,060 USD
GPT-5.2 CodexOpenAI74.00,187 USD
GPT-5.6 Luna Max EffortOpenAI73.60,169 USD
Gemini 3.6 Flash HighGoogle73.60,235 USD
GLM-5.2Z.AI73.20,225 USD
Qwen 3.7 MaxAlibaba73.10,182 USD
Claude 4.6 Sonnet Thinking Medium EffortAnthropic73.00,306 USD
Claude 4.5 Opus Thinking High EffortAnthropic72.60,610 USD
GPT-6 Luna Max Effort#2 · Najlepsza wartość za swoją cenęOpenAI72.00,026 USD
Inkling xHigh EffortThinking Machines71.90,310 USD
GLM-5.3 FlashZ.AI71.60,031 USD
Kimi K2.6 ThinkingMoonshot AI70.50,169 USD
GPT-5.4 Nano xHighOpenAI69.60,091 USD
Qwen 3.6 PlusAlibaba68.90,227 USD
Kimi K2.7 CodeMoonshot AI68.40,100 USD
Grok Build 0.1#1 · Najlepsza wartość za swoją cenęxAI67.80,024 USD
Nemotron 3 Ultra 550B A55BNVIDIA67.40,371 USD
Minimax M3Minimax67.30,060 USD
GPT-5.4 Mini xHighOpenAI66.40,334 USD
Qwen 3.6 27BAlibaba64.00,202 USD
Gemini 3.5 Flash-Lite HighGoogle63.90,069 USD
Grok 4.3xAI62.30,061 USD

Profil kategorii

Wybierz do trzech modeli z rankingu, by porównać ich siedem wyników kategorii.

  • Claude Fable 5.1 Max Effort83.4
  • ox-alpha-max69.2
  • DeepSeek V4.1 Flash Max Effort81.1
  • Rozumowanie91.776.686.7
  • Kodowanie86.475.880.0
  • Kodowanie agentowe66.152.677.3
  • Matematyka97.077.593.3
  • Analiza danych80.375.879.3
  • Język89.566.181.2
  • Wykonywanie instrukcji73.060.370.0

Każda ścieżka biegnie od 0 do 100. Dalej w prawo znaczy mocniej, a pogrubiona liczba to lider w danym wierszu.

Odczytaj te wyniki jako tabelę
Profil kategorii
KategoriaClaude Fable 5.1 Max Effortox-alpha-maxDeepSeek V4.1 Flash Max Effort
Rozumowanie91.776.686.7
Kodowanie86.475.880.0
Kodowanie agentowe66.152.677.3
Matematyka97.077.593.3
Analiza danych80.375.879.3
Język89.566.181.2
Wykonywanie instrukcji73.060.370.0

Ranking

Sortuj każdą kategorię, zawężaj listę i otwórz model, by zobaczyć opublikowany podział na podzadania.

  1. 01

    Claude Fable 5.1 Max Effort

    Anthropic

    83.4

    Ogółem

    1,212 USD

    za udane zadanie

    Matematyka97.0Rozumowanie91.7Język89.5
  2. 02

    Claude 5.5 Opus Thinking Max Effort

    Anthropic

    83.2

    Ogółem

    0,799 USD

    za udane zadanie

    Matematyka97.1Rozumowanie92.2Kodowanie89.3
  3. 03

    Claude Fable 5 Max Effort

    Anthropic

    83.0

    Ogółem

    1,439 USD

    za udane zadanie

    Matematyka96.0Język90.7Rozumowanie89.7
  4. 04

    GPT-6 Astra Max Effort

    OpenAI

    82.2

    Ogółem

    0,736 USD

    za udane zadanie

    Matematyka96.8Rozumowanie92.7Język89.4
  5. 05

    GPT-6.1 Sol Max Effort

    OpenAI

    81.6

    Ogółem

    0,142 USD

    za udane zadanie

    Matematyka96.8Rozumowanie92.6Język90.1
  6. 06

    Muse Spark 1.3 xHigh Effort

    Meta

    81.6

    Ogółem

    0,219 USD

    za udane zadanie

    Matematyka95.9Rozumowanie89.7Język82.8
  7. 07

    DeepSeek V4.1 Flash Max Effort

    otwarte

    DeepSeek

    81.1

    Ogółem

    0,029 USD

    za udane zadanie

    Matematyka93.3Rozumowanie86.7Język81.2
  8. 08

    GPT-5.6 Sol Max Effort

    OpenAI

    81.0

    Ogółem

    0,515 USD

    za udane zadanie

    Matematyka96.2Rozumowanie91.7Język87.7
  9. 09

    GPT-5.5 Thinking xHigh Effort

    OpenAI

    80.2

    Ogółem

    0,435 USD

    za udane zadanie

    Matematyka95.9Rozumowanie89.7Język87.4
  10. 10

    Claude 5 Opus Thinking Max Effort

    Anthropic

    80.1

    Ogółem

    0,699 USD

    za udane zadanie

    Matematyka95.7Rozumowanie91.2Język88.7
  11. 11

    GPT-6 Sol Max Effort

    OpenAI

    79.3

    Ogółem

    0,268 USD

    za udane zadanie

    Matematyka96.4Rozumowanie88.7Język85.3
  12. 12

    Kimi K3

    otwarte

    Moonshot AI

    79.2

    Ogółem

    0,348 USD

    za udane zadanie

    Rozumowanie90.7Język85.5Matematyka84.4
  13. 13

    Gemini 3.7 Flash High

    Google

    78.8

    Ogółem

    0,157 USD

    za udane zadanie

    Matematyka93.5Rozumowanie87.8Język85.5
  14. 14

    Qwen 3.8 Max

    otwarte

    Alibaba

    78.5

    Ogółem

    0,275 USD

    za udane zadanie

    Matematyka91.3Rozumowanie88.2Język79.7
  15. 15

    Muse Spark 1.2 xHigh Effort

    Meta

    78.0

    Ogółem

    0,375 USD

    za udane zadanie

    Matematyka91.2Rozumowanie90.0Język78.6
  16. 16

    Grok 4.6 xHigh

    xAI

    78.0

    Ogółem

    0,207 USD

    za udane zadanie

    Matematyka92.6Rozumowanie90.5Język83.7
  17. 17

    GPT-5.4 Thinking xHigh Effort

    OpenAI

    78.0

    Ogółem

    0,387 USD

    za udane zadanie

    Matematyka94.1Rozumowanie88.1Język82.6
  18. 18

    GPT-5.6 Terra Max Effort

    OpenAI

    77.9

    Ogółem

    0,352 USD

    za udane zadanie

    Matematyka94.9Rozumowanie90.6Język82.9
  19. 19

    Claude Sonnet 5.5 xHigh Effort

    Anthropic

    77.8

    Ogółem

    0,141 USD

    za udane zadanie

    Matematyka96.7Kodowanie88.9Rozumowanie86.8
  20. 20

    DeepSeek V4 Pro 0813

    otwarte

    DeepSeek

    77.4

    Ogółem

    0,044 USD

    za udane zadanie

    Matematyka95.1Rozumowanie85.8Język82.1
  21. 21

    Grok 4.7 xHigh

    xAI

    77.4

    Ogółem

    0,718 USD

    za udane zadanie

    Matematyka95.7Rozumowanie82.7Język80.1
  22. 22

    Gemini 3.1 Pro Preview High

    Google

    77.0

    Ogółem

    0,286 USD

    za udane zadanie

    Matematyka91.0Język85.4Rozumowanie84.0
  23. 23

    DeepSeek V4 Flash Vision Exp

    otwarte

    DeepSeek

    76.8

    Ogółem

    0,051 USD

    za udane zadanie

    Matematyka87.8Rozumowanie85.4Język80.4
  24. 24

    Claude 4.7 Opus Thinking xHigh Effort

    Anthropic

    76.5

    Ogółem

    0,528 USD

    za udane zadanie

    Matematyka92.9Rozumowanie87.2Kodowanie82.1
  25. 25

    Claude 4.8 Opus Thinking Max Effort

    Anthropic

    76.2

    Ogółem

    0,983 USD

    za udane zadanie

    Matematyka94.3Rozumowanie89.2Kodowanie81.8
  26. 26

    Qwen 3.8 Flash Next

    otwarte

    Alibaba

    76.2

    Ogółem

    0,042 USD

    za udane zadanie

    Rozumowanie87.4Matematyka85.8Wykonywanie instrukcji77.1
  27. 27

    GLM-5.3

    otwarte

    Z.AI

    76.1

    Ogółem

    0,450 USD

    za udane zadanie

    Matematyka87.9Rozumowanie85.8Język79.9
  28. 28

    Claude Sonnet 5 xHigh Effort

    Anthropic

    76.0

    Ogółem

    0,505 USD

    za udane zadanie

    Matematyka92.9Rozumowanie88.7Kodowanie80.7
  29. 29

    Grok 4.5

    xAI

    75.8

    Ogółem

    0,131 USD

    za udane zadanie

    Matematyka90.8Rozumowanie87.2Język82.8
  30. 30

    Gemini 3.8 Flash High

    Google

    75.8

    Ogółem

    0,307 USD

    za udane zadanie

    Matematyka91.6Rozumowanie89.3Język87.8
  31. 31

    Qwen3.8 27B

    otwarte

    Alibaba

    75.3

    Ogółem

    0,094 USD

    za udane zadanie

    Matematyka86.2Rozumowanie80.0Analiza danych76.6
  32. 32

    Muse Spark 1.1 xHigh Effort

    Meta

    75.3

    Ogółem

    0,198 USD

    za udane zadanie

    Rozumowanie87.7Matematyka87.1Kodowanie77.2
  33. 33

    GPT-5.2 High

    OpenAI

    74.6

    Ogółem

    0,234 USD

    za udane zadanie

    Matematyka93.2Rozumowanie83.2Język79.8
  34. 34

    Gemini 3.5 Flash High

    Google

    74.6

    Ogółem

    0,249 USD

    za udane zadanie

    Matematyka88.2Język84.6Rozumowanie82.0
  35. 35

    Claude 4.6 Opus Thinking High Effort

    Anthropic

    74.5

    Ogółem

    0,404 USD

    za udane zadanie

    Matematyka89.3Rozumowanie88.7Język83.3
  36. 36

    DeepSeek V4 Flash 0731

    otwarte

    DeepSeek

    74.2

    Ogółem

    0,060 USD

    za udane zadanie

    Matematyka86.8Rozumowanie86.6Analiza danych79.3
  37. 37

    GPT-5.2 Codex

    OpenAI

    74.0

    Ogółem

    0,187 USD

    za udane zadanie

    Matematyka88.8Kodowanie83.6Analiza danych78.2
  38. 38

    GPT-5.6 Luna Max Effort

    OpenAI

    73.6

    Ogółem

    0,169 USD

    za udane zadanie

    Matematyka87.2Rozumowanie85.6Kodowanie82.9
  39. 39

    Gemini 3.6 Flash High

    Google

    73.6

    Ogółem

    0,235 USD

    za udane zadanie

    Matematyka86.4Rozumowanie85.1Język83.9
  40. 40

    GLM-5.2

    otwarte

    Z.AI

    73.2

    Ogółem

    0,225 USD

    za udane zadanie

    Matematyka89.8Kodowanie79.7Rozumowanie78.6
  41. 41

    Qwen 3.7 Max

    Alibaba

    73.1

    Ogółem

    0,182 USD

    za udane zadanie

    Matematyka85.2Rozumowanie83.3Język79.7
  42. 42

    Claude 4.6 Sonnet Thinking Medium Effort

    Anthropic

    73.0

    Ogółem

    0,306 USD

    za udane zadanie

    Matematyka87.0Rozumowanie84.8Kodowanie79.3
  43. 43

    Claude 4.5 Opus Thinking High Effort

    Anthropic

    72.6

    Ogółem

    0,610 USD

    za udane zadanie

    Matematyka90.4Język81.3Rozumowanie80.1
  44. 44

    GPT-6 Luna Max Effort

    OpenAI

    72.0

    Ogółem

    0,026 USD

    za udane zadanie

    Matematyka89.1Rozumowanie81.8Kodowanie79.0
  45. 45

    Inkling xHigh Effort

    otwarte

    Thinking Machines

    71.9

    Ogółem

    0,310 USD

    za udane zadanie

    Matematyka88.4Rozumowanie78.3Język73.5
  46. 46

    GLM-5.3 Flash

    otwarte

    Z.AI

    71.6

    Ogółem

    0,031 USD

    za udane zadanie

    Matematyka81.2Kodowanie79.0Rozumowanie77.6
  47. 47

    Kimi K2.6 Thinking

    otwarte

    Moonshot AI

    70.5

    Ogółem

    0,169 USD

    za udane zadanie

    Matematyka84.3Rozumowanie79.4Kodowanie78.6
  48. 48

    GPT-5.4 Nano xHigh

    OpenAI

    69.6

    Ogółem

    0,091 USD

    za udane zadanie

    Matematyka91.0Rozumowanie81.1Kodowanie70.8
  49. 49

    ox-alpha-max

    Stealth

    69.2

    Ogółem

    0,000 USD

    za udane zadanie

    Matematyka77.5Rozumowanie76.6Kodowanie75.8
  50. 50

    Qwen 3.6 Plus

    Alibaba

    68.9

    Ogółem

    0,227 USD

    za udane zadanie

    Matematyka83.7Kodowanie78.2Rozumowanie75.8
  51. 51

    Kimi K2.7 Code

    otwarte

    Moonshot AI

    68.4

    Ogółem

    0,100 USD

    za udane zadanie

    Rozumowanie82.8Matematyka79.6Język77.9
  52. 52

    Grok Build 0.1

    xAI

    67.8

    Ogółem

    0,024 USD

    za udane zadanie

    Matematyka78.4Rozumowanie76.4Język72.5
  53. 53

    Nemotron 3 Ultra 550B A55B

    otwarte

    NVIDIA

    67.4

    Ogółem

    0,371 USD

    za udane zadanie

    Matematyka88.7Rozumowanie74.7Wykonywanie instrukcji73.4
  54. 54

    Minimax M3

    Minimax

    67.3

    Ogółem

    0,060 USD

    za udane zadanie

    Matematyka76.9Język76.8Analiza danych76.2
  55. 55

    GPT-5.4 Mini xHigh

    OpenAI

    66.4

    Ogółem

    0,334 USD

    za udane zadanie

    Matematyka78.5Kodowanie71.6Rozumowanie71.3
  56. 56

    Qwen 3.6 27B

    otwarte

    Alibaba

    64.0

    Ogółem

    0,202 USD

    za udane zadanie

    Matematyka79.9Kodowanie71.8Analiza danych70.4
  57. 57

    Gemini 3.5 Flash-Lite High

    Google

    63.9

    Ogółem

    0,069 USD

    za udane zadanie

    Kodowanie76.1Matematyka73.7Język71.8
  58. 58

    Grok 4.3

    xAI

    62.3

    Ogółem

    0,061 USD

    za udane zadanie

    Matematyka84.3Język73.6Rozumowanie70.8

Koszt to wskaźnik koszt-za-udane-zadanie podany przez źródło dla wybranego zakresu.

Wyniki to migawka publicznego benchmarku zewnętrznego, odtworzona bez zmian. Dapols dodaje do niej analizę kosztu za udane zadanie.Zobacz źródło

A benchmark rank is not a hiring decision.

These scores say which model is strongest at a set of held-out tasks. They don’t say which one fits your workflow, your budget, or the tools you already pay for — and the cheapest model that clears your bar usually beats the highest scorer.