Pemimpin skor
GPT-5.6 Sol · Max effort
82.4 · Keseluruhan
Tampilan skor LiveBench yang bersumber yang membantu Anda membandingkan kemampuan, kekuatan kategori, dan biaya eksekusi tanpa kehilangan detail.
Pemimpin skor
GPT-5.6 Sol · Max effort
82.4 · Keseluruhan
Pemimpin nilai
DeepSeek V4 Pro
$0.050 · per tugas berhasil
Bobot terbuka teratas
Kimi K3
78.5 · Keseluruhan
Urutkan setiap kategori, persempit daftar, dan buka model untuk melihat rincian subtugas yang dipublikasikan.
| Model | Bandingkan | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
Biaya adalah metrik biaya-per-tugas-berhasil yang disediakan sumber untuk cakupan LiveBench yang dipilih.
Skor lebih jelas di samping biaya dan profil kategori model. Gunakan perbandingan untuk menjaga kompromi tetap terlihat.
Tampilan biaya
Semakin tinggi semakin kuat. Biaya lebih rendah berada di kiri. Poin menggunakan metrik biaya yang disediakan sumber.
Bandingkan
Pilih hingga tiga model dari papan peringkat untuk membandingkan skor tujuh kategori mereka.
Gunakan tombol bandingkan di tabel untuk menambahkan hingga tiga model.