Puan lideri
GPT-5.6 Sol · Max effort
82.4 · Genel
Ayrıntıyı kaybetmeden yetenek, kategori güçlü yanları ve çalıştırma maliyetini karşılaştırmanıza yardımcı olan kaynak atıflı bir LiveBench puan görünümü.
Puan lideri
GPT-5.6 Sol · Max effort
82.4 · Genel
En düşük çalıştırma maliyeti
DeepSeek V4 Pro
$0.050 · başarılı görev başına
En iyi açık ağırlıklar
Kimi K3
78.5 · Genel
Her kategoriyi sıralayın, listeyi daraltın ve yayınlanan alt görev dökümü için bir modeli açın.
| Model | Karşılaştır | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
Maliyet, seçilen LiveBench kapsamı için kaynak tarafından sağlanan başarılı görev başına maliyet metriğidir.
Puanlar, maliyet ve bir modelin kategori profili yanında daha nettir. Dengeyi görünür kılmak için karşılaştırmayı kullanın.
Maliyet görünümü
Daha yüksek daha güçlüdür. Düşük maliyet daha solda yer alır. Noktalar, kaynak tarafından sağlanan maliyet metriğini kullanır.
Karşılaştır
Yedi kategori puanını karşılaştırmak için lider tablosundan en fazla üç model seçin.
En fazla üç model eklemek için tablodaki karşılaştır düğmelerini kullanın.