Meilleur score
GPT-5.6 Sol · Max effort
82.4 · Global
Une vue sourcée des scores LiveBench qui vous aide à comparer les capacités, les forces par catégorie et le coût d'exécution sans perdre le détail.
Meilleur score
GPT-5.6 Sol · Max effort
82.4 · Global
Coût d'exécution le plus bas
DeepSeek V4 Pro
$0.050 · par tâche réussie
Meilleurs poids ouverts
Kimi K3
78.5 · Global
Triez chaque catégorie, affinez la liste et ouvrez un modèle pour sa répartition publiée des sous-tâches.
| Modèle | Comparer | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
Le coût est la métrique coût-par-tâche-réussie fournie par la source pour le périmètre LiveBench sélectionné.
Les scores sont plus clairs à côté du coût et du profil de catégorie d’un modèle. Utilisez la comparaison pour garder le compromis visible.
Vue coût
Plus haut est plus fort. Un coût plus bas se situe plus à gauche. Les points utilisent la métrique de coût fournie par la source.
Comparer
Sélectionnez jusqu'à trois modèles dans le classement pour comparer leurs scores sur les sept catégories.
Utilisez les boutons de comparaison dans le tableau pour ajouter jusqu'à trois modèles.