Leader di punteggio
GPT-5.6 Sol · Max effort
82.4 · Generale
Una vista dei punteggi LiveBench attribuiti alla fonte che ti aiuta a confrontare capacità, punti di forza per categoria e costo di esecuzione senza perdere i dettagli.
Leader di punteggio
GPT-5.6 Sol · Max effort
82.4 · Generale
Costo di esecuzione più basso
DeepSeek V4 Pro
$0.050 · per attività riuscita
Migliori pesi aperti
Kimi K3
78.5 · Generale
Ordina ogni categoria, restringi la lista e apri un modello per la sua suddivisione dei sotto-compiti pubblicata.
| Modello | Confronta | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
Il costo è la metrica costo-per-attività-riuscita fornita dalla fonte per l'ambito LiveBench selezionato.
I punteggi sono più chiari accanto al costo e al profilo di categoria di un modello. Usa il confronto per mantenere visibile il compromesso.
Vista costo
Più alto è più forte. Il costo più basso si trova più a sinistra. I punti usano la metrica del costo fornita dalla fonte.
Confronta
Seleziona fino a tre modelli dalla classifica per confrontare i loro punteggi nelle sette categorie.
Usa i pulsanti di confronto nella tabella per aggiungere fino a tre modelli.