Líder en puntuación
GPT-5.6 Sol · Max effort
82.4 · General
Una vista con atribución de fuentes de las puntuaciones de LiveBench que te ayuda a comparar capacidad, fortalezas de categorías y costo de ejecución sin perder el detalle.
Líder en puntuación
GPT-5.6 Sol · Max effort
82.4 · General
Menor costo de ejecución
DeepSeek V4 Pro
$0.050 · por tarea exitosa
Mejores pesos abiertos
Kimi K3
78.5 · General
Ordena cada categoría, reduce la lista y abre un modelo para ver su desglose de subtareas publicado.
| Modelo | Comparar | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
El costo es la métrica de costo por tarea exitosa proporcionada por la fuente para el alcance de LiveBench seleccionado.
Las puntuaciones son más claras junto al costo y el perfil de categoría de un modelo. Usa la comparación para mantener visible el equilibrio.
Vista de costo
Más alto es más fuerte. El costo más bajo se sitúa más a la izquierda. Los puntos usan la métrica de costo proporcionada por la fuente.
Comparar
Elige hasta tres modelos de la tabla de clasificación para comparar sus puntuaciones en siete categorías.
Usa los botones de comparar en la tabla para agregar hasta tres modelos.