Líder em pontuação
GPT-5.6 Sol · Max effort
82.4 · Geral
Uma visão com atribuição de fontes das pontuações do LiveBench que ajuda a comparar capacidade, pontos fortes por categoria e custo de execução sem perder o detalhe.
Líder em pontuação
GPT-5.6 Sol · Max effort
82.4 · Geral
Menor custo de execução
DeepSeek V4 Pro
$0.050 · por tarefa bem-sucedida
Melhores pesos abertos
Kimi K3
78.5 · Geral
Classifique cada categoria, restrinja a lista e abra um modelo para sua divisão de subtarefas publicada.
| Modelo | Comparar | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
O custo é a métrica de custo por tarefa bem-sucedida fornecida pela fonte para o escopo selecionado do LiveBench.
As pontuações ficam mais claras ao lado do custo e do perfil de categoria do modelo. Use a comparação para manter o trade-off visível.
Visualização de custo
Quanto maior, mais forte. Custo menor fica mais à esquerda. Os pontos usam a métrica de custo fornecida pela fonte.
Comparar
Selecione até três modelos do ranking para comparar suas pontuações em sete categorias.
Use os botões de comparação na tabela para adicionar até três modelos.