점수 리더
GPT-5.6 Sol · Max effort
82.4 · 전체
출처가 명시된 LiveBench 점수 보기로 능력, 카테고리 강점, 실행 비용을 세부 사항을 놓치지 않고 비교할 수 있습니다.
점수 리더
GPT-5.6 Sol · Max effort
82.4 · 전체
최저 실행 비용
DeepSeek V4 Pro
$0.050 · 성공 태스크당
최고 오픈 가중치
Kimi K3
78.5 · 전체
모든 카테고리 정렬, 목록 좁히기, 모델 열어서 게시된 서브태스크 분석 보기
| 모델 | 비교 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
비용은 선택된 LiveBench 범위에 대해 출처에서 제공하는 성공 태스크당 비용 메트릭입니다.
점수는 비용과 모델의 카테고리 프로필과 함께 더 명확해집니다. 비교를 사용하여 트레이드오프를 시각적으로 유지하세요.
비용 보기
높을수록 더 강력합니다. 낮은 비용은 왼쪽에 더 가깝습니다. 포인트는 출처에서 제공하는 비용 메트릭을 사용합니다.
비교
리더보드에서 최대 3개의 모델을 선택하여 7개 카테고리 점수를 비교하세요.
테이블의 비교 버튼을 사용하여 최대 3개 모델을 추가하세요.