स्कोर लीडर
GPT-5.6 Sol · Max effort
82.4 · कुल मिलाकर
LiveBench स्कोर का एक स्रोत-आधारित दृश्य जो आपको विवरण खोए बिना क्षमता, श्रेणी की ताकत और रन लागत की तुलना करने में मदद करता है।
स्कोर लीडर
GPT-5.6 Sol · Max effort
82.4 · कुल मिलाकर
सबसे कम रन लागत
DeepSeek V4 Pro
$0.050 · प्रति सफल कार्य
शीर्ष ओपन वेट्स
Kimi K3
78.5 · कुल मिलाकर
प्रत्येक श्रेणी को क्रमबद्ध करें, सूची को संकीर्ण करें, और किसी मॉडल को उसके प्रकाशित उप-कार्य विवरण के लिए खोलें।
| मॉडल | तुलना करें | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI | 82.4 | 91.7 | 83.9 | 65.6 | 96.2 | 79.8 | 87.7 | 71.8 | $0.589 | |
| Anthropic | 80.8 | 89.7 | 86.0 | 46.9 | 96.0 | 80.5 | 90.7 | 75.8 | $1.573 | |
| Anthropic | 80.3 | 90.2 | 83.2 | 61.3 | 94.8 | 77.9 | 87.3 | 67.5 | $0.487 | |
| OpenAI | 79.8 | 90.6 | 78.2 | 68.0 | 94.9 | 79.3 | 82.9 | 64.6 | $0.497 | |
| Moonshot AI | 78.5 | 90.7 | 81.4 | 57.6 | 84.4 | 78.7 | 85.5 | 71.4 | $0.379 | |
| 77.1 | 84.0 | 76.5 | 45.4 | 91.0 | 78.5 | 85.4 | 79.1 | $0.262 | ||
| xAI | 76.3 | 87.2 | 68.6 | 59.8 | 90.8 | 73.0 | 82.8 | 71.5 | $0.128 | |
| DeepSeek | 71.6 | 82.7 | 70.0 | 42.6 | 90.7 | 74.5 | 78.1 | 62.4 | $0.050 |
लागत चयनित LiveBench दायरे के लिए स्रोत-प्रदत्त प्रति सफल कार्य लागत मीट्रिक है।
लागत और मॉडल की श्रेणी प्रोफ़ाइल के साथ स्कोर स्पष्ट होते हैं। व्यापार-बंद को दृश्यमान रखने के लिए तुलना का उपयोग करें।
लागत दृश्य
उच्च अधिक मजबूत है। कम लागत बाईं ओर होती है। बिंदु स्रोत-प्रदत्त लागत मीट्रिक का उपयोग करते हैं।
तुलना करें
लीडरबोर्ड से तीन मॉडल चुनें उनके सात श्रेणी स्कोर की तुलना करने के लिए।
तालिका में तुलना बटन का उपयोग करके तीन मॉडल जोड़ें।