← All benchmarks·Source: Epoch AI

Big-Bench Hard leaderboard

Current leader: Gemini 1.5 Pro (May 2024) at 85.6 (% accuracy).

Cost vs quality

Each dot is a model. The dashed line is the value frontier — top-left is the best trade-off (high score, low cost).

Not enough priced models on this benchmark yet to plot cost vs quality. The leaderboard below shows all scores.

Full leaderboard

#ModelScore% accuracyOutput $/1MReleased
1
Gemini 1.5 Pro (May 2024)
85.6May 2024
2
DeepSeek-V3OPEN
83.33Dec 2024
3
Llama 3.1-405BOPEN
77.2Jul 2024
4
phi-3-medium 14BOPEN
75.2Apr 2024
5
Qwen2.5-72BOPEN
73.07Sep 2024
6
phi-3-small 7.4BOPEN
72.13Apr 2024
7
DeepSeek-V2 (MoE-236B, May 2024)
71.73May 2024
8
GPT-4 (Jun 2023)
66.83Jun 2023
9
Yi-34BOPEN
62.27Nov 2023
10
phi-3-mini 3.8BOPEN
62.27Apr 2024
11
Stable Beluga 2OPEN
59.07Jul 2023
12
Llama 2-70BOPEN
53.2Jul 2023
13
GPT-3.5 Turbo (Jun 2023)
48.79Jun 2023
14
Phi-2OPEN
45.87Dec 2023
15
Nemotron-4 15B
44.93Feb 2024
16
LLaMA-65BOPEN
44.53Feb 2023
17
Llama 2-13BOPEN
44.27Jul 2023
18
Mistral 7B v0.1
41.47Oct 2023
19
Gemma 7BOPEN
40.13Feb 2024
20
Qwen-14BOPEN
40Sep 2023
21
internlm-20b
36.67Sep 2023
22
LLaMA-33BOPEN
33.33Feb 2023
23
Baichuan2-13BOPEN
32Sep 2023
24
Yi 6BOPEN
29.6Nov 2023
25
Qwen-7BOPEN
26.67Sep 2023
26
Llama 2-34B
25.47Jul 2023
27
vicuna-13b-v1.1
24.05Apr 2023
28
Baichuan 2-7BOPEN
22.13Sep 2023
29
Llama 2-7BOPEN
18.88Jul 2023
30
MPT-30BOPEN
17.33Jun 2023
31
LLaMA-13BOPEN
17.2Feb 2023
32
Falcon-40BOPEN
16.13Mar 2023
33
internlm-7b
16Jul 2023
34
MPT-7BOPEN
14.13May 2023
35
Gemma 2BOPEN
13.6Feb 2024
36
INTELLECT-1
13.13Nov 2024
37
chatglm2-6b
11.6Jun 2023
38
LLaMA-7BOPEN
11.33Feb 2023
39
Baichuan1-7BOPEN
9.97Jun 2023
40
Falcon-7BOPEN
5.03Apr 2023
41
Qwen-1_8B
4.27Nov 2023

Scores from Epoch AI, updated . Cost is joined from our daily API pricing where a model matches; models we don't price still appear with their score. Always verify on the benchmark's own site before relying on a number.