Results
Detailed results
For deeper analysis and transparency into the results, this page covers the metrics for each dataset and the results per trial for all 4 benchmarks.
Code Index per benchmark
Here we show not only the Index score per benchmark, but also the consumed tokens and the total cost of each model.
1
codex
176.0M
985.5K
$142.9
2
claude-code
308.2M
2.3M
$259.3
3
claude-code
188.9M
1.9M
$347.9
4
terminus-2
115.4M
2.2M
$59.2
5
claude-code
269.1M
1.9M
$214.2
6
terminus-2
52.2M
1.4M
$45.0
7
terminus-2
122.3M
2.5M
$70.2
8
terminus-2
712.6M
4.4M
$236.3
9
terminus-2
193.3M
4.0M
$10.4
10
terminus-2
186.8M
2.7M
$58.2
11
terminus-2
141.2M
2.9M
$17.7
12
terminus-2
472.3M
2.6M
$38.8
13
terminus-2
178.9M
4.4M
$47.1
1
claude-code
48.2M
1.8M
$164.0
2
terminus-2
20.2M
1.4M
$19.3
3
claude-code
94.5M
1.7M
$105.7
4
claude-code
217.3M
3.9M
$237.1
5
terminus-2
12.1M
1.8M
$35.4
6
codex
31.1M
1.0M
$57.7
7
terminus-2
113.6M
3.1M
$78.5
8
terminus-2
18.7M
4.0M
$31.5
9
terminus-2
49.1M
2.6M
$20.0
10
terminus-2
208.0M
3.0M
$17.5
11
terminus-2
35.3M
4.9M
$4.5
12
terminus-2
29.9M
1.7M
$5.5
13
terminus-2
22.3M
1.2M
$10.5
1
claude-code
198.6M
3.4M
$219.2
2
codex
44.6M
1.3M
$74.8
3
claude-code
99.7M
2.8M
$294.5
4
terminus-2
43.2M
2.1M
$52.2
5
claude-code
174.5M
3.1M
$191.7
6
terminus-2
48.8M
5.4M
$49.5
7
terminus-2
95.3M
2.6M
$54.5
8
terminus-2
151.6M
3.3M
$85.8
9
terminus-2
90.2M
5.3M
$7.0
10
terminus-2
147.2M
6.2M
$49.3
11
terminus-2
462.1M
3.8M
$38.6
12
terminus-2
87.8M
3.9M
$18.8
13
terminus-2
109.9M
3.1M
$43.2
1
claude-code
624.2M
12.7M
$809.0
2
claude-code
433.8M
9.2M
$1.1k
3
codex
217.4M
2.8M
$217.4
4
terminus-2
175.7M
4.2M
$136.3
5
claude-code
449.4M
6.6M
$455.5
6
terminus-2
2.75B
6.5M
$586.9
7
terminus-2
516.7M
11.3M
$38.7
8
terminus-2
1.76B
19.8M
$248.8
9
terminus-2
538.0M
12.1M
$294.8
10
terminus-2
383.8M
8.6M
$75.7
11
terminus-2
1.19B
7.2M
$87.8
12
terminus-2
1.41B
8.3M
$767.7
13
terminus-2
730.1M
6.5M
$219.2
Trial outcomes
Below you can find the outcome of each trial. Each model ran three trials per task, which resulted in either PASS, FAIL, or ERROR. Each is described below, along with the error description, task domain, and task empirical difficulty, which can be seen by hovering each result dot.
Talk to us
Revelo works with model labs on:
- Training datasets for code generation
- Evaluations of new and unreleased models
- Leaderboard analysis, including failure modes and agent trajectories