Run History

Past benchmark runs with their metrics and charts.

New Run
2026-07-21 12:38:11 Single model
1000 samples
ModelAccuracy (%)Correct TotalAvg time (s)Errors
Gemma-3-4B 21.9 219 1000 1.198 0
2026-07-21 10:15:23 Single model
3 samples
ModelAccuracy (%)Correct TotalAvg time (s)Errors
Gemma-3-4B 0.0 0 3 9.466 0
2026-07-13 22:25:40 Single model
50 samples
ModelAccuracy (%)Correct TotalAvg time (s)Errors
Gemma-3-4B 22.0 11 50 0.579 0
2026-07-09 08:08:36 Single model
285 samples
ModelAccuracy (%)Correct TotalAvg time (s)Errors
Gemma-3-4B 63.9 182 285 2.502 0
Llama-3.2-3B 55.8 159 285 0.768 0
Ministral-8B 79.0 225 285 1.537 0
2026-07-09 07:43:23 Single model
39 samples
ModelAccuracy (%)Correct TotalAvg time (s)Errors
Gemma-3-4B 69.2 27 39 3.177 0
2026-07-08 05:56:56 Single model
4 samples
ModelAccuracy (%)Correct TotalAvg time (s)Errors
Llama-3.2-3B 100.0 4 4 0.934 0
2026-06-22 18:24:08 All models
1000 samples
ModelAccuracy (%)Correct TotalAvg time (s)Errors
Phi-4-Mini 15.0 150 1000 0.644 0
Llama-3.2-3B 20.8 208 1000 0.577 0
Ministral-8B 38.1 381 1000 0.731 0
2026-06-22 17:44:13 All models
100 samples
ModelAccuracy (%)Correct TotalAvg time (s)Errors
Phi-4-Mini 25.0 25 100 0.614 0
Llama-3.2-3B 22.0 22 100 0.549 0
Ministral-8B 52.0 52 100 0.805 0
2026-06-22 17:31:03 All models
50 samples
ModelAccuracy (%)Correct TotalAvg time (s)Errors
Phi-4-Mini 30.0 15 50 0.63 0
Llama-3.2-3B 24.0 12 50 0.553 0
Ministral-8B 52.0 26 50 0.859 0