Neura Intelligence Index
| Benchmark | GPT-4.1 mini | Qwen2.5 VL 72B Instruct |
|---|---|---|
| GPQA Diamond | 65 | — |
| Humanity's Last Exam | 3.7 | — |
| Benchmark | GPT-4.1 mini | Qwen2.5 VL 72B Instruct |
|---|---|---|
| AIME 2025 | 40.2 | — |
| Benchmark | GPT-4.1 mini | Qwen2.5 VL 72B Instruct |
|---|---|---|
| SWE-bench Verified | 23.6 | — |
| Benchmark | GPT-4.1 mini | Qwen2.5 VL 72B Instruct |
|---|---|---|
| MMMU | 72.7 | 70.2 |
| CharXiv Reasoning | 56.8 | — |
| MMMU-Pro | — | 51.1 |
| ScreenSpot Pro | — | 43.6 |
| Benchmark | GPT-4.1 mini | Qwen2.5 VL 72B Instruct |
|---|---|---|
| MMMLU | 78.5 | — |
| Benchmark | GPT-4.1 mini | Qwen2.5 VL 72B Instruct |
|---|---|---|
| TAU-Bench Retail | 55.8 | — |
| OSWorld | — | 8.8 |