Neura Intelligence Index
| Benchmark | Llama 3.1 70B | Qwen3 VL 235B A22B Thinking |
|---|---|---|
| BigBench-Hard | 81.2 | — |
| GPQA Diamond | 46.7 | — |
| ARC-Challenge | 94.8 | — |
| Humanity's Last Exam | — | 13.6 |
| Benchmark | Llama 3.1 70B | Qwen3 VL 235B A22B Thinking |
|---|---|---|
| IFEval | 83.6 | — |
| Chatbot Arena Elo | 1207 | — |
| MMLU-Pro | 66.4 | — |
| SimpleQA | — | 44.4 |
| Benchmark | Llama 3.1 70B | Qwen3 VL 235B A22B Thinking |
|---|---|---|
| HumanEval | 80.5 | — |
| Benchmark | Llama 3.1 70B | Qwen3 VL 235B A22B Thinking |
|---|---|---|
| HellaSwag | 94.4 | — |
| WinoGrande | 85.3 | — |
| Benchmark | Llama 3.1 70B | Qwen3 VL 235B A22B Thinking |
|---|---|---|
| TruthfulQA | 60.1 | — |
| Benchmark | Llama 3.1 70B | Qwen3 VL 235B A22B Thinking |
|---|---|---|
| MMMU-Pro | — | 69.3 |
| CharXiv Reasoning | — | 66.1 |
| ScreenSpot Pro | — | 61.8 |
| Benchmark | Llama 3.1 70B | Qwen3 VL 235B A22B Thinking |
|---|---|---|
| OSWorld | — | 38.1 |