Neura Intelligence Index
| Benchmark | Llama 3.3 70B | Qwen3-235B-A22B-Thinking-2507 |
|---|---|---|
| HellaSwag | 94.8 | — |
| WinoGrande | 86.1 | — |
| Benchmark | Llama 3.3 70B | Qwen3-235B-A22B-Thinking-2507 |
|---|---|---|
| TruthfulQA | 62.8 | — |
| Benchmark | Llama 3.3 70B | Qwen3-235B-A22B-Thinking-2507 |
|---|---|---|
| HumanEval | 88.4 | — |
| Benchmark | Llama 3.3 70B | Qwen3-235B-A22B-Thinking-2507 |
|---|---|---|
| GPQA Diamond | 49.5 | 81.1 |
| ARC-Challenge | 95.2 | — |
| BigBench-Hard | 82.9 | — |
| Humanity's Last Exam | — | 18.2 |
| Benchmark | Llama 3.3 70B | Qwen3-235B-A22B-Thinking-2507 |
|---|---|---|
| MMLU-Pro | 68.9 | — |
| Chatbot Arena Elo | 1247 | — |
| IFEval | 85.3 | — |
| Benchmark | Llama 3.3 70B | Qwen3-235B-A22B-Thinking-2507 |
|---|---|---|
| TAU-Bench Retail | — | 67.8 |