Neura Intelligence Index
Subset of BIG-Bench tasks that are challenging for language models — tests reasoning
| # | Model | Score | Provider | Source |
|---|---|---|---|---|
| 1 | 93.2 | Anthropic | ||
| 2 | 91.5 | OpenAI | ||
| 3 | 90.8 | Anthropic | ||
| 4 | 89.4 | Anthropic | ||
| 5 | 87.3 | OpenAI | ||
| 6 | 86.8 | Anthropic | ||
| 7 | 85.4 | Meta | ||
| 8 | 85.1 | OpenAI | ||
| 9 | 83.5 | Alibaba | ||
| 10 | 82.9 | Meta | ||
| 11 | 81.2 | Meta | ||
| 12 | 78.5 | OpenAI |