Qwen3-VL-32B-Instruct is a large-scale multimodal vision-language model designed for high-precision understanding and reasoning across text, images, and video. With 32 billion parameters, it combines deep visual perception with advanced text...
| Benchmark | Score | Source |
|---|---|---|
| AIME 2025 | 66.2 | verified |
| Benchmark | Score | Source |
|---|---|---|
| GPQA Diamond | 68.9 | verified |
| Benchmark | Score | Source |
|---|
| MMMU-Pro | 65.3 | verified |
| CharXiv Reasoning | 62.8 | verified |
| ScreenSpot Pro | 57.9 | verified |
| Benchmark | Score | Source |
|---|---|---|
| OSWorld | 32.6 | verified |
Qwen