Qwen3-VL-235B-A22B Instruct is an open-weight multimodal model that unifies strong text generation with visual understanding across images and video. The Instruct model targets general vision-language use (VQA, document parsing, chart/table...
| MMMU-Pro | 68.1 | verified |
| CharXiv Reasoning | 62.1 | verified |
| ScreenSpot Pro | 62 | verified |
| Benchmark | Score | Source |
|---|---|---|
| OSWorld | 66.7 | verified |
Qwen