Qwen3 235B-A22B

Alibaba / Qwen Team · qwen/qwen3-235b-a22b

ProviderAlibaba / Qwen Team
Familyqwen
Typellm-reasoning
Statusactive
Released2025-04
Updated2025-04

Reported benchmark scores

These scores carry one collection date for the whole card (2026-04) and a source list rather than a source per score, so they cannot be attributed individually. They are shown as reported and are not verified evidence. Benchmark pages carry the reviewed, dated evidence where it exists.
BenchmarkCatalogue standingScore
Aider Polyglot Benchmarkunassessed68.2
AlpacaEvalunassessed44.5
Arena Elo — Codingunassessed1350.0
Arena Elo — Hard Promptsunassessed1440.4
Arena Elo — Mathunassessed1360.0
Arena Elo — Overall (Text)unassessed1340.0
Arena Elo — Style Controlunassessed1415.8
Arena Elo — Visionunassessed1214.6
Artificial Analysis Intelligence Indexunassessed82.0
Artificial Analysis Output Speedunassessed55.0
GPQA Diamondunassessed71.1
GSM8Kunassessed94.4
HumanEvalunassessed89.5
IFEvalunassessed88.5
LiveCodeBenchunassessed62.2
MATH-500unassessed93.5
MedQAunassessed84.8
MGSM (Multilingual Grade School Math)unassessed83.5
MMLU: Astronomyunassessed75.8
MMLU: Biology (subcategory)unassessed83.8
MMLU: Business Ethicsunassessed76.5
MMLU: Chemistry (subcategory)unassessed77.2
MMLU: Clinical Knowledgeunassessed82.2
MMLU: Computer Science (subcategory)unassessed84.5
MMLU: Jurisprudenceunassessed73.8
MMLU: Physics (unresolved key)unassessed81.5
MMLU-Prounassessed80.2
MMLU: Professional Accountingunassessed67.5
MMLU: Professional Lawunassessed71.8
MT-Benchunassessed8.9
MultiPL-E: C#unassessed83.5
MultiPL-E: Juliaunassessed65.8
MultiPL-E: Kotlin (unconfirmed)unassessed76.8
MultiPL-E: Luaunassessed58.8
MultiPL-E: Perlunassessed55.2
MultiPL-E: PHPunassessed81.2
MultiPL-E: Runassessed62.5
MultiPL-E: Rubyunassessed70.5
MultiPL-E: Scalaunassessed65.2
MultiPL-E: Swiftunassessed70.2
SWE-bench Agentunassessed45.5
SWE-bench Verifiedunassessed55.8
τ-benchunassessed50.2
WildBenchunassessed73.8

Data

This card as JSON · Edit on GitHub