Gemma 4 31B

Google DeepMind · google/gemma-4-31b

ProviderGoogle DeepMind
Familygemma
Typellm-reasoning
Statusactive
Released2026-04-02
Updated2026-04-02

Reported benchmark scores

These scores carry one collection date for the whole card (2026-04) and a source list rather than a source per score, so they cannot be attributed individually. They are shown as reported and are not verified evidence. Benchmark pages carry the reviewed, dated evidence where it exists.
BenchmarkCatalogue standingScore
Aider Polyglot Benchmarkunassessed54.8
Arena Elo — Codingunassessed1300.0
Arena Elo — Hard Promptsunassessed1474.2
Arena Elo — Mathunassessed1280.0
Arena Elo — Overall (Text)unassessed1290.0
Arena Elo — Style Controlunassessed1451.2
Artificial Analysis Intelligence Indexunassessed73.0
Artificial Analysis Output Speedunassessed84.0
BIG-Bench Hardunassessed62.3
ChartQAunassessed78.5
DocVQAunassessed86.8
GPQA Diamondunassessed67.8
HumanEvalunassessed84.1
IFEvalunassessed83.0
MATH-500unassessed87.3
MathVistaunassessed54.5
MMLU: Astronomyunassessed73.5
MMLU: Biology (subcategory)unassessed81.5
MMLU: Business Ethicsunassessed74.2
MMLU: Chemistry (subcategory)unassessed74.5
MMLU: Clinical Knowledgeunassessed80.2
MMLU: Computer Science (subcategory)unassessed82.5
MMLU: Jurisprudenceunassessed71.5
MMLU: Physics (unresolved key)unassessed78.8
MMLU-Prounassessed74.1
MMLU: Professional Accountingunassessed65.2
MMLU: Professional Lawunassessed70.2
MMMUunassessed60.2
MultiPL-Eunassessed77.3
MultiPL-E: C++unassessed76.5
MultiPL-E: C#unassessed74.2
MultiPL-E: Gounassessed73.2
MultiPL-E: Javaunassessed81.2
MultiPL-E: JavaScriptunassessed79.5
MultiPL-E: Juliaunassessed54.2
MultiPL-E: Kotlin (unconfirmed)unassessed65.2
MultiPL-E: Luaunassessed47.5
MultiPL-E: Perlunassessed42.5
MultiPL-E: PHPunassessed71.5
MultiPL-E: Pythonunassessed84.1
MultiPL-E: Runassessed50.5
MultiPL-E: Rubyunassessed57.8
MultiPL-E: Rustunassessed67.5
MultiPL-E: Scalaunassessed52.5
MultiPL-E: Swiftunassessed57.8
MultiPL-E: TypeScriptunassessed78.8
MuSRunassessed30.4
SWE-bench Verifiedunassessed30.2

Data

This card as JSON · Edit on GitHub