Claude Opus 4.6

Anthropic · anthropic/claude-opus-4-6

ProviderAnthropic
Familyclaude-opus
Typellm-reasoning
Statusactive
Released2026-02-05
Updated2026-03-13

Reported benchmark scores

These scores carry one collection date for the whole card (2026-04) and a source list rather than a source per score, so they cannot be attributed individually. They are shown as reported and are not verified evidence. Benchmark pages carry the reviewed, dated evidence where it exists.
BenchmarkCatalogue standingScore
Aider Polyglot Benchmarkunassessed82.1
AIME 2025unassessed82.0
AlpacaEvalunassessed55.2
Arena Elo — Codingunassessed1420.0
Arena Elo — Hard Promptsunassessed1534.7
Arena Elo — Mathunassessed1400.0
Arena Elo — Overall (Text)unassessed1410.0
Arena Elo — Style Controlunassessed1502.8
Arena Elo — Visionunassessed1295.0
Artificial Analysis Intelligence Indexunassessed88.0
Artificial Analysis Output Speedunassessed62.0
BBQ (Bias Benchmark for QA)unassessed88.2
BrowseCompunassessed83.7
ChartQAunassessed86.8
CharXiv Reasoningunassessed61.5
CharXiv Reasoning (with tool use)unassessed78.9
DocVQAunassessed93.2
FinBenchunassessed71.2
GPQA Diamondunassessed91.3
GraphWalks BFS (256K-1M context)unassessed38.7
HELM Safetyunassessed92.5
Humanity's Last Examunassessed40.0
Humanity's Last Exam (with tools)unassessed53.1
HumanEvalunassessed93.2
IFEvalunassessed92.1
LAB-Bench: FigQAunassessed58.5
LAB-Bench: FigQA (with tools)unassessed75.1
LegalBenchunassessed75.5
LiveCodeBenchunassessed62.4
MATH-500unassessed96.4
MathVistaunassessed65.5
MedQAunassessed82.1
MMLU: Astronomyunassessed80.5
MMLU: Biology (subcategory)unassessed88.2
MMLU: Business Ethicsunassessed82.1
MMLU: Chemistry (subcategory)unassessed82.5
MMLU: Clinical Knowledgeunassessed87.5
MMLU: Computer Science (subcategory)unassessed88.8
MMLU: Jurisprudenceunassessed80.5
MMLU: Physics (unresolved key)unassessed85.1
MMLU-Prounassessed85.2
MMLU: Professional Accountingunassessed72.5
MMLU: Professional Lawunassessed78.2
Multilingual MMLU (MMMLU)unassessed91.1
MMMUunassessed70.8
MT-Benchunassessed9.4
MultiPL-Eunassessed89.3
MultiPL-E: C++unassessed88.5
MultiPL-E: C#unassessed88.2
MultiPL-E: Gounassessed85.5
MultiPL-E: Javaunassessed91.2
MultiPL-E: JavaScriptunassessed91.5
MultiPL-E: Juliaunassessed70.2
MultiPL-E: Kotlin (unconfirmed)unassessed82.5
MultiPL-E: Luaunassessed65.8
MultiPL-E: Perlunassessed62.5
MultiPL-E: PHPunassessed85.5
MultiPL-E: Pythonunassessed95.5
MultiPL-E: Runassessed68.5
MultiPL-E: Rubyunassessed78.5
MultiPL-E: Rustunassessed82.1
MultiPL-E: Scalaunassessed72.2
MultiPL-E: Swiftunassessed76.8
MultiPL-E: TypeScriptunassessed90.8
OSWorldunassessed72.7
ScreenSpot-Prounassessed57.7
ScreenSpot-Pro (with tools)unassessed83.1
SWE-bench Agentunassessed62.5
SWE-bench Multilingualunassessed77.8
SWE-bench Multimodalunassessed27.1
SWE-bench Prounassessed53.4
SWE-bench Verifiedunassessed80.8
τ-benchunassessed68.2
Terminal-Benchunassessed55.8
Terminal-Bench 2.0unassessed65.4
ToxiGenunassessed95.1
USAMO 2026unassessed42.3
WildBenchunassessed82.5

Data

This card as JSON · Edit on GitHub