Highlights

Artificial Analysis Intelligence Index · Higher is better
Claude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning model616059575454515050443824
Output tokens per second · Higher is better
Gemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning model2131761451431111046864595439
Weighted average cost (USD) per Intelligence Index task · Lower is better
DeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning model$0.03$0.08$0.14$0.36$0.38$0.40$0.56$0.57$0.86$1.23$2.34$3.15
New article published · 5 Aug
Muse Spark 1.2
New language model evaluation · 5 Aug
Qwen3.8 MaxQwen3.8 Max
New language model evaluation · 5 Aug
Ling-3.0-flashLing-3.0-flash
New language model evaluation · 5 Aug
Muse Spark 1.2 (xhigh)Muse Spark 1.2 (xhigh)
New article published · 4 Aug
Launching the Endpoint Accuracy Index: Same Model, Different Accuracy
New language model evaluation · 3 Aug
G9v3-39A5BG9v3-39A5B
New article published · 31 Jul
DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, 10 points above previous DeepSeek V4 Flash
New language model evaluation · 31 Jul
Celeris-1Celeris-1
New language model evaluation · 31 Jul
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
New article published · 30 Jul
Inkling Small lands within a point of Inkling on the Artificial Analysis Intelligence Index with less than a third of the parameters
Methodology updated · 30 Jul
Artificial AnalysisWe have updated our Cost per Task methodology, resulting in slight absolute increases in cost estimates but with minimal impact on relative positioning.
New language model evaluation · 30 Jul
Kimi K3 (low)Kimi K3 (low)
New language model evaluation · 30 Jul
Inkling SmallInkling Small
New article published · 29 Jul
Agnes AI releases Agnes 2.5 Pro Alpha
New article published · 24 Jul
Claude Opus 5: the new leader in agentic knowledge work
New article published · 24 Jul
Opus 5: Fable 5 level intelligence at a lower cost per task
New language model evaluation · 24 Jul
Claude Opus 5 (Adaptive Reasoning, Low Effort)Claude Opus 5 (Adaptive Reasoning, Low Effort)
New language model evaluation · 24 Jul
Claude Opus 5 (Adaptive Reasoning, Medium Effort)Claude Opus 5 (Adaptive Reasoning, Medium Effort)
New language model evaluation · 24 Jul
Claude Opus 5 (Adaptive Reasoning, High Effort)Claude Opus 5 (Adaptive Reasoning, High Effort)
New language model evaluation · 24 Jul
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)See more

Intelligence

Intelligence of leading AI models based on our independent evaluations

Artificial Analysis Agentic Index

Represents the weighted average of agentic capabilities benchmarks in the Artificial Analysis Intelligence Index (GDPval-AA v2, 𝜏³-Banking)
Qwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelInklingLogo of InklingReasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning model55.455.354.052.850.147.447.246.846.745.745.745.643.138.735.432.330.629.127.426.819.016.414.413.29.2
Reasoning models are indicated by a lightbulb icon

Represents the average of agentic capabilities benchmarks in the Artificial Analysis Intelligence Index (GDPval-AA v2, 𝜏³-Banking).

Artificial Analysis Intelligence Index by Open Weights / Proprietary

Artificial Analysis Intelligence Index v4.1 incorporates 9 evaluations: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR
Claude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelInklingLogo of InklingReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning model61605957565655545453515150504644424138363030292423
Reasoning models are indicated by a lightbulb icon

Artificial Analysis Intelligence Index v4.1 includes: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. See Intelligence Index methodology for further details, including a breakdown of each evaluation and how we run them.

Indicates whether the model weights are available. Models are labelled as 'Commercial Use Restricted' if the weights are available but commercial use is limited (typically requires obtaining a paid license).

Cost per Intelligence Index Task

Weighted average cost (USD) per Artificial Analysis Intelligence Index task, segmented by token type. Lower is better
DeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning model$0.26$0.35$0.48$0.69$0.50$0.87$0.78$0.31$0.22$0.27$0.19$0.55$0.22$0.28$0.37$0.41$0.59$0.28$0.32$0.58$0.88$0.64$1.26$0.03$0.03$0.05$0.08$0.10$0.14$0.22$0.36$0.38$0.40$0.46$0.51$0.53$0.56$0.57$0.86$1.14$1.23$1.72$2.03$2.34$3.15$0.24$0.36$0.43
Reasoning models are indicated by a lightbulb icon

Weighted average cost per Intelligence Index task. Each evaluation’s cost is calculated from input, cache hit, cache write, reasoning, and answer token prices, divided by task count, and weighted by its Intelligence Index weight.

Intelligence Index vs. Cost per Intelligence Index Task

Artificial Analysis Intelligence Index · Weighted average cost (USD) per Artificial Analysis Intelligence Index task
Most attractive quadrant
Pareto line
$0.03$0.04$0.06$0.08$0.1$0.2$0.3$0.4$0.5$0.6$0.8$1$2$3$4$5$6$7$8$9Cost per Task (USD, Log Scale)20253035404550556065Artificial Analysis Intelligence Index
Reasoning models are indicated by a lightbulb icon

Weighted average cost per Intelligence Index task. Each evaluation’s cost is calculated from input, cache hit, cache write, reasoning, and answer token prices, divided by task count, and weighted by its Intelligence Index weight.

Artificial Analysis Intelligence Index v4.1 includes: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. See Intelligence Index methodology for further details, including a breakdown of each evaluation and how we run them.

Frontier Language Model Intelligence, Over Time

Artificial Analysis Intelligence Index v4.1 incorporates 9 evaluations: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR
Nov 22May 23Nov 23May 24Oct 24Apr 25Oct 25Mar 26Aug 26Release Date020406080Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.1 includes: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. See Intelligence Index methodology for further details, including a breakdown of each evaluation and how we run them.

Performance, cost, and execution time for leading coding agents on end-to-end software engineering tasks

Artificial Analysis Coding Agent Index

Composite average pass@1 across DeepSWE, Terminal-Bench v2, and SWE-Atlas-QnA · Higher is better
Claude Code - Opus 5 (xhigh)Label for Claude Code - Opus 5 (xhigh)Claude CodeOpus 5(xhigh)Codex - GPT-5.6 Sol (max)Label for Codex - GPT-5.6 Sol (max)CodexGPT-5.6 Sol(max)Claude Code - Fable 5 (max) (with fallback)Label for Claude Code - Fable 5 (max) (with fallback)Claude CodeFable 5(max)(with fallback)Claude Code - Opus 5 (max)Label for Claude Code - Opus 5 (max)Claude CodeOpus 5(max)Grok Build - Grok 4.5 (high)Label for Grok Build - Grok 4.5 (high)Grok BuildGrok 4.5(high)Codex - GPT-5.6 Terra (max)Label for Codex - GPT-5.6 Terra (max)CodexGPT-5.6 Terra(max)Codex - GPT-5.5 (xhigh)Label for Codex - GPT-5.5 (xhigh)CodexGPT-5.5(xhigh)Kimi Code CLI - Kimi K3Label for Kimi Code CLI - Kimi K3Kimi Code CLIKimi K3Claude Code - Opus 4.8 (max)Label for Claude Code - Opus 4.8 (max)Claude CodeOpus 4.8(max)Codex - GPT-5.6 Luna (max)Label for Codex - GPT-5.6 Luna (max)CodexGPT-5.6 Luna(max)Opencode - Muse Spark 1.1 (xhigh)Label for Opencode - Muse Spark 1.1 (xhigh)OpencodeMuse Spark1.1(xhigh)Claude Code - GLM-5.2Label for Claude Code - GLM-5.2Claude CodeGLM-5.2Cursor CLI - Composer 2.5 FastLabel for Cursor CLI - Composer 2.5 FastCursor CLIComposer 2.5FastClaude Code - DeepSeek V4 Pro (high)Label for Claude Code - DeepSeek V4 Pro (high)Claude CodeDeepSeek V4Pro(high)Gemini CLI - Gemini 3.1 Pro (high)Label for Gemini CLI - Gemini 3.1 Pro (high)Gemini CLIGemini 3.1Pro(high)676766666462616161595443383130

Image & Video

Top models from our Image Arena and Video Arena leaderboards, with 95% confidence intervals

Text to Image Leaderboard

Elo scores from blind preference votes in our Image Arena. See the full leaderboard here.
133912991270126312631262124512401225121912081205120412011196GPT Image 2 (high)Logo of GPT Image 2 (high)Reve 2.1Logo of Reve 2.1MAI-Image-2.5Logo of MAI-Image-2.5Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)Logo of Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)GPT Image 1.5 (high)Logo of GPT Image 1.5 (high)Nano Banana 2 (Gemini 3.1 Flash Image Preview)Logo of Nano Banana 2 (Gemini 3.1 Flash Image Preview)HiDream-O1-Image-1.5Logo of HiDream-O1-Image-1.5Seedream 5.0 ProLogo of Seedream 5.0 ProNano Banana Pro (Gemini 3 Pro Image)Logo of Nano Banana Pro (Gemini 3 Pro Image)Cosmos3-Super-Text2Image (agentic)Logo of Cosmos3-Super-Text2Image (agentic)MAI-Image-2.5-FlashLogo of MAI-Image-2.5-FlashRecraft V4.1 UtilityLogo of Recraft V4.1 Utilitygrok-imagine-image-qualityLogo of grok-imagine-image-qualityRecraft V4.1 Utility ProLogo of Recraft V4.1 Utility ProFLUX.2 [max]Logo of FLUX.2 [max]

Speech

Top models from our Text to Speech Arena, Speech to Text and Speech to Speech evaluations

Text to Speech Arena Leaderboard

Elo scores from blind preference votes in our Text to Speech Arena · See the full leaderboard here.
122912271210120311941191117211711151114611391138113111241122Qwen-Audio-3.0-TTS-PlusLogo of Qwen-Audio-3.0-TTS-PlusSimba 3.2Logo of Simba 3.2Gemini 3.1 Flash TTSLogo of Gemini 3.1 Flash TTSSonic 3.5Logo of Sonic 3.5Realtime TTS 1.5 MaxLogo of Realtime TTS 1.5 MaxRealtime TTS-2 - Research PreviewLogo of Realtime TTS-2 - Research PreviewSpeech 2.8 HDLogo of Speech 2.8 HDEleven v3Logo of Eleven v3Async Flash v1.5Logo of Async Flash v1.5Speech 2.8 TurboLogo of Speech 2.8 TurboStep TTS 2 (Mar 2026)Logo of Step TTS 2 (Mar 2026)Lightning V3.1 Pro TTS (Jun 2026)Logo of Lightning V3.1 Pro TTS (Jun 2026)Realtime TTS 1.5 MiniLogo of Realtime TTS 1.5 MiniAsync Pro v1.0Logo of Async Pro v1.0Simba 3.0Logo of Simba 3.0

Relative Elo score of the models as determined by responses from users in Artificial Analysis' Speech Arena. Some models may not be shown due to not yet having enough votes.

Measures the performance of models on specific capabilities and industries

Artificial Analysis Agentic Index

Measures performance in agentic workflows, focusing on behaviors like tool use, planning, autonomy, and complex problem solving.
Qwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelInklingLogo of InklingReasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning model5555545350474747474646464339353231292727191614139
Reasoning models are indicated by a lightbulb icon

Intelligence Evaluations

Intelligence evaluations measured independently by Artificial Analysis · Higher is better

Agentic real-world work tasks, (Elo-500)/2000

Claude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelInklingLogo of InklingReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning model68%62%62%61%59%57%55%54%54%54%53%51%50%46%44%39%38%37%33%32%22%21%15%15%11%

Agentic tool use

Qwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelInklingLogo of InklingReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelCommand A+Logo of Command A+Reasoning model42%33%33%33%32%31%30%28%28%27%27%27%27%25%24%16%15%14%14%13%12%11%9%9%6%

Agentic coding & terminal use

Claude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelInklingLogo of InklingReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning model89%88%88%85%85%85%82%81%81%81%80%79%78%78%75%65%65%55%54%54%51%44%43%26%23%

Coding

Claude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelInklingLogo of InklingReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning model60%59%56%56%56%54%54%54%53%53%53%53%50%50%50%49%46%45%43%43%41%40%40%39%38%

Reasoning & knowledge

Claude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelInklingLogo of InklingReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelCommand A+Logo of Command A+Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning model53%53%47%46%44%44%42%41%40%40%40%38%38%37%37%37%34%30%27%23%18%18%13%11%10%

Scientific reasoning

GPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelInklingLogo of InklingReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning model94%94%93%93%93%93%93%93%93%92%92%91%91%91%90%89%87%87%87%86%84%78%76%75%67%

Physics reasoning

GPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGPT-5.5 Pro (xhigh)Logo of GPT-5.5 Pro (xhigh)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelInklingLogo of InklingReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning model32%31%30%29%29%23%21%21%21%20%18%17%17%15%13%11%5%4%4%3%1%1%0%0%0%0%
Claude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelInklingLogo of InklingReasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelCommand A+Logo of Command A+Reasoning model61%59%54%52%50%47%46%46%42%40%38%38%37%31%30%30%25%25%23%22%22%20%17%15%9%
Command A+Logo of Command A+Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelInklingLogo of InklingReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning model86%84%77%75%74%72%72%71%66%64%63%60%50%49%46%46%45%37%18%18%16%15%11%10%9%

Long context reasoning

Kimi K3 (max)Logo of Kimi K3 (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelInklingLogo of InklingReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning model75%74%74%74%74%73%71%71%70%70%70%70%69%68%68%67%67%66%65%63%62%62%61%51%46%

Agentic knowledge work, Elo

Claude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelInklingLogo of InklingReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelCommand A+Logo of Command A+Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning model1719157415411502138513421314125211079629148808748426346115163743698

Agentic SaaS workflows

Kimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning model53%51%51%51%49%49%46%42%39%33%28%26%17%16%14%10%6%

Legal agentic work, criterion pass rate

Kimi K3 (max)Logo of Kimi K3 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning model95%94%92%91%91%90%88%88%87%85%83%82%73%69%61%47%14%

Agentic business operations

Claude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelInklingLogo of InklingReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning model51%47%45%45%45%44%43%43%41%38%34%32%29%29%28%26%

Instruction following

MiniMax-M3Logo of MiniMax-M3Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelCommand A+Logo of Command A+Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning model83%81%81%80%76%74%73%73%71%69%69%63%62%54%

Long-horizon agentic tasks

Kimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning model41%39%36%34%3%2%

Kubernetes incident root-cause analysis

GPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning model56%51%48%43%42%40%38%37%27%6%

Visual reasoning

Claude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelInklingLogo of InklingReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelCommand A+Logo of Command A+Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning model85%83%83%82%81%81%80%79%79%79%77%73%73%65%63%59%
Reasoning models are indicated by a lightbulb icon

While model intelligence generally translates across use cases, specific evaluations may be more relevant for certain use cases.

Artificial Analysis Intelligence Index v4.1 includes: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. See Intelligence Index methodology for further details, including a breakdown of each evaluation and how we run them.

AA-Briefcase

AA-Briefcase is a frontier agentic evaluation for long-horizon knowledge work, testing agents on realistic business workflows that require deliverables such as spreadsheets, presentations, and memos

AA-Briefcase Elo

AA-Briefcase is an agentic knowledge work benchmark developed by Artificial Analysis. AA-Briefcase Elo is a combined metric that aggregates rubric pass rate, analytical quality Elo and presentation Elo · Higher is better
1719157415411502138513421314125211079629148808748426346115163743698Claude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelInklingLogo of InklingReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelCommand A+Logo of Command A+Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning model
Reasoning models are indicated by a lightbulb icon

AA-Briefcase Elo is a combined metric that aggregates analytical quality Elo, presentation Elo, and rubric pass rate, with rubric performance converted into Elo via synthetic head-to-head matches. Elo and 95% confidence interval bounds are clamped at 0.

AA-Omniscience

AA-Omniscience is a knowledge and hallucination benchmark that rewards accuracy, punishes bad guesses and provides a comprehensive view of which models produce factually reliable outputs across different domains

AA-Omniscience Index

AA-Omniscience Index (higher is better) measures knowledge reliability and hallucination. It rewards correct answers, penalizes hallucinations, and has no penalty for refusing to answer. Scores range from -100 to 100, where 0 means as many correct as incorrect answers, and negative scores mean more incorrect than correct.
Claude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelInklingLogo of InklingReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelCommand A+Logo of Command A+Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning model403127262422221815147444210−1−4−4−11−16−36−45−50
Reasoning models are indicated by a lightbulb icon

AA-Omniscience Index (higher is better) measures knowledge reliability and hallucination. It rewards correct answers, penalizes hallucinations, and has no penalty for refusing to answer. Scores range from -100 to 100, where 0 means as many correct as incorrect answers, and negative scores mean more incorrect than correct.

GDPval-AA v2

GDPval-AA v2 evaluates AI models on real-world, economically valuable tasks across a wide range of occupations

GDPval-AA v2 Leaderboard

Elo rating for performance on real-world work tasks · Anchored to a human baseline of 1,000 · Higher is better
Human Baseline (1,000)
18521743173917301685163116001588157815771558152615081423138912711264123711611137931911807799713Claude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelInklingLogo of InklingReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelCommand A+Logo of Command A+Reasoning model
Reasoning models are indicated by a lightbulb icon

Artificial Analysis Openness Index assesses how 'open' models are on the basis of their availability and transparency across different components.

Artificial Analysis Openness Index: Components

Openness Index underlying score contribution by components, up to a maximum of 18 (higher is more open)
Nemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelInklingLogo of InklingReasoning modelCommand A+Logo of Command A+Reasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning model6.06.06.06.06.06.06.06.04.04.05.02.06.02.02.01.01.01.01.01.03.02.01.01.515.08.08.07.07.07.07.07.07.06.06.02.01.5
Reasoning models are indicated by a lightbulb icon

Artificial Analysis Openness Index vs. Artificial Analysis Intelligence Index

Most attractive quadrant
Pareto line
15202530354045505560Artificial Analysis Intelligence Index0102030405060708090Artificial Analysis Openness Index

Output Tokens

Output tokens of leading AI models based on our independent evaluations

Output Tokens per Intelligence Index Task

Weighted average number of output tokens used to run one task in the Artificial Analysis Intelligence Index
Gemma 4 31BLogo of Gemma 4 31BReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelCommand A+Logo of Command A+Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelInklingLogo of InklingReasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning model9k9k8k11k14k15k15k14k18k15k17k12k14k19k18k20k18k27k29k27k26k35k39k37k58k13k14k15k17k20k21k21k21k23k24k24k25k26k26k26k26k30k36k37k38k40k45k45k46k72k4k5k7k6k6k6k6k7k5k9k7k13k12k7k8k6k13k9k8k11k15k10k7k9k15k
Reasoning models are indicated by a lightbulb icon

The number of tokens required per Intelligence Index task. This is calculated by multiplying the output tokens per eval by the relative weights of each benchmark in the Intelligence Index, then dividing by task count (excluding repeats).

Cost

Price and real-world costs of leading AI models based on our independent evaluations

Cost per Intelligence Index Task

Weighted average cost (USD) per Artificial Analysis Intelligence Index task, segmented by token type. Lower is better
DeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning model$0.26$0.35$0.48$0.69$0.50$0.87$0.78$0.31$0.22$0.27$0.19$0.55$0.22$0.28$0.37$0.41$0.59$0.28$0.32$0.58$0.88$0.64$1.26$0.03$0.03$0.05$0.08$0.10$0.14$0.22$0.36$0.38$0.40$0.46$0.51$0.53$0.56$0.57$0.86$1.14$1.23$1.72$2.03$2.34$3.15$0.24$0.36$0.43
Reasoning models are indicated by a lightbulb icon

Weighted average cost per Intelligence Index task. Each evaluation’s cost is calculated from input, cache hit, cache write, reasoning, and answer token prices, divided by task count, and weighted by its Intelligence Index weight.

Cost to Run Artificial Analysis Intelligence Index

Cost (USD) to run all evaluations in the Artificial Analysis Intelligence Index
DeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning model$470$434$850$680$743$514$367$540$402$630$572$724$1,072$788$1,879$72$96$99$153$174$204$517$530$582$638$727$882$939$1,056$1,403$1,749$2,437$2,824$3,753$3,836$4,010$5,631$424$508
Reasoning models are indicated by a lightbulb icon

The cost to run the evaluations in the Artificial Analysis Intelligence Index, calculated using the model's input, cache hit, cache write, reasoning, and answer token prices and the number of tokens used across evaluations (excluding repeats).

Pricing: Cache Hit, Input, and Output

Price (USD per M Tokens)
DeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelGemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelInklingLogo of InklingReasoning modelMuse Spark 1.2 (xhigh)Logo of Muse Spark 1.2 (xhigh)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning model<0.010.15<0.010.020.060.030.20.170.150.230.10.250.30.150.150.50.20.20.30.50.50.510.140.150.440.20.30.30.611.251.351221.51.52.5223555100.280.60.871.21.22.52.754.054.254.295667.57.57.510121525253050
Reasoning models are indicated by a lightbulb icon

Price per token for cached prompts (previously processed), typically offering a significant discount compared to regular input price, represented as USD per million tokens. The values shown here are the cache hit price; cache write and cache storage are billed separately and vary by provider — see "Cache pricing by provider" for detail.

Speed & Latency

Comparison of first-party API performance

Output Speed

Output tokens per second · Higher is better
Gemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelCommand A+Logo of Command A+Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelInklingLogo of InklingReasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning model344213209202187176145143141126111104998282706864625959543935
Reasoning models are indicated by a lightbulb icon

Tokens per second received while the model is generating tokens (ie. after first chunk has been received from the API for models which support streaming).

Figures represent performance of the model's first-party API (e.g. OpenAI for o1) or the median across providers where a first-party API is not available (e.g. Meta's Llama models).

Time per Intelligence Index Task

Weighted average decode time (minutes) per task; excludes TTFT and overhead time · Lower is better
Gemini 3.5 Flash-LiteLogo of Gemini 3.5 Flash-LiteReasoning modelCommand A+Logo of Command A+Reasoning modelQwen3.7 MaxLogo of Qwen3.7 MaxReasoning modelGPT-5.6 Luna (max)Logo of GPT-5.6 Luna (max)Reasoning modelGemini 3.6 FlashLogo of Gemini 3.6 FlashReasoning modelNemotron 3 UltraLogo of Nemotron 3 UltraReasoning modelGPT-5.6 Terra (max)Logo of GPT-5.6 Terra (max)Reasoning modelMistral Medium 3.5Logo of Mistral Medium 3.5Reasoning modelMiniMax-M3Logo of MiniMax-M3Reasoning modelClaude 4.5 HaikuLogo of Claude 4.5 HaikuReasoning modelgpt-oss-120b (high)Logo of gpt-oss-120b (high)Reasoning modelGrok 4.5 (high)Logo of Grok 4.5 (high)Reasoning modelGPT-5.6 Sol (max)Logo of GPT-5.6 Sol (max)Reasoning modelGLM-5.2 (max)Logo of GLM-5.2 (max)Reasoning modelMiMo-V2.5-ProLogo of MiMo-V2.5-ProReasoning modelDeepSeek V4 Flash 0731 (max)Logo of DeepSeek V4 Flash 0731 (max)Reasoning modelInklingLogo of InklingReasoning modelClaude Fable 5 (with fallback)Logo of Claude Fable 5 (with fallback)Reasoning modelGemma 4 31BLogo of Gemma 4 31BReasoning modelClaude Opus 5 (max)Logo of Claude Opus 5 (max)Reasoning modelClaude Opus 4.8 (max)Logo of Claude Opus 4.8 (max)Reasoning modelQwen3.8 MaxLogo of Qwen3.8 MaxReasoning modelClaude Sonnet 5 (max)Logo of Claude Sonnet 5 (max)Reasoning modelKimi K3 (max)Logo of Kimi K3 (max)Reasoning model0.71.61.61.81.92.62.72.93.23.23.34.04.44.54.64.85.25.45.87.77.88.79.110.1
Reasoning models are indicated by a lightbulb icon

The weighted average time (seconds) per Artificial Analysis Intelligence Index task. This is calculated by dividing output tokens per task by output speed, weighted by the relative weights of each benchmark in the Intelligence Index.

Providers

Endpoint Accuracy Index: gpt-oss-120b (high)

v1.0 · Composite of BFCL v4-500, HLE-250 and AA-LCR-25 run against each provider endpoint · Percentage of the reference endpoint, with 95% confidence interval · Higher is better
100%101%98%98%98%97%97%97%93%91%89%87%86%86%84%72%70%SGLangLogo of SGLang
SGLang
AmazonLogo of AmazonSambaNovaLogo of SambaNovaParasailLogo of ParasailCoreWeaveLogo of CoreWeaveDeepInfraLogo of DeepInfraScalewayLogo of ScalewayNebius (Base)Logo of Nebius (Base)AzureLogo of AzureNovitaLogo of NovitaDatabricksLogo of DatabricksCerebrasLogo of CerebrasGroqLogo of GroqFireworksLogo of FireworksDeepInfra (Turbo)Logo of DeepInfra (Turbo)Google VertexLogo of Google VertexCloudflareLogo of Cloudflare

Composite measure of how much of a model's accuracy a given provider endpoint preserves, from re-running BFCL v4-500, HLE-250 and AA-LCR-25 against that endpoint. Where a self-hosted reference endpoint exists, scores are expressed as a percentage of that reference (100 = matches reference); lower scores indicate accuracy lost to quantisation, sampling defaults, or other endpoint-side configuration. Scores are point-in-time snapshots. Methodology.

Output Speed vs. Price: gpt-oss-120b (high)

Output tokens per second · USD per 1M tokens (blended) · 10,000 input tokens
Most attractive quadrant
Pareto line
$0$0.05$0.1$0.15$0.2$0.25$0.3$0.35$0.4$0.45Price (USD per M Tokens)02004006008001.00k1.20k1.40k1.60k1.80k2.00k2.20kOutput Speed (Output Tokens per Second)
Reasoning models are indicated by a lightbulb icon

Smaller, emerging providers are offering high output speed and at competitive prices.

Pricing (Cache Hit, Input, and Output): gpt-oss-120b (high)

Price (USD per M Tokens) · Lower is better · 10,000 input tokens
CoreWeaveLogo of CoreWeaveDeepInfraLogo of DeepInfraNovitaLogo of NovitaGoogle VertexLogo of Google VertexBasetenLogo of BasetenAmazonLogo of AmazonAzureLogo of AzureDatabricksLogo of DatabricksDeepInfra (Turbo)Logo of DeepInfra (Turbo)FireworksLogo of FireworksGroqLogo of GroqNebius (Base)Logo of Nebius (Base)SambaNovaLogo of SambaNovaParasailLogo of ParasailScalewayLogo of ScalewayCerebrasLogo of CerebrasCloudflareLogo of Cloudflare0.080.060.030.040.050.090.10.150.150.150.150.150.150.150.220.10.170.350.350.170.170.250.360.50.60.60.60.60.60.60.60.590.750.70.750.75

Price per token for cached prompts (previously processed), typically offering a significant discount compared to regular input price, represented as USD per million tokens. The values shown here are the cache hit price; cache write and cache storage are billed separately and vary by provider — see "Cache pricing by provider" for detail.

Output Speed: gpt-oss-120b (high)

Output speed: output tokens per second · 10,000 input tokens
CerebrasLogo of CerebrasSambaNovaLogo of SambaNovaGroqLogo of GroqGoogle VertexLogo of Google VertexDatabricksLogo of DatabricksAzureLogo of AzureParasailLogo of ParasailDeepInfra (Turbo)Logo of DeepInfra (Turbo)ScalewayLogo of ScalewayBasetenLogo of BasetenNebius (Base)Logo of Nebius (Base)FireworksLogo of FireworksCloudflareLogo of CloudflareAmazonLogo of AmazonNovitaLogo of NovitaDeepInfraLogo of DeepInfraCoreWeaveLogo of CoreWeave1991708476423324300177175172165132122112101914633

Tokens per second received while the model is generating tokens (ie. after first chunk has been received from the API for models which support streaming).

Figures represent performance of the model's first-party API (e.g. OpenAI for o1) or the median across providers where a first-party API is not available (e.g. Meta's Llama models).