Anthropic
Grade My Model
Explore DeepSWE model performance, pricing, and comparisons in one place.
Leaderboard snapshot: 2026-08-13T16:11:55.708636+00:00
Model selector
Choose the model and reasoning effort rows to compare.
15 of 61 selected
Anthropic
Claude Opus
Anthropic
Claude Sonnet
DeepSeek
Deepseek V Flash
DeepSeek
Deepseek V Pro
Gemini 3 Flash
Zhipu
Glm
Luna
Gpt 5 Luna
OpenAI
Gpt 5 Sol
OpenAI
Gpt 5 Terra
xAI
Grok 4
Moonshot
Kimi K
Moonshot
Kimi K Code
Meta
Muse Spark
Alibaba
Qwen Max
Efficiency frontier
Compare DeepSWE pass rate with mean cost. The top-left corner is the sweet spot: higher performance for less money.
15 selected models
Chart loads in the browser.
Leaderboard table
FilledUncertainEmpty
15 selected models · sort by performance, price, or speed when shown
| Model | lower is cheaper | Savings | Reference | |
|---|---|---|---|---|
claude-opus-5 max Anthropic | 73.6% ±3.9 | $11.84 / task $0.16/ point | 60.3% cheaper reference | gpt-5-6-sol Tier: xhigh |
gpt-5-6-sol max OpenAI | 72.7% ±2.8 | $8.39 / task $0.12/ point | 43.9% cheaper reference | gpt-5-6-sol Tier: xhigh |
claude-fable-5 xhigh Anthropic | 69.9% ±3.2 | $13.41 / task $0.19/ point | 84.9% cheaper reference | gemini-3-7-flash Tier: medium |
gpt-5-6-terra max OpenAI | 69.6% ±2.6 | $4.95 / task $0.07/ point | 59.1% cheaper reference | gemini-3-7-flash Tier: medium |
kimi-k3 max Moonshot | 68.5% ±4.5 | $4.65 / task $0.07/ point | 56.5% cheaper reference | gemini-3-7-flash Tier: medium |
grok-4-6 medium xAI | 67.5% ±2.3 | $3.45 / task $0.05/ point | 41.3% cheaper reference | gemini-3-7-flash Tier: medium |
gpt-5-6-luna max Luna | 67.2% ±4.0 | $3.03 / task $0.05/ point | 33.1% cheaper reference | gemini-3-7-flash Tier: medium |
gemini-3-7-flash medium Google | 65.5% ±3.1 | $2.03 / task $0.03/ point | — | No cheaper match Similar-score reference unavailable |
deepseek-v4-pro max DeepSeek | 62.8% ±6.3 | $0.24 / task $0.0038/ point | — | No cheaper match Similar-score reference unavailable |
qwen3-8-max xhigh Alibaba | 57.5% ±2.7 | $3.73 / task $0.06/ point | 93.5% cheaper reference | deepseek-v4-pro Tier: max |
muse-spark-1-2 xhigh Meta | 54.9% ±2.1 | $3.70 / task $0.07/ point | 97.3% cheaper reference | deepseek-v4-flash Tier: max |
claude-sonnet-5 max Anthropic | 53.8% ±4.2 | $26.40 / task $0.49/ point | 99.6% cheaper reference | deepseek-v4-flash Tier: max |
deepseek-v4-flash max DeepSeek | 53.3% ±3.6 | $0.10 / task $0.0019/ point | — | No cheaper match Similar-score reference unavailable |
glm-5-2 max Zhipu | 43.8% ±1.7 | $3.92 / task $0.09/ point | 97.4% cheaper reference | deepseek-v4-flash Tier: max |
kimi-k2-7-code default Moonshot | 30.5% ±0.5 | $2.82 / task $0.09/ point | 96.4% cheaper reference | deepseek-v4-flash Tier: max |