Skip to content
LLM Pulse

Leaderboards

Benchmark leaderboards

95 benchmarks across 608 scored entries — each leaderboard pairs scores with current best prices. Also available as JSON.

SWE-Bench Pro
56 models scoredview →
🥇 Claude Fable 5 (80.3)
Terminal-Bench
46 models scoredview →
🥇 GPT-5.6 Sol (88.8)
SWE-Bench Verified
36 models scoredview →
🥇 Claude Opus 5 (96)
Humanity's Last Exam
31 models scoredview →
🥇 Claude Opus 5 (64.7)
SciCode
30 models scoredview →
🥇 Fugu (60.1)
Artificial Analysis Coding Index
27 models scoredview →
🥇 GPT-5-Codex (38.9)
Aider Polyglot
26 models scoredview →
🥇 GPT-5 (88)
SWE-Atlas Codebase QnA
26 models scoredview →
🥇 Claude Opus 4.7 (81)
Terminal-Bench Hard
22 models scoredview →
🥇 GPT-5-Codex (37.9)
GPQA Diamond
17 models scoredview →
🥇 Fugu (95.5)
Artificial Analysis Coding Agent Index
17 models scoredview →
🥇 GPT-5.6 Sol (80)
OSWorld-Verified
16 models scoredview →
🥇 Claude Fable 5 (85)
BrowseComp
14 models scoredview →
🥇 Kimi K3 (91.2)
SWE-Atlas Test Writing
12 models scoredview →
🥇 GPT-5.4 (44.36)
DeepSWE
12 models scoredview →
🥇 GPT-5.6 Sol (72.7)
MCP Atlas
11 models scoredview →
🥇 Muse Spark 1.1 (88.1)
SWE-Atlas Refactoring
11 models scoredview →
🥇 Claude Opus 4.7 (48.57)
MMMU Pro
11 models scoredview →
🥇 Gemini 3.5 Flash (83.6)
CharXiv Reasoning
11 models scoredview →
🥇 Kimi K3 (91.3)
FrontierMath
11 models scoredview →
🥇 GPT-5.6 Sol (89)
GDPval-AA
9 models scoredview →
🥇 Claude Fable 5 (1932)
Toolathlon
8 models scoredview →
🥇 GPT-5.6 Sol (58)
SWE-Bench Multilingual
7 models scoredview →
🥇 Claude Opus 5 (89.5)
ARC-AGI-2
6 models scoredview →
🥇 Claude Opus 5 (90.4)
GDPval
6 models scoredview →
🥇 GPT-5.5 (84.9)
FrontierCode
5 models scoredview →
🥇 Claude Opus 5 (53.4)
AutomationBench
5 models scoredview →
🥇 Kimi K3 (30.8)
Artificial Analysis Intelligence Index
5 models scoredview →
🥇 GPT-5.6 Sol (58.9)
τ²-Bench Telecom
5 models scoredview →
🥇 GPT-5.5 (98)
GDM-MRCR
5 models scoredview →
🥇 Gemini 3.7 Flash (97)
OSWorld
4 models scoredview →
🥇 Claude Opus 5 (70.6)
Agents' Last Exam
4 models scoredview →
🥇 GPT-5.6 Sol (52.7)
OpenAI MRCR
4 models scoredview →
🥇 GPT-5.4 mini (47.7)
Graphwalks
4 models scoredview →
🥇 GPT-5.4 mini (76.3)
NL2Repo
3 models scoredview →
🥇 DeepSeek V4 Flash 0731 (54.2)
Program Bench
3 models scoredview →
🥇 Kimi K3 (77.8)
SWE Marathon
3 models scoredview →
🥇 Kimi K3 (42)
LiveCodeBench
3 models scoredview →
🥇 Fugu Ultra (93.2)
AA-Briefcase
2 models scoredview →
🥇 Claude Opus 5 (1720)
ARC-AGI-1
2 models scoredview →
🥇 Claude Opus 5 (97.5)
Toolathlon-Verified
2 models scoredview →
🥇 Muse Spark 1.1 (75.6)
MLE-Bench
2 models scoredview →
🥇 Gemini 3.6 Flash (63.9)
JobBench
2 models scoredview →
🥇 Muse Spark 1.1 (54.7)
FrontierSWE
2 models scoredview →
🥇 Kimi K3 (81.2)
MMLU-Pro
2 models scoredview →
🥇 Sakana Namazu (90.33)
IFBench
2 models scoredview →
🥇 Nemotron 3 Ultra 550B A55B (81.7)
OmniDocBench
2 models scoredview →
🥇 GPT-5.4 nano (0.2419)
GeneBench
2 models scoredview →
🥇 GPT-5.5 Pro (33.2)
SWE Bench Pro
2 models scoredview →
🥇 Fugu Ultra (73.7)
Terminal Bench 2.1
2 models scoredview →
🥇 Fugu Ultra (82.1)
LiveCodeBench Pro
2 models scoredview →
🥇 Fugu Ultra (90.8)
Humanity’s Last Exam
2 models scoredview →
🥇 Fugu Ultra (50)
τ3 Banking
2 models scoredview →
🥇 Fugu (21.7)
Long Context Reasoning
2 models scoredview →
🥇 Fugu (74.7)
MRCRv2
2 models scoredview →
🥇 Fugu Ultra (93.6)
CTI-REALM
2 models scoredview →
🥇 Fugu Ultra (69.4)
HMMT
2 models scoredview →
🥇 GLM-5.2 (94.4)
SWE-bench Pro
1 models scoredview →
🥇 Qwen3.8 27B (61.7)
SWE-Bench Multimodal
1 models scoredview →
🥇 Claude Opus 5 (59.4)
Frontier-Bench
1 models scoredview →
🥇 Claude Opus 5 (43.3)
DeepSearchQA
1 models scoredview →
🥇 Claude Opus 5 (95)
ARC-AGI-3
1 models scoredview →
🥇 Claude Opus 5 (30.2)
HealthBench Professional
1 models scoredview →
🥇 Claude Opus 5 (59.8)
CyberGym
1 models scoredview →
🥇 DeepSeek V4 Flash 0731 (76.7)
DSBench-FullStack
1 models scoredview →
🥇 DeepSeek V4 Flash 0731 (68.7)
DSBench-Hard
1 models scoredview →
🥇 DeepSeek V4 Flash 0731 (59.6)
GDP.pdf
1 models scoredview →
🥇 Gemini 3.7 Flash (34)
LMArena Text-to-Video Arena
1 models scoredview →
🥇 Gemini Omni Flash Preview (1527)
IFEval
1 models scoredview →
🥇 LongCat-2.0 (90)
FORTE
1 models scoredview →
🥇 LongCat-2.0 (73.2)
DeepSearch QA
1 models scoredview →
🥇 Muse Glimmer 30B (74.6)
AIME 2026
1 models scoredview →
🥇 Muse Glimmer 30B (94.7)
Finance Agent
1 models scoredview →
🥇 Muse Spark 1.1 (57.2)
BabyVision
1 models scoredview →
🥇 Muse Spark 1.1 (76.3)
τ³-Telecom
1 models scoredview →
🥇 Mistral Medium 3.5 (91.4)
Kimi Code Bench
1 models scoredview →
🥇 Kimi K2.7 Code (62)
MLS Bench Lite
1 models scoredview →
🥇 Kimi K2.7 Code (35.1)
MCP Mark Verified
1 models scoredview →
🥇 Kimi K2.7 Code (81.1)
Kimi Claw 24/7 Bench
1 models scoredview →
🥇 Kimi K2.7 Code (46.9)
SpreadsheetBench
1 models scoredview →
🥇 Kimi K3 (34.8)
ZeroBench
1 models scoredview →
🥇 Kimi K3 (41)
GPQA
1 models scoredview →
🥇 Nemotron 3 Ultra 550B A55B (87)
FinanceAgent
1 models scoredview →
🥇 GPT-5.4 Pro (61.5)
AIME26
1 models scoredview →
🥇 Sakana Namazu (96.67)
LiveCodeBench v6
1 models scoredview →
🥇 Sakana Namazu (90.33)
JFBench
1 models scoredview →
🥇 Sakana Namazu (37.4)
Translation
1 models scoredview →
🥇 Sakana Namazu (52.2)
FairPoliticsQA
1 models scoredview →
🥇 Sakana Namazu (56.3)
ClawEval
1 models scoredview →
🥇 Step 3.7 Flash (67.1)
Terminal Bench 2.0
1 models scoredview →
🥇 GLM-4.7 (33.4)
CritPt
1 models scoredview →
🥇 GLM-5.2 (20.9)
AIME
1 models scoredview →
🥇 GLM-5.2 (99.2)
IMOAnswerBench
1 models scoredview →
🥇 GLM-5.2 (91)
PostTrainBench
1 models scoredview →
🥇 GLM-5.2 (34.3)
Tool-Decathlon
1 models scoredview →
🥇 GLM-5.2 (48.2)