Claude Sonnet 5 vs Claude Sonnet 5.5: What's Improved

Anthropic has officially unveiled Claude Sonnet 5.5, and it is a significant update over Claude Sonnet 5. Here is what's improved:

Benchmarks

BenchmarkClaude Sonnet 5Claude Sonnet 5.5Change
Terminal-Bench 4.010.3%70.6%+60.3 points
FrontierCode 1.1 (Main)42.4%52.1%Xhigh effort. 46.2% at Max+9.7 points+3.8 at Max
CursorBench 4.034.1%55.5%+21.4 points
SWE-Bench Pro63.2%81.3%+18.1 points
SWE-Bench Multilingual78.3%90.3%+12.0 points
SWE-Bench Multimodal28.1%54.3%+26.2 points
GDPval-AA v2.11449 Elo1844 Elo+395 Elo
AA-Briefcase v1.11359 Elo1811 Elo+452 Elo
Humanity's Last Exam, with tools54.9%64.5%+9.6 points
Humanity's Last Exam, no tools43.1%56.9%+13.8 points
AutomationBench, Zapier10.7%44.7%+34.0 points
HealthBench Professional57.8%69.2%+11.4 points
ProgramBench, long context77.3%79.7%+2.4 points
OSWorld 2.1, partial credit57.0%80.1%+23.1 points
OSWorld 2.1, strict pass25.6%43.5%+17.9 points
Chartography, no tools15.6%61.6%+46.0 points

Artificial Analysis benchmarks

BenchmarkClaude Sonnet 5Claude Sonnet 5.5Change
Intelligence Index v4.3.23856+18
AA-Briefcase v1.11359 Elo1811 Elo+452 Elo
GDPval-AA v2.11449 Elo1844 Elo+395 Elo
AutomationBench-AA37%71%+34 points
Terminal-Bench 4.014%64%+50 points
SciCode54%61%+7 points
Humanity's Last Exam41%55%+14 points
CritPt, physics17%31%+14 points
AA-Omniscience1632+16
AA-LCR v1.1, long context82%83%+1 point