Claude Sonnet 5 vs Claude Sonnet 5.5: What's Improved
Anthropic has officially unveiled Claude Sonnet 5.5, and it is a significant update over Claude Sonnet 5. Here is what's improved:
Benchmarks
| Benchmark | Claude Sonnet 5 | Claude Sonnet 5.5 | Change |
|---|---|---|---|
| Terminal-Bench 4.0 | 10.3% | 70.6% | +60.3 points |
| FrontierCode 1.1 (Main) | 42.4% | 52.1%Xhigh effort. 46.2% at Max | +9.7 points+3.8 at Max |
| CursorBench 4.0 | 34.1% | 55.5% | +21.4 points |
| SWE-Bench Pro | 63.2% | 81.3% | +18.1 points |
| SWE-Bench Multilingual | 78.3% | 90.3% | +12.0 points |
| SWE-Bench Multimodal | 28.1% | 54.3% | +26.2 points |
| GDPval-AA v2.1 | 1449 Elo | 1844 Elo | +395 Elo |
| AA-Briefcase v1.1 | 1359 Elo | 1811 Elo | +452 Elo |
| Humanity's Last Exam, with tools | 54.9% | 64.5% | +9.6 points |
| Humanity's Last Exam, no tools | 43.1% | 56.9% | +13.8 points |
| AutomationBench, Zapier | 10.7% | 44.7% | +34.0 points |
| HealthBench Professional | 57.8% | 69.2% | +11.4 points |
| ProgramBench, long context | 77.3% | 79.7% | +2.4 points |
| OSWorld 2.1, partial credit | 57.0% | 80.1% | +23.1 points |
| OSWorld 2.1, strict pass | 25.6% | 43.5% | +17.9 points |
| Chartography, no tools | 15.6% | 61.6% | +46.0 points |
Artificial Analysis benchmarks
| Benchmark | Claude Sonnet 5 | Claude Sonnet 5.5 | Change |
|---|---|---|---|
| Intelligence Index v4.3.2 | 38 | 56 | +18 |
| AA-Briefcase v1.1 | 1359 Elo | 1811 Elo | +452 Elo |
| GDPval-AA v2.1 | 1449 Elo | 1844 Elo | +395 Elo |
| AutomationBench-AA | 37% | 71% | +34 points |
| Terminal-Bench 4.0 | 14% | 64% | +50 points |
| SciCode | 54% | 61% | +7 points |
| Humanity's Last Exam | 41% | 55% | +14 points |
| CritPt, physics | 17% | 31% | +14 points |
| AA-Omniscience | 16 | 32 | +16 |
| AA-LCR v1.1, long context | 82% | 83% | +1 point |