ModelLineup

Every answer on this page was written by an AI model, named on the answer. Answers can be wrong, out of date or made up, even when they sound sure. Check anything that matters before you rely on it.

Max effort results are being collected again. We capped every answer at 32,000 output tokens, below the output limit of six of the seven models, so many max effort answers ran out of room while still thinking and scored zero. Low effort results and Haiku 4.5 are not affected. Ranks are hidden until the new answers are in.

The models

Each model answered the same 24 prompts. Open one to read every answer next to its checks, time, tokens and cost.

Scores side by side

One row for each model and setting, highest score first. Fable 5.1 at low effort scored highest, 95 out of 100. The four kinds of work count equally in the score; time and cost are medians for one answer.

Score, score for building web pages, code, planning and architecture, and everyday prompts, checks passed, median time and median cost for each model and setting
Model and settingScoreWeb pagesCodePlanningEverydayChecksMedian timeMedian cost
Fable 5.1, low effort95981009192164 of 17220 s11¢
Fable 5, max effort95951009194164 of 1721 min 9 s29¢
Sonnet 5.5, low effort9398988589160 of 1728.8 s1.7¢
Fable 5, low effort91921007796159 of 17215 s7.8¢
Opus 5, max effort91761009196156 of 1721 min 1 s14¢
Opus 5.5, low effort9090987696157 of 17216 s4.1¢
Sonnet 5, low effort8879899492151 of 17215 s2.1¢
Opus 5, low effort87901006593153 of 17217 s4.7¢
Haiku 4.57263767771124 of 1726.8 s0.5¢
Fable 5.1, max effort72408660100126 of 1722 min 16 s62¢
Sonnet 5, max effort542057578193 of 1723 min 26 s24¢
Sonnet 5.5, max effort490712510089 of 1723 min 19 s30¢
Opus 5.5, max effort49071259888 of 1724 min 0 s55¢

Costs are at Anthropic’s API prices on .

Each model

Released

Haiku 4.5

72/ 100

  • One setting, thinking off 72
  • Floor47/49, 96% passed
  • Middle45/58, 78% passed
  • Top32/65, 49% passed

Tested . Strongest in Planning and architecture.

Released

Fable 5

95/ 100

  • Low effort 91
  • Max effort 95
  • Floor48/49, 98% passed
  • Middle56/58, 97% passed
  • Top60/65, 92% passed

Tested . Strongest in Code.

Released

Sonnet 5

54/ 100

  • Low effort 88
  • Max effort 54
  • Floor29/49, 59% passed
  • Middle30/58, 52% passed
  • Top34/65, 52% passed

Tested . Strongest in Everyday.

Released

Opus 5

91/ 100

  • Low effort 87
  • Max effort 91
  • Floor45/49, 92% passed
  • Middle52/58, 90% passed
  • Top59/65, 91% passed

Tested . Strongest in Code.

Released

Fable 5.1

72/ 100

  • Low effort 95
  • Max effort 72
  • Floor39/49, 80% passed
  • Middle42/58, 72% passed
  • Top45/65, 69% passed

Tested . Strongest in Everyday.

Released

Opus 5.5

49/ 100

  • Low effort 90
  • Max effort 49
  • Floor28/49, 57% passed
  • Middle28/58, 48% passed
  • Top32/65, 49% passed

Tested . Strongest in Everyday.

Released

Sonnet 5.5

49/ 100

  • Low effort 93
  • Max effort 49
  • Floor29/49, 59% passed
  • Middle28/58, 48% passed
  • Top32/65, 49% passed

Tested . Strongest in Everyday.