Claude Opus 5 medium slog Sonnet 5 max – till halva kostnaden

Den vanliga modellen för AI-routing är enkel: börja billigt och växla upp till Opus när uppgiften blir svår. Claude Opus 5 får den regeln att kännas gammal.
För kvalificerat agentarbete kan den bättre utgångspunkten nu vara en starkare modell med lägre effort-nivå. Varje token kostar mer, men agenten kan behöva betydligt färre tokens, verktygsanrop och omtag för att bli klar.
Det är inte bara en teori. På CursorBench 3.2 fick Opus 5 på medium 64,3 procent till en kostnad av 3,29 dollar per uppgift. Sonnet 5 på max fick 61,5 procent till en kostnad av 6,45 dollar. Opus använde 23 612 tokens och 44 steg. Sonnet använde 92 882 tokens och 86 steg.
I det testet var Opus 5 medium något bättre, använde cirka 75 procent färre tokens och kostade 49 procent mindre.
Källa: CursorBench 3.2
Hur står sig Sonnet 5 på high och xhigh?
Samma test ger ett ovanligt tydligt svar. Opus 5 medium slog inte bara Sonnet max med liten marginal:
- Mot Sonnet 5 high fick Opus medium 7,4 procentenheter högre resultat för bara 0,10 dollar mer per uppgift. Modellen använde 40 procent färre tokens och 13 färre steg.
- Mot Sonnet 5 xhigh fick Opus medium 5,6 poäng högre resultat, kostade 21 procent mindre, använde 55 procent färre tokens och tog 23 färre steg.
- Mot Sonnet 5 max fick Opus medium 2,8 poäng högre resultat, kostade 49 procent mindre, använde 75 procent färre tokens och tog 42 färre steg.
High var alltså den enda av dessa Sonnet-nivåer som var marginellt billigare per uppgift – och den gav lägst resultat. Xhigh och max kostade båda mer men fick lägre resultat. Det här är ett enskilt test, inte en naturlag, men det ger ett starkt stöd för Opus medium som standardval för kvalificerat agentarbete.

Diagrammet är återskapat från de publika resultaten i CursorBench 3.2. Poäng och genomsnittlig uppgiftskostnad återges exakt som rapporterat.
Det viktiga är kostnaden per färdig uppgift
Sonnet 5 är fortfarande billigare i prislistan. Till och med den 31 augusti 2026 kostar modellen 2 dollar per miljon inputtokens och 10 dollar per miljon outputtokens. Från den 1 september blir standardpriset 3/15 dollar. Opus 5 kostar 5/25 dollar.
Om modellerna använder exakt lika många tokens vinner Sonnet på pris. Opus kostar 2,5 gånger mer än Sonnet till introduktionspris och 1,67 gånger mer än Sonnet till ordinarie pris.
Men en agent köper inte ett identiskt tokenpaket. Den ska lösa en uppgift. En svagare körning kan utforska fler sidospår, göra fler verktygsanrop, upprepa kontroller, missa grundorsaken och behöva ett nytt försök. CursorBench visar hur modellen med billigare tokens ändå kan bli den dyrare medarbetaren.
Skillnaden ökar dessutom när Sonnet 5:s introduktionspris löper ut. Med samma användning skulle uppgiften som nu kostar 6,45 dollar i stället kosta cirka 9,68 dollar. I just det testet skulle Opus 5 medium då bli ungefär 66 procent billigare.
Källa: Anthropics API-priser
Resultatet syns även utanför ett enskilt kodtest
Artificial Analysis testar modeller på GDPval-AA v2: 220 realistiska yrkesuppgifter med dokument, kalkylblad, diagram och research från 44 yrken.
Där fick Opus 5 medium 1 632 Elo, medan Sonnet 5 max fick 1 603. Skillnaden är liten och de rapporterade osäkerhetsintervallen överlappar. Den bör därför inte säljas in som en avgörande seger. Däremot visar den att Cursor-resultatet inte bara handlar om kod: Opus på medium når samma kvalitetsnivå som Sonnet på max även i praktiskt kunskapsarbete.
Anthropics egna lanseringstester pekar åt samma håll. Företaget rapporterar ledande resultat för Opus 5 på Frontier-Bench, förstaplats på Zapier AutomationBench även på low och bättre datoranvändning än Fable 5 till drygt en tredjedel av kostnaden. Det är leverantörens egna siffror, men de omfattar kod, webbläsararbete, affärsautomation och långkörande agenter – inte bara ett smalt test.
Källor: GDPval-AA v2, Anthropics lansering av Opus 5

Anthropics lanseringsdiagram för GDPval-AA v2 visar Opus och Fable på olika effort-nivåer i förhållande till kostnad. Sonnet 5 ingår inte i bilden; jämförelsen mellan Opus och Sonnet ovan kommer från Artificial Analysis aktuella topplista. Källa: Anthropic.
Varför Opus 5 förändrar synen på agenter
Tidigare agenter kompenserade ofta för modellernas begränsningar med mer struktur: detaljerade planer, granskningsagenter, upprepade omtag och hårt styrda verktygsflöden. Opus 5 är bättre på att hitta grundorsaker, kontrollera sitt eget arbete och fortsätta tills uppgiften faktiskt är klar. Anthropic skriver också att modellen delegerar till underagenter mer aktivt och varnar för att gamla instruktioner om extra verifiering nu kan leda till överdriven kontroll.
Det spelar roll eftersom orkestrering inte är gratis. Varje omtag kostar tokens och tid och skapar ännu ett tillfälle för arbetsflödet att glida. En modell som behöver färre korrigerande rundor kan därför bli billigare trots att varje token kostar mer.
Opus 5 ger dessutom teamen en praktisk kontroll: low, medium, high, xhigh och max. Effort påverkar hela svaret, även modellens tänkande, verktygsanrop och funktionsargument. Det är ingen hård tokenbudget, men det låter en enda modell täcka ett brett arbetsområde.
Källor: Nyheterna i Opus 5, Anthropics dokumentation om effort
Opus 5 mot Fable 5: premiumvalet blir svårare att motivera
Fable 5 är fortfarande Anthropics mest kapabla brett tillgängliga modell. Den kostar också exakt dubbelt så mycket som Opus 5: 10/50 dollar jämfört med 5/25 dollar per miljon input- och outputtokens.
CursorBench gör avvägningen ovanligt tydlig:
- Medium: Opus 5 fick 64,3 procent för 3,29 dollar. Fable 5 fick 65,2 procent för 6,80 dollar.
- High: Opus 5 fick 66,7 procent för 3,91 dollar. Fable 5 fick 66,5 procent för 8,77 dollar.
- Max: Opus 5 fick 70,0 procent för 8,23 dollar. Fable 5 fick 70,5 procent för 17,32 dollar.

Anthropics lanseringsdiagram för CursorBench visar resultat mot uppgiftskostnad över flera effort-nivåer. Källa: Anthropic; underliggande test: CursorBench 3.2.
På dessa nivåer gav Opus nästan samma resultat till ungefär halva kostnaden per uppgift. Fable kan fortfarande vara rätt när ett eget test visar att den sista lilla kapacitetsfördelen påverkar utfallet. Modellerna har också olika skydd och lagringsvillkor: Fable har ett obligatoriskt krav på 30 dagars datalagring, medan vanlig åtkomst till Opus 5 saknar ett modellspecifikt lagringskrav.
Resultaten stödjer däremot inte påståendet att Opus är standardvalet för exakt allt. Sonnet och Haiku är fortfarande rimliga för enkla flöden med hög volym eller hårda latenskrav. Mythos är starkare för vissa riskfyllda uppgifter inom cyber och biologi. Men för generella agenter som utför värdefullt arbete ser Fable nu mer ut som ett undantag än det självklara premiumvalet.
Källor: CursorBench 3.2, Översikt över Claude-modeller, Dokumentation för Fable 5
En praktisk routingpolicy
En rimlig startpunkt för agentarbete är nu:
- Opus 5 medium: vardagsvalet för avgränsad kodning, research och affärsflöden där resultatet spelar roll.
- Opus 5 high: otydliga uppgifter, djupare resonemang och arbete som måste hålla ihop genom flera verktygsanrop.
- Opus 5 xhigh: långkörande kodning och agenter med hög autonomi. Det är också Anthropics rekommenderade startpunkt för krävande agentarbete.
- Opus 5 max: reservera nivån för verkliga gränsproblem där egna utvärderingar visar att obegränsad effort lönar sig.
- Sonnet 5: snabba, enklare flöden med hög volym där tester visar att det lägre tokenpriset också ger lägre kostnad per färdig uppgift.
- Fable 5: när den mätbara kvalitetsfördelen är värd ungefär dubbla priset eller när arbetsflödet uttryckligen kräver modellen.
Byt inte effort blint mitt i en cachetung konversation. Anthropic uppger att ett byte ogiltigförklarar cachade prefix. Välj nivå efter arbetsflöde, håll den stabil under sessionen och mät kostnad per godkänt resultat i stället för kostnad per miljon tokens.
Slutsats
Opus 5 gör inte Sonnet 5 överflödig. Däremot blir Sonnet 5 på high, xhigh och max svåra att försvara som standardval för krävande agenter. I CursorBench slog Opus medium alla tre: high var bara 0,10 dollar billigare men fick 7,4 poäng lägre resultat, medan xhigh och max både kostade mer och fick lägre resultat.
Den skarpare modellen är: börja värdefullt agentarbete med Opus 5 medium. Höj Opus effort när egna utvärderingar visar att komplexiteten motiverar det. Växla ner till Sonnet eller Haiku när hastighet, volym eller latens väger tyngre – och bara när mätningarna visar att den färdiga uppgiften faktiskt blir billigare.
Det här är ett enskilt test, inte en lag för alla arbetsflöden. Men det förändrar standardfrågan. Fråga inte vilken modell som säljer billigast tokens. Fråga: Vilken är den lägsta effort-nivån på den starkaste modellen som tillförlitligt slutför uppgiften?
Vanliga frågor
Är Claude Opus 5 billigare än Sonnet 5?
Inte per token. Opus 5 kostar mer per miljon tokens. På svåra agentuppgifter kan den ändå bli billigare per färdigt resultat eftersom den använder färre tokens, verktygsanrop och omtag.
Kan Opus 5 medium verkligen slå Sonnet 5 max?
Ja. I CursorBench 3.2 fick Opus 5 medium 64,3 procent till 3,29 dollar per uppgift. Det slog Sonnet 5 high med 7,4 poäng, xhigh med 5,6 poäng och max med 2,8 poäng. Resultatet gäller detta test och bör verifieras mot egna arbetsflöden.
Vilken effort-nivå bör man börja med för Opus 5?
Medium är en stark vardagsnivå för avgränsat agentarbete. Anthropic rekommenderar xhigh som startpunkt för krävande kodning och agenter med hög autonomi, och high för andra intelligenskänsliga uppgifter.
Ersätter Opus 5 Fable 5?
Inte helt. Opus 5 ligger mycket nära Fable 5 i flera agenttester till ungefär halva kostnaden, men Fable kan fortfarande vara motiverad när egna tester visar en avgörande kvalitetsfördel. Specialiserade riskområden kan också kräva andra modeller och åtkomstregler.
Smedjans nyhetsbrev
Få nya artiklar i inkorgen
Välj de ämnen som intresserar dig. Inget brus, max ett mejl i veckan.
Vi följer GDPR. Avsluta när du vill.


