AI Enablement Radar vecka 31: välj modell per arbetssteg och mät utfallet

Den här veckan blev AI-arbete enklare att dela upp och mäta. OpenAI sänker priset på vissa GPT-5.6-modeller, Google gör agentutvärdering allmänt tillgänglig och Notion låter mötesanteckningar starta nästa arbetssteg. För en mindre verksamhet betyder det att samma arbetsflöde kan använda olika modeller, mätas per steg och lämna tydliga beslut till en människa.
Toppsignaler denna vecka
-
OpenAI sänkte API-priset för GPT-5.6 Luna med 80 procent till 0,20 dollar per miljon indatatoken och 1,20 dollar per miljon utdatatoken. Terra blev 20 procent billigare. Det gör modellval per arbetssteg till en budgetfråga som går att testa, inte bara en teknisk detalj. Källa: Advancing the price-performance frontier with GPT-5.6.
-
Google gjorde Agent and Model Evaluations i Gemini Enterprise Agent Platform allmänt tillgängligt. Tjänsten har fler än 20 färdiga mått för bland annat kvalitet, källförankring, verktygsanvändning och agentens väg genom en uppgift. Källa: Agent and Model Evaluations in Gemini Enterprise Agent Platform are now GA.
-
National University Health System i Singapore visar varför avgränsning fungerar. Fyra separata AI-verktyg hjälper farmaceuter med läkemedelsavstämning, sortering och verifiering. De första valideringarna låg mellan över 88 och 100 procents träffsäkerhet, medan farmaceuten behåller det kliniska beslutet. Källa: NUHS unveils novel AI platform to strengthen medication safety and streamline pharmacy workflows.
-
Notion Custom Agents kan nu starta när en AI Meeting Note har sammanfattats. Ett möte kan därmed följas av en uppdaterad projektstatus, en sammanfattning i Slack eller nya ärenden, utan att någon flyttar text mellan systemen för hand. Källa: AI Meeting Notes can now trigger Custom Agents.
-
EU:s AI Omnibus trädde i kraft den 27 juli. Tidslinjen för vissa högrisksystem har flyttats, men transparenskraven i AI Act artikel 50 börjar gälla den 2 augusti 2026. Organisationer behöver därför kunna förklara när en människa möter AI och hur AI-genererat innehåll märks. Källor: AI Omnibus enters into force. Guidelines on transparency obligations for providers and deployers of certain AI systems.
Vad företag faktiskt gör med AI
SaaStr har tre heltidsanställda och fler än 20 AI-agenter. Säljaragenten Hexi sattes i drift på tre veckor med 1 250 äldre leads som startmaterial. Enligt Salesforce skapade arbetet en pipeline på 3,5 miljoner dollar och bidrog till 2,7 miljoner dollar i stängda affärer. Hexi får inte boka möten, gå under rabattgolvet eller lova talartider. Det är en användbar detalj: agenten gör volymarbetet, medan människan äger förhandling och löften.
Källa: Agentic outreach turns SaaStr's warm leads into $2.7 million in sales.
Cognizant har utbildat fler än 30 000 medarbetare i Claude och bygger in modellen i sina egna plattformar. I två kundprojekt uppger Anthropic att kontraktsgranskning blev upp till 40 procent snabbare och att ett försäkringsverktyg sparade ungefär åtta timmar per användare och vecka. Siffrorna är leverantörsrapporterade, men upplägget är intressant: träning, verksamhetskunskap och utvärdering följer samma införande.
Källa: Cognizant and Anthropic expand their partnership to bring Claude to enterprise clients.
Oracle planerar att göra Gemini-modeller tillgängliga i Oracle AI Agent Studio för Fusion Applications, med användning i bland annat ekonomi, HR, försörjningskedjor och kundservice. Nyheten är en färdplan, inte bevis på att allt är i drift. Riktningen är ändå relevant för mindre team: AI flyttar in i systemet där godkännanden och transaktioner redan finns.
Källa: Oracle to make Gemini models available to thousands of enterprise applications customers.
Verktygslagret: plattformar, agenter och arbetsflöden
En agentisk arbetsprocess är ett flöde där AI kan välja och utföra flera steg med verktyg, i stället för att bara skriva ett svar. MCP, Model Context Protocol, är ett öppet sätt att ge AI tillgång till verktyg och kontext genom en gemensam anslutningsmodell.
GitHub Copilot code review kan nu använda projektspecifika SKILL.md-instruktioner och läsa kontext från MCP-anslutna ärendehanterare, dokumentation och tjänstekataloger. MCP-anropen i granskningen är skrivskyddade, och kommentarerna visar när en skill eller MCP-källa har använts. Det ger ett konkret mönster för andra verksamheter: koppla först in källor med läsbehörighet, mät svaren och öppna skrivsteg först när granskningsregeln håller.
Källa: Copilot code review: Agent skills and MCP now generally available.
Make publicerade samtidigt flera anslutningsändringar som kan bryta befintliga flöden om de ignoreras. Stripe-anslutningar behöver ny behörighet, GoHighLevel flyttar från API-nycklar till OAuth 2.0 och Google Sheets har ändrade inmatningsval i fyra moduler. Ett AI-flöde är alltså aldrig bara en prompt. Anslutningar, behörigheter och testposter är en del av jobbet.
Källa: Action required for Stripe users, new Gemini module, and more app updates.
Shopify låter appar lägga händelsemarkörer i analysgrafer, med appens namn som källa. Markören visar vad som hände runt en förändring men bevisar inte att förändringen orsakade utfallet. Det är ändå bättre än att försöka minnas kampanjer och driftändringar i efterhand.
Källa: View app-added annotations on your analytics charts.
Styrning och risk: vad som behöver sättas innan skala
AI-styrning betyder de beslut, roller och kontroller som avgör hur AI får användas. Den här veckan blev två delar ovanligt konkreta.
Först: EU:s transparensregler gäller från den 2 augusti. Den som tillhandahåller ett system ska tydligt informera människor när de interagerar direkt med AI. AI-genererat eller manipulerat innehåll ska också kunna märkas maskinläsbart i de fall reglerna omfattar. För ett kundflöde räcker det långt att skriva ner var AI möter användaren, vem som granskar offentlig text och hur märkning sparas.
Sedan: evals, alltså återkommande utvärderingar av AI-resultat, behöver följa arbetet från test till drift. Googles nya tjänst kan köra samma mått på lokala försök och produktionsspår. En mindre verksamhet behöver inte börja med tjugo mått. Välj ett resultatmått, ett faktamått och ett stoppvillkor. Logga modellversion, källor, kostnad och mänskligt beslut för varje körning som får verklig effekt.
Integrera professionellt: lägg nycklar i miljövariabler eller en secret manager, ge varje anslutning avgränsad behörighet, maskera känsliga fält före modellsteget och använd ett godkännande före externa eller svåråterkalleliga åtgärder. Då kan AI göra verkligt arbete utan att lösenord eller ansvar hamnar i chatten.
Veckans praktiska Hammer-test
Välj ett återkommande flöde som slutar i ett mänskligt beslut, exempelvis ett kundsvar, en mötesuppföljning eller kontroll av en offert. Ge testet 40 minuter.
- Skriv vilket resultat mottagaren behöver och vad som måste vara sant för att resultatet ska godkännas.
- Dela flödet i fyra steg: samla underlag, analysera, skriva förslag och utföra eller skicka.
- Välj modell efter steg. Använd en billig och snabb modell för sortering eller formatkontroll. Spara den starkare modellen till osäker analys där bättre resonemang ändrar utfallet.
- Lägg ett mått på varje steg: saknade källor, korrekt format, handläggningstid, kostnad per ärende eller antal ändringar efter mänsklig granskning.
- Sätt ett godkännande precis före utskick, bokning, publicering eller systemändring. Kör tre verkliga men granskade exempel.
- Avsluta med ett kort körkvitto: modell per steg, källor, kostnad, fel, mänskligt beslut och nästa ändring.
Kopiera den här instruktionen till din AI-assistent:
Hjälp mig att rita ett AI-flöde för [arbetsuppgift]. Dela arbetet i samla underlag, analysera, skriva förslag och utföra. Föreslå vilken typ av modell varje steg behöver och motivera valet utifrån kvalitet, hastighet och kostnad. Lägg ett mätbart godkännandekrav på varje steg. Markera vilka anslutningar som ska ha läsbehörighet, vilka åtgärder som kräver mänskligt godkännande och vad som ska stå i körkvittot. Ställ frågor om underlag eller ansvar saknas. Skriv inget till externa system.
Företag och verktyg att hålla koll på
- OpenAI GPT-5.6: Lägre pris gör det värt att testa modellroutning på nytt, steg för steg.
- Google Gemini Enterprise Agent Platform: Samlar lokala testfall och produktionsmätning i samma utvärderingslager.
- Notion Custom Agents: Gör mötet till en startpunkt för ett granskat arbetsflöde.
- National University Health System: Visar hur flera avgränsade AI-verktyg kan bära ett känsligt flöde med tydligt mänskligt ansvar.
- EU AI Office: Gör transparens till en konkret produkt- och kommunikationsfråga från den 2 augusti.
Om ni vill göra ett sådant flöde återanvändbart i verksamheten hjälper Hammers Verktygssmide till med anslutningar, modellval, mätning och godkännanden. Börja med ett arbetsflöde där nyttan går att se redan efter tre granskade körningar.
Vanliga frågor
Vad är AI Enablement Radar?
AI Enablement Radar är Hammers veckovisa genomgång av verifierade AI-nyheter, konkreta företagsanvändningar och ett praktiskt test för mindre verksamheter, skolor och team.
Hur väljer man AI-modell för olika arbetssteg?
Utgå från felets kostnad, uppgiftens svårighet, svarstid och pris. Använd en snabb modell för sortering och formatkontroll, och en starkare modell där bättre analys påverkar beslutet. Mät resultatet per steg.
Vad innebär EU:s nya AI-transparenskrav från den 2 augusti 2026?
Artikel 50 kräver bland annat att människor informeras när de interagerar direkt med vissa AI-system. Reglerna innehåller också krav på maskinläsbar märkning och information för vissa typer av AI-genererat eller manipulerat innehåll.
Smedjans nyhetsbrev
Få nya artiklar i inkorgen
Välj de ämnen som intresserar dig. Inget brus, max ett mejl i veckan.
Vi följer GDPR. Avsluta när du vill.


