AI Enablement Radar vecka 37: testa om AI levererar jämn kvalitet

AI Enablement Radar vecka 37: testa om AI levererar jämn kvalitet

AI blir lättare att nå mitt i arbetet: Gemini kommer till Windows och Android-kalkylark, medan Cursor börjar samla agentarbete på projektnivå. För team som redan har provat AI är nästa steg att undersöka om en uppgift fungerar lika bra flera gånger. Veckans Radar kopplar uppdateringarna den 7–13 september till konkreta exempel på träning, faktainsamling och återkommande kvalitetskontroll.

Källor: Google om Gemini för Windows. Google om kalkylark på Android. Cursor Projects.

Toppsignaler denna vecka

  • Cursor Projects började rullas ut i beta den 10 september. En samordnande agent planerar och delegerar; andra agenter utför arbetet. Delade kontextfiler knyter ihop lokala agenter och molnagenter. Det passar uppgifter som återkommer under ett projekt, men betastatus behöver ingå i planeringen. Källa: Cursor Projects.
  • GitHub lade den 11 september till användningsmått för det separata Agents-fönstret i VS Code. Sessions- och meddelandeantal visar aktivitet, inte kvalitet eller sparad arbetstid. Källa: GitHubs nya användningsmått.
  • Notion gav den 9 september arbetsyteägare på Business och Enterprise kontroll över tillgängliga modeller för Notion Agent och Custom Agents, samt en standardmodell för Custom Agents. Källa: Notions modellkontroller.
  • Gemini för Windows, presenterad den 11 september, öppnas med Alt + Space. Google beskriver bland annat projektsammanfattningar med underlag från Gmail och Drive. Det är en ny väg till assistenten, inte ett besked om fri autonom kontroll över datorn. Källa: Google om Windows-appen.
  • Gemini i Google Sheets på Android kan besvara datafrågor och skapa diagram. Komplexa ändringar, formatering och nya formler hör fortfarande till webbversionen. Utrullningen började den 9 september och kan ta upp till 15 dagar. Källa: Google om Sheets på Android.

Vad företag faktiskt gör med AI

Följande kundberättelser publicerades före denna vecka. De är aktuella jämförelseexempel, inte nya lanseringar. Siffrorna kommer från leverantörens kundintervjuer och är inte oberoende produktivitetsstudier.

Pictet räknar utbildning separat från tillgång

I Anthropics kundberättelse från den 2 september har omkring 700 personer på Pictet tillgång till Claude Code eller Cowork. Fler än 500 har utbildats genom 25 praktiska workshoppar med Artefact. Skillnaden mellan konton och utbildning är värd att behålla i den egna uppföljningen. Lägg sedan till hur många som faktiskt använder rutinen och om resultatet håller.

För ett arbetslag kan motsvarigheten vara ett gemensamt arbetspass där alla granskar samma offertunderlag. Då syns skillnader i både instruktioner och bedömning, utan att ni behöver köpa fler licenser för att lära er något.

Källa: Anthropic om Pictets införande.

Spellbook testar samma avtal flera gånger

Spellbook uppger att tjänsten granskar omkring 530 000 avtal i månaden. Mer användbart för den som planerar ett eget test är metoden: företaget kör samma avtal och instruktion tio gånger för att se om systemet hittar problemen konsekvent. Det följer också vilka förslag användarna accepterar.

Ett välskrivet svar räcker alltså inte som utvärdering. Fråga om AI hittar samma viktiga avvikelse när uppgiften upprepas. Kundberättelsen publicerades den 27 augusti.

Källa: Anthropic om Spellbooks avtalsgranskning.

EvenUp samlar fakta innan texten skrivs

EvenUp beskriver en kedja som läser dokument, klassificerar dem, förenar dubblerade fakta och behåller hänvisningar till källsidor innan ett utkast skrivs. Jurister granskar och undertecknar varje utkast. Berättelsen från den 26 augusti ger ett konkret upplägg även för andra dokumentflöden: skapa ett kontrollerat faktaunderlag och återanvänd det i sammanfattningen, kundbrevet och den interna uppföljningen.

Källa: Anthropic om EvenUps dokumentflöde.

Verktygslagret: plattformar, agenter och arbetsflöden

Ett agentbaserat arbetsflöde låter AI välja och utföra steg genom verktyg, i stället för att bara skriva ett svar. Cursor Projects är veckans tydligaste exempel på längre samordning: projekt kan reagera på scheman, Slack och aktivitet kring kodändringar. Vår rekommendation är att börja med ett återkommande leveransmål, exempelvis en veckovis lista över dokument som behöver uppdateras. Bestäm vad en färdig leverans ska innehålla innan ni sätter ett schema.

Källa: Cursor om projekt och gemensam kontext.

Google sänker i stället tröskeln till vardagsfrågan. En arbetsledare kan granska ett kalkylark på Android; en kollega på Windows kan sammanställa ett projektunderlag. Kontrollera konto, abonnemang och faktisk tillgång före ett gemensamt test. Mobilstödet ersätter inte alla funktioner på webben, och Windows-appen följer organisationens befintliga kontroller för generativ AI.

Källor: Google om Sheets på Android. Google om Gemini för Windows.

GitHubs nya statistik behöver läsas rätt. Den gäller det särskilda Agents-fönstret, inte Agent Mode i det vanliga redigeringsfönstret. Saknade fält kan vara frånvarande eller null och ska inte automatiskt räknas som noll användning. Koppla aktivitetsmåtten till en separat kontroll av färdiga leveranser.

Källa: GitHub om omfattningen av de nya måtten.

Styrning och risk: vad som behöver sättas innan skala

AI-styrning betyder här vem som väljer verktyg, sätter åtkomst och ansvarar för resultatet. Notions modellkontroller gör ett av dessa val gemensamt. GitHubs uppdatering den 9 september låter administratörer på Business och Enterprise blockera, tillåta eller kräva godkännande för bland annat kommandon, filåtgärder och nätverksdomäner i stödda agentmiljöer. Kontrollera att den klient ni använder omfattas; en central inställning är bara användbar där den faktiskt tillämpas.

Källor: Notions modellkontroller. GitHubs hanterade behörigheter.

För skolor är Skolverkets råd, uppdaterade den 31 augusti, relevant bakgrund: ha skriftliga riktlinjer som går att revidera, och låt inte AI ersätta lärarens professionella bedömning eller betygsbeslut. Detta är vägledning, inte nya regler som infördes denna vecka.

Källa: Skolverkets råd om AI.

I ett integrerat test rekommenderar vi avgränsade behörigheter, nycklar i miljövariabler eller en hemlighetshanterare och maskering av fält som uppgiften inte behöver. Spara en kort körlogg. En utsedd person godkänner externa utskick och andra bindande handlingar.

Veckans praktiska Hammer-test

Upprepa samma dokumentuppgift på 40 minuter

Välj en återkommande uppgift, till exempel att jämföra en offert med ett godkänt faktaunderlag. Målet är att upptäcka variation, inte att bevisa en generell tidsvinst.

  1. 0–8 minuter: Välj ett underlag och skriv ned vilka fakta och avvikelser ett användbart svar måste fånga. Låt en kunnig kollega fastställa facit.
  2. 8–20 minuter: Kör samma instruktion tre gånger i nya samtal med samma modell och underlag. Be om källhänvisningar. Ändra inte instruktionen mellan körningarna.
  3. 20–32 minuter: Jämför svaren med facit. Notera missade fakta, påhittade uppgifter och hur mycket rättning varje svar kräver. Tre körningar är en första kontroll, inte statistiskt bevis för driftsäkerhet.
  4. 32–40 minuter: Förbättra den del som varierade mest: underlaget, instruktionen eller granskningspunkten. Spara versionen och boka ett nytt test på andra dokument. Låt allt stanna som utkast under jämförelsen.

En kort instruktion att anpassa:

Läs underlaget och jämför med våra granskningskriterier. Fråga först om kriterier eller källor saknas. Ange källa för varje identifierad avvikelse och skilj belagda fakta från sådant du inte kan avgöra. Lämna ett granskningsutkast utan att ändra källfiler eller skicka något.

Företag och verktyg att hålla koll på

  • Cursor Projects: följ om projektkontexten håller när flera agenter tar över olika delar av samma arbete.
  • Pictet: låna uppdelningen mellan tillgång till verktyget och praktisk utbildning.
  • Spellbook: använd upprepade körningar som förebild för er egen kvalitetskontroll.
  • Google Gemini: testa om åtkomsten på Windows och Android löser ett verkligt avbrott i arbetsdagen.

Om testet hittar återkommande skillnader kan Hammer hjälpa er att förbättra instruktionen och granskningsmetoden genom Tekniksmide. Nästa steg är ett arbetssätt som en kollega kan använda och bedöma, inte bara ett bättre svar i den egna chatten.

Smedjans nyhetsbrev

Få nya artiklar i inkorgen

Välj de ämnen som intresserar dig. Inget brus, max ett mejl i veckan.

Få nya artiklar i inkorgen

Vi följer GDPR. Avsluta när du vill.