AI-masterclasspodden vecka 29: när AI-agenter börjar slutföra jobbet

Vecka 29 handlade mindre om ännu en chattruta och mer om vad som händer när AI:n får göra klart arbetet. Claude kan använda en godkänd inloggning i webbläsaren utan att lösenordet hamnar i modellens kontext. Gemini Notebook kan köra kod mot sitt källmaterial. Grok kan starta schemalagda arbetsflöden. Manus kan skapa redigerbara presentationer och publicera en fungerande webbversion.
Det låter som flera separata produktnyheter. Tillsammans pekar de på samma skifte: AI-leverantörerna bygger inte bara modeller, utan hela körmiljöer för delegerat arbete. Därför handlar veckans podd lika mycket om behörigheter, återställning och mänskliga stoppknappar som om nya funktioner.
AI-agentens körmiljö blir en del av produkten
En AI-agent är ett system som inte bara svarar på frågor utan också använder verktyg, kör flera steg och kan ändra något utanför chatten. När en sådan agent arbetar i minuter eller dagar räcker det inte att bedöma modellens svar. Man måste också förstå var koden körs, hur tillstånd sparas och vilka uppgifter agenten får använda.
Perplexity gjorde den frågan tydlig med SPACE, körmiljön bakom Perplexity Computer. Systemet kombinerar beständiga sessioner med tillfälliga Firecracker-mikrovirtuella maskiner, ögonblicksbilder, styrd nätverksåtkomst och externa inloggningsuppgifter. Det kan göra långvariga uppgifter lättare att pausa och återuppta. Samtidigt samlas mer tillit hos leverantörens hantering av nätverk, lagring och autentisering. Ett pilotprojekt bör därför börja med en reversibel leverans, inte med produktionsdata eller fria skrivbehörigheter.
Google rör sig åt samma håll. Gemini Notebook fick en säker molndator som kan skriva och köra kod mot källgrundade data. Det kan vara användbart för analys av ett avgränsat kalkylblad eller en dokumentmängd, men den första testen bör använda okänsliga data och ett resultat som går att återskapa. Under veckan registrerades också en lång störning i AI Studio Build. Det är en påminnelse om att en imponerande körmiljö fortfarande behöver en reservväg.
Inloggning utan att lämna ut lösenordet
1Password för Claude visar hur agentbehörighet kan bli mer praktisk. På Mac kan en användare godkänna en viss inloggning eller engångskod för en Claude Cowork-uppgift i webbläsaren. 1Password fyller i uppgifterna lokalt medan agenten väntar; hemligheten ska inte gå in i modellens kontext, minne eller Anthropics system.
Det minskar en viktig risk, men tar inte bort ansvaret. När agenten väl är inloggad kan den agera i den godkända sessionen. Använd därför en separat webbläsarprofil, begränsa åtkomsten till uppgiften och behåll ett mänskligt godkännande för betalningar, publicering och andra oåterkalleliga steg.
Claude fick också stöd för instruktioner mitt i en pågående API-konversation på vissa modeller. Det gör att en betrodd operatör kan ändra prioritet eller policy utan att kasta bort hela den cachade historiken. Den möjligheten bör reserveras för kontrollerade instruktioner. Text som hämtats från webben eller ett kunddokument ska inte automatiskt få samma auktoritet.
Automatisering behöver en broms, inte bara en kalender
xAI lanserade Grok 4.5 för kodning, agentiska uppgifter och kunskapsarbete. Modellen fick ett kontextfönster på 500 000 token och spreds till Grok Build samt flera externa verktyg. Samtidigt fick Grok schemalagda Automations, och vissa abonnemang kan utlösa dem via e-post.
Det sista låter bekvämt men bör behandlas som en säkerhetsfråga. E-post är indata från omvärlden. Innan en e-posttriggad agent får skriva till ett affärssystem behöver teamet testa promptinjektion, dubbla leveranser, kostnadstak och vad som händer när ett steg misslyckas. Börja med läsbehörighet eller en reversibel destination.
OpenAI:s signaler under veckan gick i samma riktning. GPT-Red använder automatiserad motståndartestning för att träna modeller mot promptinjektioner, och Codex 0.144.5 utökade upptäckten av farliga kommandon. Det är bra försvarslager, men inte ett argument för obegränsad körning. Sandlåda, uppgiftsspecifika inloggningar, säkerhetskopior och granskningsgrindar behövs fortfarande.
Från utkast till leveransbara filer
Manus fokuserade på den sista delen av arbetsflödet. Native PowerPoint skapar redigerbara PPTX-filer med riktiga diagram, tabeller och bildlayouter. En ny färdighet kan formge professionella PDF-dokument, och Auto-Publish kan publicera varje lyckad WebDev-version till en liveadress.
Detta är konkret nytta för verksamheter som lägger mycket tid på att flytta ett AI-utkast till en fil som en kollega eller kund faktiskt kan redigera. Men en lyckad byggning är inte samma sak som ett godkänt innehåll. Auto-Publish är avstängt som standard, vilket är rimligt. Behåll en kvalitetskontroll för fakta, tonalitet, tillgänglighet och personuppgifter innan något blir offentligt.
Mistral Vibe 2.20.0 gav en mer teknisk version av samma tema: stabilare beteende för Windows och skal, bättre hantering av MCP-inloggning, strömning, återspolning och frågor till användaren. Mistrals TypeScript-stöd för att maskera känslig telemetri hade slagits samman i källkoden men var ännu inte publicerat i npm-paketet. Det är en viktig skillnad mellan annonserad riktning och funktion som faktiskt går att installera.
Veckans praktiska test: definiera konsekvensen först
Välj en återkommande uppgift som slutar i en konkret leverans, till exempel en presentation, en veckorapport eller en uppdaterad webbsida. Skriv sedan ner fyra gränser innan ni väljer verktyg:
- Körmiljö: var körs kod och hur länge sparas sessionen?
- Behörighet: vilka data får agenten läsa, och var får den skriva?
- Godkännande: vilket steg måste en människa bekräfta?
- Återställning: hur går ni tillbaka efter ett dåligt resultat eller en driftstörning?
Kör uppgiften tre gånger med testdata. Mät inte bara tidsbesparingen utan också granskningsarbete, fel och hur lätt det var att stoppa eller återställa processen. Om det fungerar kan samma underlag bli början på en avgränsad Verktygssmide-insats.
Vecka 29 visar att agentmarknaden håller på att mogna på ett lite oväntat sätt. Modellerna blir förstås bättre, men konkurrensen flyttar mot vem som kan hantera identitet, kod, tillstånd och färdiga leveranser utan att göra kontrollen osynlig. För köparen blir den viktigaste frågan tvådelad: Vad kan agenten göra, och vilken konsekvens får den skapa utan att fråga?
Avsnittet är en AI-genererad masterclass byggd på Hammer Automations djupa veckovisa research om AI-leverantörernas uppdateringar och funktioner, bearbetad med NotebookLM. Ingen Whisper-transkription användes i det automatiska flödet.
Vanliga frågor
Vad handlar AI-masterclasspodden för vecka 29 om?
Avsnittet går igenom Claude, OpenAI, Gemini, Grok, Mistral, Perplexity och Manus med fokus på hur AI-agenter kör kod, använder behörigheter och levererar färdiga resultat – samt vilka säkerhetsgränser som behövs.
Vad är en körmiljö för AI-agenter?
Det är infrastrukturen där agenten kör kod, sparar arbetsläge, använder nätverk och hanterar filer eller inloggningar. För långvariga uppgifter påverkar körmiljön säkerhet och återställning minst lika mycket som själva modellen.
Hur testar man en AI-agent utan att ge den för mycket åtkomst?
Börja med testdata, läsbehörighet eller en reversibel destination. Kräv mänskligt godkännande före publicering, betalning eller andra externa åtgärder och kontrollera att processen går att stoppa och återställa.
Är artikeln baserad på en transkription av podden?
Nej. Artikeln bygger på käll-PDF:erna och NotebookLM-syntes från Hammer Automations veckovisa AI-leverantörsresearch. Ingen Whisper-transkription användes i det automatiska flödet.
Smedjans nyhetsbrev
Få nya artiklar i inkorgen
Välj de ämnen som intresserar dig. Inget brus, max ett mejl i veckan.
Vi följer GDPR. Avsluta när du vill.