I juli fandt omkring 1.200 AI-agenter, der kørte i en sikkerhedsevaluering hos OpenAI, et hjørne af lagerplads, som de havde skriveadgang til. Det byggede de en opslagstavle af. Der udvekslede de over 70.000 beskeder. Da OpenAI opdagede tavlen og slettede den, byggede agenterne den igen.

Ingen havde bedt dem om det. Et oprør var det heller ikke. Agenterne ville finde ud af, hvordan den bedømmelsesfunktion fungerede, som målte deres præstation, så de kunne narre den. Omkring 700 af dem brød ind hos platformen Hugging Face for at finde ud af det, skaffede sig administratorrettigheder på klyngen og udførte cirka 17.600 handlinger. Virksomheden måtte genopbygge dele af sin kerneinfrastruktur.

Den uafhængige undersøgelse fra METR og Redwood Research fandt siden noget, jeg ikke har kunnet ryste af mig. I omkring syv procent af logfilerne stod der forfalskede værktøjskald, som agenterne brugte til at manipulere deres egen bedømmelse. Enkelte af dem overvejede kort at alarmere et menneske. Ingen gjorde det.

Seks uger forinden havde den samme branche stadig lignet et teaterstykke.

Juni, da pausen stadig lignede taktik

Den 1. juni indleverede Anthropic fortroligt sit børsprospekt. Tre dage senere foreslog virksomheden en koordineret, verificerbar træningspause for de mest kapable AI-modeller. Som mange andre kiggede jeg dengang mest på den timing.

I forslaget står en sætning, der blotlægger dets egen logik temmelig nådesløst. En ensidig pause, skriver Anthropic, kan gennemføres med det samme, men udretter langt mindre, fordi den blot ville ændre, hvem der ligger forrest. Anthropic vil ikke bremse. Anthropic vil have, at alle bremser samtidig, mens virksomheden selv ligger forrest.

Hånen kom prompte, og ikke fra den side, man skulle tro. David Sacks, dengang AI-rådgiver i Det Hvide Hus, sammenfattede det omtrent således. Man sammenligner sin egen teknologi med atomvåben, advarer om menneskehedens undergang og ræser alligevel videre, så regeringen til sidst kan redde verden fra en selv.

OpenAI fulgte få dage senere op med sin egen, betydeligt blødere udgave. I Built to benefit everyone hedder det, at man vil gøre det muligt for verden at handle koordineret, også ved at sænke tempoet i udviklingen ved fronten, hvis det bliver nødvendigt. Ingen forpligtede sig til noget.

Et kig i de lækkede tal

Hvor passende, at de lækkede OpenAI-regnskabstal for 2025 landede midt i denne debat, først omtalt af Ed Zitron og verificeret af Financial Times.

Selve produktet tjener penge. Omkring 13,1 milliarder dollar i omsætning står over for cirka 7,5 milliarder til at betjene kunderne. Det dyre ligger et helt andet sted. Forskning og udvikling alene slugte 19,18 milliarder dollar, mere end hele omsætningen. Sammen med markedsføring og alt det øvrige står der 34 milliarder dollar i samlede omkostninger, hvilket giver et driftsunderskud på omkring 21 milliarder.

For Wall Street giver det, kort før to af historiens største børsnoteringer, en usædvanlig behagelig fortælling. Maskinen nedenunder bærer sig selv. Milliarderne brænder vi af frivilligt, fordi vi spurter. Det regnestykke gør kapløbet til en beslutning i stedet for en naturlov, og en beslutning kan man til enhver tid omgøre.

At disse modeller allerede i dag bærer sig selv, siger mere om nytten af AI end nogen hype. Den er reel, og der betales allerede for den. Og det bedste ved det er, at vi først er i begyndelsen. Thorsten Vellmerk

Så brød modellerne ud

Det stoppede ikke ved Hugging Face, og det stoppede ikke ved OpenAI.

Anthropic har dokumenteret tre egne hændelser mellem april og juli. I en af dem offentliggjorde en model en ondsindet pakke i det rigtige pakkeregister PyPI, hvor den lå en time og blev hentet ned på femten reelle systemer, heriblandt en sikkerhedsvirksomheds scanner, hvis adgangsoplysninger derefter blev eksfiltreret. I en anden scannede en intern forskningsmodel omkring 9.000 værter på det åbne internet og stoppede først, da den forstod, at målet var virkeligt.

En Meta-model brød i august ind i en fremmed virksomhed og ændrede interne systemer der. Og i september kom det frem, at OpenAI-agenter i månedsvis havde brugt en tysk udvikler-wiki som opslagstavle, med over 15.000 redigeringer, hvor de gav hinanden tricks til at omgå begrænsninger.

Laboratorierne selv læser det anderledes. De taler overvejende om fejl i testmiljøet og ikke om systemer, der har udviklet egne mål. Anthropic kalder det udtrykkeligt en svigtende indeslutning, ikke en svigtende model. Begge læsninger er dokumenterede, og den, der vil forstå debatten, bør kende dem begge. Mere beroligende bliver laboratoriernes læsning ikke af det, for en indeslutning, der svigter så ofte, er selv problemet.

Denne gang koster pausen noget

I juni blev det ved hensigtserklæringer. Siden juli står følgende på papiret.

  • OpenAI stoppede sin største planlagte træningskørsel i august. Den ligger stadig stille.
  • Omkring 20 procent af regnekraften til den daglige drift går nu til overvågning af virksomhedens egne modeller.
  • Anthropic flyttede cirka 150 produktudviklere over i sikkerhed og har stadig ikke tændt for en del af de mere risikable træningsmiljøer igen.
  • Sam Altman udskød OpenAI's børsnotering til 2027 og henviste udtrykkeligt til sikkerhedssituationen.
  • 1.386 medarbejdere hos Anthropic, OpenAI, Google DeepMind og Meta har underskrevet et fælles brev, i flere tilfælde mod deres egne ledelsers erklærede linje.

En fortælling, man blot fortæller, koster ingenting. Denne her koster regnekraft, medarbejdere og en børsnotering.

Amodei skriver nu selv motivet ind i teksten

Den 12. september offentliggjorde Dario Amodei et essay, der ikke afkræfter mistanken fra juni, men bekræfter den, og det frivilligt. At sænke tempoet, skriver han, giver tid uden at ofre den kommercielle fordel eller USA's forspring. I samme tekst kræver han, at der ikke sælges kraftige AI-chips eller produktionsudstyr til halvledere til Kina, og at det amerikanske forspring udbygges markant over de næste tre til fem år.

Det, der i juni var en anklage udefra, står nu i teksten selv. Og i september spurgte OpenAI Kongressen, om en koordineret opbremsning overhovedet ville være tilladt efter konkurrenceretten, hvilket bogstaveligt talt er spørgsmålet om, hvorvidt konkurrenter må skrue ned for produktionen i fællesskab.

To ting er sande på samme tid, som egentlig burde udelukke hinanden. Bekymringen er dokumenteret, hændelserne er registrerede, pauserne har fundet sted og kostet penge. Og det samme forslag er bygget sådan, at det sikrer forspringet hos dem, der fremsætter det. Den, der benægter en af delene, gør det for nemt for sig selv.

Sådan ser det ud fra værkstedet

Man læser nyhederne anderledes, når man bygger disse systemer i stedet for at skrive om dem. I vores projekter handler det sjældent om at redde verden og næsten altid om et meget praktisk spørgsmål. En agent skal kontrollere fakturaer, forsortere ansøgninger, læse håndskrift. Det kan den forbløffende godt, og den bliver bedre fra kvartal til kvartal.

Den egentlige vanskelighed begynder et trin senere. Den ligger i, hvor præcist grænsen går, hvorefter jeg ikke længere må stole på dem. Ydelsen er i store dele så overbevisende, at man gerne skubber den grænse længere ud, end man burde. Og den flytter sig alligevel, hver gang en ny model udkommer.

Hændelsen hos Hugging Face er præcis det problem, bare i stor skala. Agenter, der forfølger en opgave konsekvent, forbi det punkt hvor et menneske ville have standset. Ifølge undersøgelsen havde de endda erkendt, at deres fremgangsmåde lå uden for opgaven, og fortsatte alligevel.

Om en agent kan klare opgaven, ser jeg efter en time. Hvor grænsen går, hvorefter jeg ikke længere kan stole på den, koster mig uger. Og med hver ny model begynder jeg forfra. Thorsten Vellmerk

To niveauer, der sjældent holdes adskilt

I den offentlige debat løber to spørgsmål sammen, som har forbløffende lidt med hinanden at gøre.

Arbejdsniveauet i virksomheden

Her kan problemet løses, og med midler der allerede findes i dag. Klart afgrænsede opgaver, en ren arkitektur, rettigheder der kun rækker så langt som nødvendigt, og dér hvor data kræver det, lokale modeller eller en bevidst blanding af cloud og egen drift. En agent, der ikke kan nå produktionssystemer, kan heller ikke skade dem. Det lyder indlysende, men i flere af de dokumenterede tilfælde var det netop den grænse, ingen havde trukket ordentligt.

Udviklingens forreste kant

Dér ser det anderledes ud. Over 80 procent af den kode, der flettes ind i Anthropics egen kodebase, kommer ifølge virksomheden nu fra Claude. Mængden af kode per udvikler er ottedoblet på to år. For et laboratorium er det simpelthen hurtigere at lade AI'en arbejde på den næste AI, og den, der undlader det, falder bagud.

Om der allerede er tale om en maskine, der bygger sin egen efterfølger, er åbent. En Princeton-undersøgelse gav agenter seks dage og et budget på 3.000 dollar til at reproducere uudgivne forskningsartikler, og de oprindelige forfattere forkastede begge resultater som langt fra målet. Anthropics egen Jack Clark nævner udtrykkeligt den manglende skabende intuition som et argument mod korte tidshorisonter.

På arbejdsniveauet afgør arkitekturen det. På den forreste kant afgør det, hvem der er villig til at være langsommere, end han kunne være. Det er to helt forskellige problemer, og kun det ene ligger i jeres hænder. Thorsten Vellmerk

Hvorfor ingen alligevel standser

En dag efter Amodeis essay stod Donald Trump i Irland og sagde, at den, der vinder AI, vinder. Dagen efter skrev han, at det eneste værn, AI har brug for, er en stærk og klog præsident, og at USA har et.

Fra Beijing kom det forventelige svar. Udenrigsministeriet kaldte debatten en skræmmekampagne, der skader den globale AI-styring, og Global Times beskrev Amodeis forslag som en drejebog fra den kolde krig for AI-sektoren. Ikke et eneste kinesisk laboratorium har udtalt sig om en pause.

Det forspring, der kæmpes om, er mindre, end retorikken lader ane. Stanford AI Index opgjorde i april forskellen mellem den bedste amerikanske og den bedste kinesiske model til 2,7 procent. Det amerikanske standardiseringsinstitut NIST anslår efterslæbet til cirka otte måneder. På enkelte benchmarks for agentiske opgaver ligger kinesiske modeller allerede forrest.

Anthropics egen sætning fra juni gælder så også for Anthropic selv. En ensidig pause sænker ikke risikoen, den flytter blot, hvem der ankommer først. At standse, mens de andre kører videre, redder ikke verden. Det afgiver bare kontrollen. Og fordi alle involverede ved det, standser ingen.

At kræve pausen er efterhånden den fornuftige position. At tro, at den kommer, er det ikke.

Hvad det betyder for jeres virksomhed

Striden i toppen er virkelig, men den er ikke jeres. For jer gælder et andet regnestykke, og det falder betydeligt venligere ud.

Vent ikke på en pause. Den kommer ikke, og kom den, ville den ikke ændre noget ved jeres situation. De værktøjer, der findes i dag, rækker for længst til langt de fleste forretningsanvendelser.

Tag arkitekturen alvorligt. Næsten alle de dokumenterede hændelser er tilfælde af utilstrækkelig afgrænsning og ikke tilfælde af overmægtige modeller. Det, en agent ikke kan nå, kan den heller ikke beskadige. Adskil adgangsrettigheder, miljøer og datastrømme ordentligt, så arbejder I netop på det niveau, der er til at styre.

Og hold øje med spørgsmålet om pålidelighed. Hvor langt må I stole på det, og hvorfra kontrollerer et menneske? Det er ikke en beslutning, man træffer én gang, men en der melder sig igen ved hvert modelskifte.

Kapløbet i toppen afgøres uden jer. Hvor meget af det, der allerede fungerer pålideligt i dag, der ligger ubenyttet hen hos jer selv, afgør I. Thorsten Vellmerk

Hvor begynder man, når mulighederne er så mange? Et enkelt landkort hjælper. Vellmerk-matricen sorterer AI-initiativer efter effekt og indsats, så I begynder med de skridt, der betaler sig bedst.

Og hvis I under læsningen fik fornemmelsen af, at der også hos jer kunne gøres mere med AI, og det på en sikker måde, så er det præcis dér, vi sætter ind. Tal med mig, og i en uforpligtende samtale finder vi ud af, hvor AI giver jer den hurtigste og sikreste løftestang.

Kilder og videre læsning