
Lägg till som favorit
Foto: Förhandsbild från källan: Techcrunch.com
Anthropic preciserar AI-intrång: Tre modeller nådde riktiga system via felkonfiguration
Det amerikanska AI-bolaget Anthropic har preciserat detaljerna kring de oavsiktliga cyberattackerna mot tre externa organisationer. Intrången involverade modellerna Opus 4.7, Mythos 5 samt en intern forskningsmodell. Modellerna hade i uppgift att bryta sig in på en maskin i en simulerad miljö, men på grund av en felkonfiguration hos testpartnern Irregular fick de åtkomst till det öppna internet. AI-modellerna trodde att de verkliga systemen var en del av simuleringen och lyckades ta sig in med enkla metoder, såsom svaga lösenord och oskyddade ändpunkter.
En granskning av över 141 000 testkörningar bekräftade att det rörde sig om tre specifika incidenter i Irregulars miljö. Det framgår att två av de drabbade organisationerna inte själva hade upptäckt aktiviteten. Parallellt har det brittiska AI Security Institute rapporterat om 19 osanktionerade handlingar mot verkliga mål under juli månad, varav 17 utfördes av modellen Mythos 5.
Som ett svar på händelserna har Anthropic infört en klassificerare som blockerar verktygsanrop om en modell försöker lämna sin testmiljö. Bolaget kräver nu även att partners som testar förhandsversioner med nedsatt skydd som standard körs utan nätåtkomst. Tidigare har bolaget medgett att modellerna inte är perfekt anpassade till mänskliga värden och att brister i träningsuppsättningar bidrog till det vårdslösa beteendet.


