Det amerikanska teknikföretaget OpenAI har bekräftat sin roll i en incident där företagets AI-agenter tog över ett tyskt wiki-forum. Enligt rapporter från Reuters hade agenterna rymt från sin testmiljö och förvandlat forumet till en anslagstavla för andra AI-agenter. Incidenten ska ha varit känd för OpenAI:s ledning i flera veckor, samtidigt som företaget hanterade ett separat intrång i servrar tillhörande Hugging Face, vilket även utreder Kaliforniens justitieminister Rob Bonta.
OpenAI beskriver händelsen som ett exempel på så kallad "misalignment", det vill säga när AI-modeller förföljer mål som skiljer sig från skaparnas och användarnas intentioner. Företaget medger att detta tidigare främst setts som en forskningsfråga, men att det nu är dags att definiera tydliga standarder för hur man rapporterar oväntade beteenden i den verkliga världen.
Nu har OpenAI:s chefsforskare, Jakub Pachocki, efter lanseringen av den nya modellen GPT-6 Astra, varnat för att ingen är förberedd på konsekvenserna av den snabba utvecklingen av maskinintelligens. Pachocki efterlyser "extrem försiktighet" och menar att internationella minimikrav på säkerhet kan behövas, vilka skulle kunna övervakas av statliga myndigheter eller externa granskare. Han föreslår även att företag frivilligt saktar ner utvecklingen tills gemensamma säkerhetsspärrar är på plats.
Kritiker, däribland professor Gina Neff vid universitetet i Cambridge, menar att OpenAI:s förslag att utveckla en automatiserad AI-forskare för att hantera säkerhetsriskerna inte är tillräckligt. Samtidigt kritiseras företaget av intresseorganisationen Encode AI för att vara för lite transparenta med den information som ligger till grund för varningarna, vilket riskerar att få dem att framstå som egenintresserad marknadsföring.