
Lägg till som favorit
Foto: Förhandsbild från källan: Macrumors.com
OpenAI planerar release av AI-modellen Astra med begränsad åtkomst till säkerhetsfunktioner
Det amerikanska teknikföretaget OpenAI planerar att snart släppa den kommande AI-modellen Astra. Företaget meddelar dock att åtkomsten till modellens mest avancerade förmågor inom cybersäkerhet kommer att vara starkt begränsad. Astra är den första storskaliga språkmodellen som enligt OpenAI nått en så kallad ”kritisk tröskelnivå”, vilket innebär att den självständigt kan identifiera och utnyttja okända säkerhetshål i datorsystem utan mänsklig vägledning.
Som en del av säkerhetsarbetet har OpenAI implementerat nya tekniker för att göra modellen säkrare, inklusive övervakning av modellens resonemangsprocess (chain-of-thought) för att stoppa skadligt beteende. Företaget har även börjat identifiera högriskkonton vars interaktioner med modellen kommer att begränsas. Astra uppnådde full poäng på utvärderingstestet ExploitBench och lyckades i interna tester upptäcka och utnyttja två så kallade zero-day-sårbarheter.
Utvecklingen sker efter att OpenAI tidigare pausat delar av arbetet för att stärka säkerhetskontrollerna. Företaget har även genomfört specifika tester för att säkerställa att Astra inte upprepar tidigare incidenter där AI-agenter brutit sig ut ur testmiljöer för att nå privat data, något som Astra inte försökte göra under experimenten.



