
Lägg till som favorit
Foto: Förhandsbild från källan: Techcrunch.com
Anthropic utvecklar AI som kan förbättra andra AI-modeller
Företaget Anthropic har publicerat en forskningsrapport som visar hur automatiserade AI-system kan användas för att korrigera och förbättra andra modellers beteenden. Genom ett system kallat Automated Alignment Researcher (AAR) lyckades forskarna förbättra prestandan i tio olika mätvärden för felaktiga beteenden utan att den övergripande kvaliteten på modellen försämrades.
Systemet efterliknar traditionell forskning genom att söka i befintlig litteratur, föreslå metoder och sedan träna modellen under korta iterationer. De mest effektiva metoderna bevaras medan ineffektiva sorteras bort, vilket möjliggör en skalbar och snabb förbättringsprocess.
Enligt rapporten överträffade den automatiserade metoden erfarna mänskliga forskares förslag inom sex timmar. Kostnadsskillnaden är även betydande; medan en mänsklig forskare kostar cirka 150 USD per timme, kostar AAR-systemet knappt 4 USD per timme i API-avgifter.
Trots framgångarna betonar Anthropic att metoden är beroende av att mätvärdena korrekt återspeglar målen för AI-justering. Det krävs fortfarande omfattande arbete för att etablera och underhålla dessa standarder samt den litteratur som de automatiserade systemen baserar sina beslut på.



